# Cómo ejecutar un modelo de IA en tu propio PC paso a paso

> Instala y usa modelos de lenguaje en tu computador sin enviar datos a internet con LM Studio u Ollama: requisitos de RAM y VRAM, modelos y configuración.

- URL: https://viralsixteen.com/inteligencia-artificial/ejecutar-ia-en-tu-pc/
- Categoría: Inteligencia Artificial
- Publicado: 2026-09-18 · Actualizado: 2026-09-18
- Autor: Equipo editorial de ViralSixteen (ViralSixteen)

## Resumen rápido

- Ejecutar IA en local te da privacidad, funcionamiento sin internet y cero costos por uso.
- La VRAM de la tarjeta gráfica (o la memoria unificada en un Mac) determina qué tamaño de modelo puedes usar con fluidez.
- LM Studio ofrece una interfaz gráfica sencilla; Ollama es ideal si te manejas con la terminal o quieres integrarlo con otras apps.
- Empieza con un modelo pequeño (3–8 mil millones de parámetros) cuantizado a 4 bits.

## Antes de empezar

- Tiempo estimado: 30 min
- Necesitas: PC con Windows, macOS o Linux
- Necesitas: 16 GB de RAM (recomendado)
- Necesitas: Tarjeta gráfica con 8 GB de VRAM o más, o un Mac con chip Apple (opcional pero recomendado)
- Necesitas: Conexión a internet para la descarga inicial

Los asistentes de IA en la nube son potentes, pero cada consulta viaja a los servidores de una empresa. Ejecutar un **modelo de lenguaje en tu propio PC** te da privacidad total, funcionamiento sin conexión y ningún costo por uso. Y hoy es mucho más fácil de lo que parece.

## Qué necesitas saber antes de empezar

El factor clave es la **memoria**. El modelo tiene que caber en la VRAM de tu tarjeta gráfica (o en la memoria unificada de un Mac con chip Apple) para funcionar con fluidez. Si no cabe, se ejecuta en parte con el procesador y la RAM del sistema, y va mucho más lento.

El tamaño de un modelo se mide en **parámetros** (miles de millones, «B» en inglés). Gracias a la **cuantización**, que comprime el modelo reduciendo la precisión de sus números, un modelo a 4 bits necesita aproximadamente 0,6–0,7 GB de memoria por cada mil millones de parámetros, más un margen para la conversación.

| Tamaño del modelo | Memoria aproximada (4 bits) | Hardware orientativo |
| --- | --- | --- |
| 1–4 mil millones | 1–3 GB | Portátil sin gráfica dedicada, 16 GB de RAM |
| 7–9 mil millones | 5–7 GB | Tarjeta gráfica con 8 GB de VRAM |
| 12–14 mil millones | 8–10 GB | Tarjeta gráfica con 12 GB de VRAM |
| 24–32 mil millones | 15–20 GB | Tarjeta gráfica con 16–24 GB de VRAM o Mac con 32 GB |

Si estás pensando en comprar una gráfica para esto, prioriza la VRAM: lo explicamos en [cómo elegir una tarjeta gráfica](/tarjetas-graficas/como-elegir-tarjeta-grafica/).

## Instalación y primer uso

### Paso 1: Comprueba tu hardware

En Windows, abre el **Administrador de tareas** (<kbd>Ctrl</kbd> + <kbd>Mayús</kbd> + <kbd>Esc</kbd>) → **Rendimiento**. En **Memoria** verás tu RAM y en **GPU** la «Memoria de GPU dedicada», que es tu VRAM. En un Mac, ve a **menú Apple → Acerca de este Mac** para ver el chip y la memoria. Anota ambos datos y comprueba que tienes al menos 20 GB libres en disco.

### Paso 2: Elige la herramienta

- **LM Studio:** aplicación con interfaz gráfica para Windows, macOS y Linux. Incluye un buscador de modelos que indica cuáles caben en tu equipo. Es la opción más sencilla para empezar.
- **Ollama:** herramienta ligera que se usa desde la terminal con comandos simples. Ideal si quieres conectar el modelo con otras aplicaciones o automatizar tareas.

Ambas son gratuitas. Si no te manejas con la terminal, elige LM Studio.

### Paso 3: Instala la herramienta desde su web oficial

Descarga el instalador **solo desde la web oficial** (lmstudio.ai u ollama.com) y ejecútalo como cualquier otro programa. Evita descargas desde sitios de terceros: son una vía habitual de malware.

### Paso 4: Descarga un modelo del tamaño adecuado

**En LM Studio:** abre la pestaña de búsqueda de modelos, escribe el nombre de una familia de modelos de pesos abiertos (por ejemplo, Llama, Gemma, Qwen o Mistral) y elige una versión que la aplicación marque como compatible con tu memoria. Para empezar, elige una variante de 4 bits (suele aparecer como *Q4*).

**En Ollama:** abre la terminal y descarga y ejecuta un modelo con un solo comando. Por ejemplo:

```bash
ollama run llama3.2
```

Puedes sustituir `llama3.2` por cualquier modelo del catálogo de ollama.com. La primera vez descargará varios gigabytes.

> [!TIP]
> Empieza con un modelo pequeño. Si responde rápido y la calidad se te queda corta, prueba el siguiente tamaño. Es mejor un modelo mediano rápido que uno grande que tarda un minuto por respuesta.

### Paso 5: Haz tu primera consulta

En LM Studio, carga el modelo en la parte superior y escribe en el chat. En Ollama, escribe directamente en la terminal después del comando anterior (sal con `/bye`). Prueba con algo concreto:

```text
Resume en 5 puntos las ventajas de ejecutar un modelo de IA en local.
```

Todo lo que escribas se procesa en tu computador: puedes desconectar internet y seguirá funcionando.

### Paso 6: Ajusta el rendimiento

- **Descarga en la GPU (GPU offload):** en LM Studio, asegúrate de que todas las capas del modelo se cargan en la gráfica si caben. Es lo que más influye en la velocidad.
- **Longitud de contexto:** determina cuánto texto «recuerda» el modelo en una conversación. Más contexto consume más memoria; redúcelo si el modelo va lento.
- **Cierra aplicaciones pesadas** (juegos, editores de video, pestañas del navegador) que ocupen VRAM.

Una velocidad de 15–20 tokens por segundo o más se siente fluida para leer; por debajo de 5 se hace lenta.

### Paso 7: Conéctalo a otras aplicaciones (opcional)

Ambas herramientas pueden funcionar como un **servidor local** compatible con muchas aplicaciones:

- **Ollama** expone automáticamente una API en `http://localhost:11434`.
- **LM Studio** incluye un servidor local (por defecto en el puerto 1234) compatible con el formato de la API de OpenAI.

Así puedes usar tu modelo local en editores de código, extensiones del navegador, herramientas de notas o tus propios scripts, sin que los datos salgan de tu equipo.

## Qué esperar de un modelo local

Los modelos que caben en un PC doméstico son excelentes para **resumir, redactar, reescribir, traducir, clasificar textos y ayudar con código sencillo**. Tienen menos conocimientos y capacidad de razonamiento que los grandes modelos en la nube, y también pueden inventar datos, así que aplica las mismas precauciones que explicamos en [qué es la IA generativa](/inteligencia-artificial/que-es-la-ia-generativa/).

> [!IMPORTANT]
> Revisa la licencia de cada modelo antes de usarlo con fines comerciales. Las licencias de pesos abiertos varían y algunas imponen condiciones de uso.

## Preguntas frecuentes

### ¿Puedo ejecutar IA local sin tarjeta gráfica?

Sí, con el procesador y la RAM del sistema, pero será bastante más lento. Los modelos pequeños (1–4 mil millones de parámetros) pueden ser utilizables en un portátil moderno sin gráfica dedicada.

### ¿Los modelos locales son tan buenos como los de la nube?

Los modelos que caben en un PC doméstico son más pequeños que los grandes modelos comerciales en la nube, así que suelen tener menos conocimientos y razonamiento. Aun así, son muy útiles para resumir, redactar, clasificar, traducir o programar tareas sencillas, con total privacidad.

### ¿Es legal descargar estos modelos?

Sí. Los modelos de pesos abiertos se publican con licencias que permiten su descarga y uso, aunque cada licencia tiene condiciones propias, sobre todo para uso comercial. Revísala antes de usar un modelo en un producto o empresa.

### ¿Cuánto espacio en disco necesito?

Cada modelo ocupa aproximadamente lo mismo que la memoria que necesita: de 2 a 5 GB los pequeños y 10 GB o más los medianos. Reserva al menos 20 GB libres para probar varios.
