Cómo ejecutar un modelo de IA en tu propio PC paso a paso
Instala y usa modelos de lenguaje en tu computador sin enviar datos a internet con LM Studio u Ollama: requisitos de RAM y VRAM, modelos y configuración.
Resumen rápido
- Ejecutar IA en local te da privacidad, funcionamiento sin internet y cero costos por uso.
- La VRAM de la tarjeta gráfica (o la memoria unificada en un Mac) determina qué tamaño de modelo puedes usar con fluidez.
- LM Studio ofrece una interfaz gráfica sencilla; Ollama es ideal si te manejas con la terminal o quieres integrarlo con otras apps.
- Empieza con un modelo pequeño (3–8 mil millones de parámetros) cuantizado a 4 bits.
Antes de empezar
Tiempo estimado
30 min
Necesitas
- PC con Windows, macOS o Linux
- 16 GB de RAM (recomendado)
- Tarjeta gráfica con 8 GB de VRAM o más, o un Mac con chip Apple (opcional pero recomendado)
- Conexión a internet para la descarga inicial
7 pasos · cada paso tiene enlace propio.
Contenido del artículo
Los asistentes de IA en la nube son potentes, pero cada consulta viaja a los servidores de una empresa. Ejecutar un modelo de lenguaje en tu propio PC te da privacidad total, funcionamiento sin conexión y ningún costo por uso. Y hoy es mucho más fácil de lo que parece.
Qué necesitas saber antes de empezar#
El factor clave es la memoria. El modelo tiene que caber en la VRAM de tu tarjeta gráfica (o en la memoria unificada de un Mac con chip Apple) para funcionar con fluidez. Si no cabe, se ejecuta en parte con el procesador y la RAM del sistema, y va mucho más lento.
El tamaño de un modelo se mide en parámetros (miles de millones, «B» en inglés). Gracias a la cuantización, que comprime el modelo reduciendo la precisión de sus números, un modelo a 4 bits necesita aproximadamente 0,6–0,7 GB de memoria por cada mil millones de parámetros, más un margen para la conversación.
| Tamaño del modelo | Memoria aproximada (4 bits) | Hardware orientativo |
|---|---|---|
| 1–4 mil millones | 1–3 GB | Portátil sin gráfica dedicada, 16 GB de RAM |
| 7–9 mil millones | 5–7 GB | Tarjeta gráfica con 8 GB de VRAM |
| 12–14 mil millones | 8–10 GB | Tarjeta gráfica con 12 GB de VRAM |
| 24–32 mil millones | 15–20 GB | Tarjeta gráfica con 16–24 GB de VRAM o Mac con 32 GB |
Si estás pensando en comprar una gráfica para esto, prioriza la VRAM: lo explicamos en cómo elegir una tarjeta gráfica.
Instalación y primer uso#
Paso 1: Comprueba tu hardware#
En Windows, abre el Administrador de tareas (Ctrl + Mayús + Esc) → Rendimiento. En Memoria verás tu RAM y en GPU la «Memoria de GPU dedicada», que es tu VRAM. En un Mac, ve a menú Apple → Acerca de este Mac para ver el chip y la memoria. Anota ambos datos y comprueba que tienes al menos 20 GB libres en disco.
Paso 2: Elige la herramienta#
- LM Studio: aplicación con interfaz gráfica para Windows, macOS y Linux. Incluye un buscador de modelos que indica cuáles caben en tu equipo. Es la opción más sencilla para empezar.
- Ollama: herramienta ligera que se usa desde la terminal con comandos simples. Ideal si quieres conectar el modelo con otras aplicaciones o automatizar tareas.
Ambas son gratuitas. Si no te manejas con la terminal, elige LM Studio.
Paso 3: Instala la herramienta desde su web oficial#
Descarga el instalador solo desde la web oficial (lmstudio.ai u ollama.com) y ejecútalo como cualquier otro programa. Evita descargas desde sitios de terceros: son una vía habitual de malware.
Paso 4: Descarga un modelo del tamaño adecuado#
En LM Studio: abre la pestaña de búsqueda de modelos, escribe el nombre de una familia de modelos de pesos abiertos (por ejemplo, Llama, Gemma, Qwen o Mistral) y elige una versión que la aplicación marque como compatible con tu memoria. Para empezar, elige una variante de 4 bits (suele aparecer como Q4).
En Ollama: abre la terminal y descarga y ejecuta un modelo con un solo comando. Por ejemplo:
ollama run llama3.2
Puedes sustituir llama3.2 por cualquier modelo del catálogo de ollama.com. La primera vez descargará varios gigabytes.
Consejo
Empieza con un modelo pequeño. Si responde rápido y la calidad se te queda corta, prueba el siguiente tamaño. Es mejor un modelo mediano rápido que uno grande que tarda un minuto por respuesta.
Paso 5: Haz tu primera consulta#
En LM Studio, carga el modelo en la parte superior y escribe en el chat. En Ollama, escribe directamente en la terminal después del comando anterior (sal con /bye). Prueba con algo concreto:
Resume en 5 puntos las ventajas de ejecutar un modelo de IA en local.
Todo lo que escribas se procesa en tu computador: puedes desconectar internet y seguirá funcionando.
Paso 6: Ajusta el rendimiento#
- Descarga en la GPU (GPU offload): en LM Studio, asegúrate de que todas las capas del modelo se cargan en la gráfica si caben. Es lo que más influye en la velocidad.
- Longitud de contexto: determina cuánto texto «recuerda» el modelo en una conversación. Más contexto consume más memoria; redúcelo si el modelo va lento.
- Cierra aplicaciones pesadas (juegos, editores de video, pestañas del navegador) que ocupen VRAM.
Una velocidad de 15–20 tokens por segundo o más se siente fluida para leer; por debajo de 5 se hace lenta.
Paso 7: Conéctalo a otras aplicaciones (opcional)#
Ambas herramientas pueden funcionar como un servidor local compatible con muchas aplicaciones:
- Ollama expone automáticamente una API en
http://localhost:11434. - LM Studio incluye un servidor local (por defecto en el puerto 1234) compatible con el formato de la API de OpenAI.
Así puedes usar tu modelo local en editores de código, extensiones del navegador, herramientas de notas o tus propios scripts, sin que los datos salgan de tu equipo.
Qué esperar de un modelo local#
Los modelos que caben en un PC doméstico son excelentes para resumir, redactar, reescribir, traducir, clasificar textos y ayudar con código sencillo. Tienen menos conocimientos y capacidad de razonamiento que los grandes modelos en la nube, y también pueden inventar datos, así que aplica las mismas precauciones que explicamos en qué es la IA generativa.
Importante
Revisa la licencia de cada modelo antes de usarlo con fines comerciales. Las licencias de pesos abiertos varían y algunas imponen condiciones de uso.
Preguntas frecuentes
¿Puedo ejecutar IA local sin tarjeta gráfica?
Sí, con el procesador y la RAM del sistema, pero será bastante más lento. Los modelos pequeños (1–4 mil millones de parámetros) pueden ser utilizables en un portátil moderno sin gráfica dedicada.
¿Los modelos locales son tan buenos como los de la nube?
Los modelos que caben en un PC doméstico son más pequeños que los grandes modelos comerciales en la nube, así que suelen tener menos conocimientos y razonamiento. Aun así, son muy útiles para resumir, redactar, clasificar, traducir o programar tareas sencillas, con total privacidad.
¿Es legal descargar estos modelos?
Sí. Los modelos de pesos abiertos se publican con licencias que permiten su descarga y uso, aunque cada licencia tiene condiciones propias, sobre todo para uso comercial. Revísala antes de usar un modelo en un producto o empresa.
¿Cuánto espacio en disco necesito?
Cada modelo ocupa aproximadamente lo mismo que la memoria que necesita: de 2 a 5 GB los pequeños y 10 GB o más los medianos. Reserva al menos 20 GB libres para probar varios.