La forma más sencilla de ejecutar una IA en tu ordenador es instalar LM Studio, descargar un modelo cuantizado y abrir un chat. No necesitas programar ni enviar tus documentos a un servidor externo, aunque sí conviene comprobar la memoria disponible y entender que un modelo local suele ser menos potente que los servicios en la nube.
Esta guía propone dos caminos. LM Studio es el más visual para empezar; Ollama resulta cómodo si quieres usar la terminal o conectar otras aplicaciones. Ambos ejecutan modelos en el equipo, pero la descarga inicial puede ocupar varios gigabytes.
Antes de instalar nada: comprueba si tu equipo encaja
LM Studio recomienda 16 GB de RAM y, en Windows, al menos 4 GB de memoria gráfica dedicada; en Mac exige Apple Silicon y macOS 14 o posterior. Ollama funciona en Windows 10 22H2 o posterior y en macOS 14 o posterior, incluidos Mac Intel con ejecución por CPU, según sus páginas de requisitos y compatibilidad.
Un equipo con 8 GB puede mover modelos muy pequeños, pero tendrá poco margen. Con 16 GB se abre una zona mucho más útil; con 32 GB o una GPU de 12 a 16 GB puedes probar modelos mayores. Nuestra guía sobre qué ordenador necesitas para usar IA en local explica cómo influyen CPU, GPU, Apple Silicon y arquitectura.
Ruta fácil: instalar LM Studio
- Descarga la aplicación desde LM Studio e instala la versión de tu sistema.
- Abre el catálogo y busca un modelo “Instruct”, preparado para responder instrucciones y mantener conversaciones.
- Elige una cuantización de 4 bits o superior si tu memoria lo permite. La propia documentación de LM Studio recomienda empezar por ahí porque equilibra tamaño y calidad.
- Descarga el archivo, cárgalo en memoria y abre la pestaña de chat.
- Escribe una pregunta de prueba y observa el uso de memoria y la velocidad antes de cargar documentos o aumentar el contexto.
Los modelos suelen publicarse en varias cuantizaciones. Un archivo más comprimido ocupa menos y es más fácil de ejecutar, pero puede perder precisión. La guía oficial para descargar modelos muestra el tamaño antes de bajar cada variante, una comprobación importante si el SSD está justo.
Ruta flexible: instalar Ollama
Ollama está pensado como motor local al que puedes llamar desde la terminal o desde otras aplicaciones. Tras instalarlo desde su página oficial, puedes descargar y ejecutar un modelo con una orden como esta:
ollama run gemma3:4b
La primera ejecución descarga el modelo y las siguientes reutilizan el archivo local. En Windows, Ollama ocupa alrededor de 4 GB antes de contar los modelos, que pueden consumir decenas de gigabytes; su documentación para Windows explica además dónde se almacenan y cómo cambiar esa ubicación.
¿Qué modelo elegir para la primera prueba?
Empieza con un modelo de 3.000 a 8.000 millones de parámetros en cuantización de 4 bits. Es suficiente para comprobar si el equipo mantiene una conversación, resume texto o genera borradores con una velocidad aceptable. Un modelo mayor no es automáticamente mejor para tu uso si obliga al sistema a intercambiar memoria con el disco y responde con extrema lentitud.
Busca una variante “Instruct” y revisa los idiomas declarados por el creador. Para español conviene probar varias preguntas reales, porque las tablas de rendimiento no siempre reflejan la naturalidad, el vocabulario técnico o la calidad de una traducción.
Configura privacidad y acceso con criterio
Ejecutar el modelo localmente evita enviar cada prompt a un proveedor remoto, pero no vuelve privada cualquier aplicación conectada. Si añades extensiones, búsquedas web, servicios externos o herramientas MCP, parte de la información puede salir del equipo. Revisa cada integración antes de introducir datos sensibles.
También debes proteger la API local. Ollama escucha por defecto en la dirección local del ordenador; cambiarla para aceptar conexiones de la red abre una superficie adicional. Mantén el servicio limitado al propio equipo salvo que sepas configurar autenticación, cortafuegos y acceso de red.
Los fallos más comunes tienen arreglo
- El modelo no carga: el archivo y el contexto superan la memoria disponible. Prueba una cuantización o un modelo menor.
- Responde muy despacio: quizá parte del modelo está usando la CPU o el sistema está recurriendo al SSD. Cierra aplicaciones y reduce el contexto.
- La aplicación se cierra: actualiza el controlador gráfico y comprueba los requisitos de instrucciones del procesador.
- Las respuestas son pobres: usa una variante Instruct, formula mejor la tarea y prueba otro modelo antes de asumir que falta potencia.
Tu primera instalación debería ser pequeña
No empieces descargando varios modelos de 30 o 70 mil millones de parámetros. Instala una sola aplicación, prueba un modelo pequeño con tareas que conozcas y mide tres cosas: calidad, velocidad y memoria ocupada. Con esos datos podrás decidir si necesitas un modelo mayor o si la nube sigue siendo más práctica.
Cuando quieras afinar la elección, consulta nuestras guías sobre cuánta RAM y VRAM necesita un LLM local y sobre la diferencia entre un PC con IA, una NPU y los TOPS. La etiqueta comercial no sustituye a la memoria que realmente exige el modelo. Para escoger la descarga, consulta también qué modelo de IA local elegir según la tarea.