Publicado en

Cuánta RAM y VRAM necesitas para ejecutar un modelo de lenguaje en local

RAM y VRAM necesarias para ejecutar un modelo de lenguaje o LLM en local

Para empezar con un modelo de lenguaje local, 16 GB de RAM es el mínimo cómodo; 32 GB amplían mucho las opciones y una GPU con 12 o 16 GB de VRAM cambia la experiencia. La cifra necesaria depende del tamaño y la cuantización del LLM, del contexto que quieras mantener y de si la memoria está separada o unificada.

No existe una equivalencia exacta entre “parámetros” y memoria porque cada formato comprime los pesos de forma distinta y el programa necesita espacio adicional para el contexto. Estas orientaciones se aplican a modelos de lenguaje; la generación de imágenes y vídeo tiene requisitos diferentes.

La tabla que conviene mirar primero

Memoria disponible Objetivo razonable Experiencia esperable
8 GB de RAM Modelos de 1B a 4B muy cuantizados Pruebas básicas y contexto corto
16 GB de RAM Modelos de 7B u 8B en 4 bits Chat, resumen y escritura con margen limitado
32 GB de RAM Modelos de 14B a 24B cuantizados Mejor calidad y contexto más amplio
64 GB de RAM Modelos de 30B a 70B, según cuantización Más capacidad, pero la velocidad depende del hardware
8 GB de VRAM Modelos de 7B u 8B cuantizados Aceleración completa con contexto moderado
12-16 GB de VRAM Modelos de 14B y algunos mayores Buen equilibrio para uso personal
24 GB de VRAM Modelos de 30B aproximadamente Mayor calidad sin descargar tanto trabajo en la CPU

Son rangos prudentes, no garantías. Un modelo de 8B en Q4 suele ocupar alrededor de 5 o 6 GB solo en pesos; uno de 14B puede rondar 9 o 10 GB y uno de 32B superar los 20 GB. Después hay que reservar memoria para el contexto, la aplicación, el sistema y otras tareas.

RAM y VRAM no son intercambiables en todos los equipos

En un PC con gráfica dedicada, la VRAM almacena los pesos y datos que procesa la GPU; la RAM del sistema atiende a Windows, Linux y el resto de aplicaciones. Si el modelo no cabe en la VRAM, algunos motores reparten capas entre GPU y CPU, pero la velocidad puede caer de forma notable.

Los Mac con Apple Silicon emplean memoria unificada: CPU y GPU comparten el mismo fondo. Eso permite dedicar una parte grande de 24, 32 o 64 GB al modelo sin copiarlo entre memorias separadas, aunque macOS y las aplicaciones también necesitan su porción. La guía de requisitos de LM Studio recomienda 16 GB de RAM como punto de partida.

La cuantización decide cuánto ocupa el modelo

Cuantizar reduce la precisión numérica de los pesos para que el modelo ocupe menos memoria y pueda ejecutarse en hardware doméstico. Una variante de 4 bits suele ser el mejor punto de entrada: baja mucho el tamaño con una pérdida de calidad asumible para chat, resumen o clasificación.

Las etiquetas cambian según el formato, pero nombres como Q4, Q5 y Q8 indican niveles de compresión. Cuanto mayor sea la precisión, mayor será el archivo y la memoria necesaria. La documentación de LM Studio aconseja elegir 4 bits o más cuando el equipo pueda soportarlo.

El contexto también consume memoria

El contexto es la cantidad de texto que el modelo puede tener presente: conversación, instrucciones, documentos y respuesta. Ampliarlo no es gratis. Ollama advierte en su guía de longitud de contexto que una ventana mayor exige más memoria, especialmente para tareas de agentes y programación.

Por eso un modelo que arranca con 4.000 tokens puede quedarse sin memoria al subir a 32.000 o 64.000. Si aparecen errores o una caída brusca de velocidad, reduce primero el contexto antes de buscar otro controlador o reinstalar el programa.

¿Qué configuración elegir según lo que quieres hacer?

  • Chat y redacción ocasional: 16 GB de RAM y un modelo de 7B u 8B en Q4 son un punto de partida sensato.
  • Analizar documentos largos: prioriza 32 GB o más, porque el contexto añade una carga importante.
  • Programación y agentes: reserva memoria para contextos amplios y herramientas; una GPU de 12 a 24 GB mejora mucho la respuesta.
  • Generación de imágenes o vídeo: las necesidades son distintas y suelen depender más de la VRAM; no extrapoles sin revisar cada modelo.
  • Varios usuarios o servicios simultáneos: suma el consumo de cada modelo y del número de peticiones concurrentes.

La velocidad no depende solo de que el modelo quepa

Cargar un modelo es el primer requisito, pero la experiencia depende del ancho de banda de la memoria, la potencia de la GPU y el reparto entre CPU y acelerador. Dos equipos con 32 GB pueden ofrecer velocidades muy diferentes. Ollama permite consultar con su comando ps si el modelo está en GPU, CPU o repartido, una pista útil para diagnosticar lentitud.

Una NPU tampoco sustituye automáticamente a una GPU. Muchos programas de modelos generativos locales todavía se apoyan en CPU, CUDA, ROCm, Metal u otras rutas gráficas. Nuestro artículo sobre qué significa que un PC tenga IA separa el marketing de las funciones que realmente usan la NPU.

Compra memoria pensando en tu modelo, no al revés

Si ya tienes ordenador, descarga primero una variante pequeña y mide el consumo real. Si vas a comprar uno, define el tamaño del LLM y el contexto que necesitas antes de pagar por una GPU. Para la mayoría de usuarios, 32 GB de RAM o memoria unificada ofrecen más margen y vida útil que 16 GB.

También puedes consultar nuestra explicación general sobre el ordenador adecuado para IA local y la guía para elegir el modelo según la tarea. La mejor cifra no es la mayor posible, sino la que evita que el modelo recurra al disco o deje sin recursos al sistema. Si vas a empezar desde cero, aquí explicamos cómo instalar una IA local en Windows y Mac.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *