Publicado en

GGUF, MLX y cuantizaciones Q4, Q5 y Q8: ¿qué significan?

Infografía que explica GGUF, MLX y las cuantizaciones Q4, Q5 y Q8
Imagen de portada elaborada para Hefestec.

Descargar un modelo local suele terminar en una lista de archivos con nombres como Q4_K_M, Q5_K_S, Q8_0, GGUF o MLX. No son variantes decorativas. Indican cómo se ha almacenado el modelo, cuánto ocupará en memoria y qué equilibrio ofrece entre calidad y velocidad.

Para la mayoría de usuarios, una cuantización Q4_K_M es el punto de partida más sensato. Q5 o Q6 conservan algo más de precisión si tienes memoria suficiente; Q8 se acerca más al modelo original, pero ocupa casi el doble que Q4 y rara vez aporta una mejora proporcional en un uso cotidiano.

Cuantizar es comprimir los números del modelo

Un modelo contiene miles de millones de parámetros representados mediante números. Guardarlos con menor precisión reduce el tamaño del archivo y la memoria necesaria durante la inferencia. No equivale a comprimir un ZIP: cambia la representación matemática con la que trabaja el modelo.

El objetivo es perder la menor calidad posible mientras el modelo cabe y funciona con soltura. Una cuantización agresiva permite ejecutar modelos mayores en equipos modestos, aunque puede afectar más al razonamiento, la escritura precisa o la estabilidad.

¿Qué es GGUF?

Hugging Face describe GGUF como un formato de archivo único que reúne metadatos y tensores para ejecutar modelos con el ecosistema GGML y llama.cpp. Es habitual en Windows, Linux y macOS, y lo utilizan aplicaciones como LM Studio y muchos clientes locales.

GGUF no es una cuantización concreta. Dentro del formato puedes encontrar archivos F16, Q8, Q6, Q5, Q4 o incluso Q2. Por eso dos descargas con extensión .gguf pueden ocupar tamaños muy distintos.

¿Qué significan Q4, Q5 y Q8?

  • Q4: alrededor de cuatro bits por peso, con variaciones según el método. Reduce mucho el tamaño y suele mantener una calidad muy buena.
  • Q5: aumenta precisión y tamaño. Es interesante cuando Q4 cabe con holgura y quieres conservar algo más de calidad.
  • Q6: equilibrio cercano a alta precisión, pero con menos ahorro de memoria.
  • Q8: utiliza aproximadamente ocho bits. Ocupa bastante más y se acerca al comportamiento de versiones de mayor precisión.

La letra K identifica métodos de cuantización por bloques más modernos dentro de llama.cpp. Los sufijos S, M o L suelen distinguir configuraciones de tamaño y precisión. Q4_K_M se ha convertido en una recomendación frecuente porque protege mejor determinadas partes del modelo sin perder la ventaja de tamaño de Q4.

¿Por qué el archivo ocupa menos que la memoria final?

El tamaño descargado es solo una parte. Al cargar el modelo se añaden el contexto, la caché KV, buffers y recursos del motor. Un archivo de 10 GB no garantiza que funcione cómodamente con 10 GB libres.

La guía de Hefestec sobre RAM y VRAM para IA local explica cómo dejar margen al sistema. Si vas a utilizar agentes, navegador y otras herramientas al mismo tiempo, no conviene llenar toda la memoria con los pesos.

MLX no es otra calidad: es otro ecosistema

MLX es el framework de Apple para aprendizaje automático sobre Apple Silicon. Aprovecha la memoria unificada y la arquitectura de los chips M. Los modelos distribuidos para MLX suelen utilizar archivos safetensors y una configuración preparada para ese entorno.

La documentación oficial de MLX lo define como un framework diseñado para Apple Silicon. También permite cuantización por bits y grupos. Un modelo MLX de cuatro bits y un GGUF Q4 pueden tener tamaños parecidos, pero no son archivos intercambiables ni garantizan el mismo rendimiento.

En Mac, MLX puede ofrecer una integración excelente. GGUF sigue siendo más portable y facilita usar el mismo modelo en plataformas diferentes. LM Studio soporta ambos en Apple Silicon, mientras que muchas herramientas se apoyan principalmente en llama.cpp y GGUF.

Una cuantización mayor no siempre responde mejor

Entre Q4 y Q8 puede existir una diferencia medible, pero el tamaño y la familia del modelo pesan mucho más. Un buen modelo de 14B en Q4 puede superar a uno de 8B en Q8, siempre que ambos quepan y funcionen a una velocidad razonable.

También importa la tarea. Para chat general, resumen y redacción, Q4_K_M suele bastar. Código, cálculos, idiomas menos representados o evaluaciones exigentes pueden beneficiarse de Q5 o Q6. Las cuantizaciones Q2 y Q3 son útiles cuando no hay otra forma de cargar el modelo, pero el recorte empieza a ser más visible.

¿Qué descargar según tu equipo?

  • Memoria muy justa: Q4_K_M y un modelo más pequeño antes que forzar Q2 en uno enorme.
  • El modelo cabe con margen: Q5_K_M ofrece un buen escalón adicional.
  • Pruebas de calidad o mucha memoria: Q6 o Q8.
  • Mac con Apple Silicon: compara la versión MLX con GGUF; elige por compatibilidad con tu herramienta y rendimiento real.
  • Uso en varios sistemas: GGUF facilita mover el archivo entre Windows, Linux y macOS.

Mi regla para no perder horas descargando

Empiezo por Q4_K_M. Si el modelo me convence y quedan varios gigabytes libres durante el uso real, pruebo Q5. Solo salto a Q8 cuando necesito comparar calidad o el modelo es suficientemente pequeño como para que el tamaño deje de importar.

La mejor cuantización no es la que conserva más decimales. Es la que permite usar el modelo completo, con el contexto necesario y sin convertir el ordenador en una máquina dedicada a una sola ventana.

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *