Cuantizacion de Modelos IA: Q4, Q5 y Q8 Explicados

Patron abstracto de barras horizontales en tonos cian sobre fondo oscuro

La cuantización reduce la precisión numérica de un modelo para que ocupe menos memoria y corra más rápido, a cambio de una pérdida mínima de calidad. Para uso general, Q4_K_M es la mejor elección: reduce el tamaño unas cuatro veces y la diferencia frente al modelo original es casi imperceptible.

Si has intentado descargar un modelo y te has topado con nombres como Q4_K_M, Q5_K_S o Q8_0 sin saber cuál elegir, este artículo es para ti. Forma parte de la guía completa de IA local.

Qué es la cuantización

Un modelo de lenguaje son millones de números llamados pesos. Al entrenarlo, cada peso se guarda con mucha precisión: normalmente 16 bits por número. Esa precisión es necesaria durante el entrenamiento, pero resulta excesiva para simplemente usar el modelo.

La cuantización aprovecha eso: guarda cada peso con menos bits. Pasar de 16 a 4 bits divide el tamaño entre cuatro. Un modelo de 8 mil millones de parámetros baja de unos 16 GB a menos de 5 GB.

Una analogía útil: es como guardar una foto en JPEG en lugar de RAW. Pierdes información técnica, pero a simple vista la imagen sigue siendo la misma y ocupa una fracción del espacio. Con un JPEG muy comprimido empiezan a verse artefactos; con la cuantización ocurre lo mismo si bajas demasiado.

Además del ahorro de espacio hay un efecto secundario valioso: menos bits significa menos datos que mover entre memoria y procesador, y como la generación de texto está limitada por el ancho de banda de memoria, el modelo cuantizado también va más rápido.

Comparativa de niveles

Tomando como referencia un modelo de 8 mil millones de parámetros, esto es lo que cambia en cada nivel:

NivelTamaño aprox.CalidadCuándo usarlo
Q2_K3,2 GBDegradada y notableSolo si no cabe otra cosa
Q3_K_M4,0 GBAceptableEquipos con 8 GB muy justos
Q4_K_M4,9 GBMuy buenaRecomendado para casi todo
Q5_K_M5,7 GBExcelenteSi te sobra memoria
Q6_K6,6 GBCasi indistinguibleTareas exigentes
Q8_08,5 GBPrácticamente idénticaCuando la precisión es crítica
F1616 GBOriginalInvestigación o fine-tuning
Tamaños orientativos para un modelo de 8B. Escalan de forma proporcional en otros tamaños: un 3B ocupa aproximadamente la mitad, un 70B unas nueve veces más.

Fíjate en el detalle importante: entre Q4 y Q8 duplicas el tamaño para ganar muy poco. Esa es la razón de que Q4_K_M se haya convertido en el estándar de facto.

Cuál elegir según tu caso

La regla general

Antes de mirar niveles de cuantización, ten presente este principio: un modelo grande muy cuantizado suele rendir mejor que un modelo pequeño poco cuantizado, siempre que quepa en memoria.

Con 8 GB libres, un modelo de 13B en Q4 dará mejores respuestas que uno de 7B en Q8. Prioriza el tamaño del modelo y ajusta la cuantización para que entre.

Por tipo de tarea

  • Chat, resumir, reescribir: Q4_K_M sobra. No notarás diferencia con niveles superiores.
  • Programación: Q5_K_M si puedes. El código es menos tolerante a pequeños errores que la prosa.
  • Matemáticas y razonamiento: Q6_K o Q8_0. Aquí la degradación sí se nota.
  • Traducción: Q4_K_M funciona bien en idiomas mayoritarios.

Para decidir qué combinación de tamaño y cuantización entra en tu equipo, consulta la tabla de memoria de la guía de IA local.

Cómo descifrar los nombres

Los nombres parecen crípticos pero siguen una lógica sencilla. Tomemos Q4_K_M:

  • Q4 son los bits por peso. Más alto significa más calidad y más tamaño.
  • K indica el método moderno por bloques, que reparte la precisión de forma inteligente en lugar de aplicarla de manera uniforme.
  • M es la variante: S de pequeña, M de media, L de grande. Ajusta qué capas reciben más precisión.

Por eso Q4_K_M se lee como: 4 bits, método por bloques, variante media. Y por eso es el equilibrio recomendado.

Verás también nombres antiguos sin la K, como Q4_0. Son métodos más primitivos: si existe la versión con K, elige esa. Todo esto viene del formato GGUF que usa llama.cpp, el motor que hay debajo de Ollama y LM Studio.

Preguntas frecuentes

¿Se nota de verdad la diferencia entre Q4 y Q8?

En conversación normal, casi nunca. Aparece en tareas que exigen precisión encadenada: cálculos de varios pasos, código complejo o instrucciones muy detalladas. Para el 90 por ciento del uso cotidiano, Q4_K_M es indistinguible.

¿Puedo cuantizar un modelo yo mismo?

Sí, con las herramientas de llama.cpp, aunque rara vez hace falta: la comunidad publica versiones cuantizadas de casi todos los modelos populares en Hugging Face a los pocos días de cada lanzamiento.

¿Por qué hay quien evita Q2 y Q3?

Porque la degradación deja de ser sutil. Los modelos empiezan a contradecirse, a inventar con más frecuencia y a ignorar instrucciones. Son un recurso de emergencia cuando la memoria no da para más.

¿La cuantización afecta a la ventana de contexto?

No directamente, pero sí en la práctica: el contexto también consume memoria. Un modelo más ligero deja más espacio libre para trabajar con textos largos.

En resumen

Si solo te quedas con una idea: descarga la versión Q4_K_M del modelo más grande que quepa en tu memoria y no le des más vueltas.

Sube a Q5 o Q6 solo si te sobra espacio y trabajas con código o matemáticas. Y recuerda que un modelo grande en Q4 casi siempre supera a uno pequeño en Q8.

// sin comentarios, mejor hablamos

¿Alguna duda con esto?

Si algo no te ha funcionado o quieres contarme tu caso, escríbeme directamente. Respondo a todos los mensajes.