Cuantización
La cuantización guarda los pesos de un modelo con menos precisión (por ejemplo 4 bits en lugar de 16), reduciendo la memoria a cerca de una cuarta parte con un pequeño costo en calidad.
Un modelo son miles de millones de números. Guardados con la precisión del entrenamiento, cada número ocupa dos bytes; la cuantización los redondea a una escala más gruesa para que cada uno ocupe solo una fracción. Piensa en redondear todos los precios de un supermercado a pesos enteros: los totales quedan casi iguales y el cuaderno que necesitas es mucho más pequeño.
Esta es la tecnología que hace posible la IA local. Un modelo de 30 mil millones de parámetros necesita del orden de 60 GB en precisión completa, fuera del alcance de cualquier tarjeta gráfica de consumo. Las cuantizaciones de 4 bits más comunes lo bajan a cerca de un tercio, dentro del rango que tienen las máquinas reales.
Los nombres crípticos (Q4_K_M, Q8_0, IQ4_XS) son recetas: cuántos bits y qué método de empaquetado. Números más altos conservan más precisión y más gigabytes. Para el uso diario en chat, las recetas populares de 4 bits aguantan bien; las versiones muy agresivas de 2 y 3 bits ahorran más memoria pero empiezan a notarse las asperezas.
Dónde lo ves en el radar
Nuestras tablas miden el archivo Q4_K_M cuando existe (la cuantización que asumen casi todas las guías de IA local) y cada tabla nombra la receta exacta que midió.
Comprobar un modelo cuantizado con tu hardware →Términos relacionados