Skip to content
AI Model Radar

Glosario

Destilación

La destilación entrena a un modelo pequeño para imitar las respuestas de uno más grande: por eso existen muchos de los mejores modelos pequeños, y por eso heredan los hábitos del grande, buenos y malos.

En lugar de aprender solo de texto en bruto, el modelo pequeño («estudiante») se entrena con lo que produce un modelo grande («maestro»): sus respuestas, sus cadenas de razonamiento, a veces todo el abanico de palabras que consideró. El estudiante nunca se convierte en el maestro, pero aprende a sonar como él mucho más barato que entrenando desde cero.

Para el uso local es, discretamente, la técnica más importante de los últimos años. Un modelo destilado de 8B puede defenderse en tareas que antes exigían un modelo cinco veces mayor, que es exactamente lo que cabe en una tarjeta de gama media. Cuando el nombre de un modelo lleva «distill», esa es la afirmación que se hace.

Las advertencias honestas: un estudiante hereda los puntos ciegos de su maestro junto con sus fortalezas, y «destilado» describe la receta, no garantiza la calidad. La historia del hardware no cambia: un modelo destilado de 8B es un archivo de 8B, y el buscador mide el archivo.

Dónde lo ves en el radar

Los modelos destilados llegan como archivos pequeños y medidos con un alcance sorprendente; el buscador los trata como cualquier otro GGUF, así que un buen modelo destilado simplemente aparece como un buen ajuste en hardware modesto.

Ver qué cabe en una tarjeta de gama media

Términos relacionados

Fine-tuning (ajuste fino)Parámetros (7B, 70B)Cuantización

También en:EnglishPortuguês

← Todos los términos