Skip to content
AI Model Radar

Glossário

Destilação

A destilação treina um modelo pequeno para imitar as respostas de um maior: por isso existem muitos dos melhores modelos pequenos, e por isso herdam os hábitos do grande, bons e maus.

Em vez de aprender apenas com texto bruto, o modelo pequeno («aluno») é treinado com o que um modelo grande («professor») produz: suas respostas, seus rastros de raciocínio, às vezes todo o leque de palavras que ele considerou. O aluno nunca se torna o professor, mas aprende a soar como ele por muito menos do que treinar do zero.

Para uso local, é discretamente a técnica mais importante dos últimos anos. Um modelo destilado de 8B consegue se sair bem em tarefas que antes exigiam um modelo cinco vezes maior, que é exatamente o que cabe em uma placa de gama média. Quando o nome de um modelo traz «distill», é essa a afirmação que está sendo feita.

As ressalvas honestas: um aluno herda os pontos cegos do professor junto com as forças, e «destilado» descreve a receita, não garante a qualidade. A história do hardware não muda: um modelo destilado de 8B é um arquivo de 8B, e o localizador mede o arquivo.

Onde você vê isso no radar

Modelos destilados chegam como arquivos pequenos e medidos com um alcance surpreendente; o localizador os trata como qualquer outro GGUF, então um bom modelo destilado simplesmente aparece como um bom encaixe em hardware modesto.

Ver o que cabe em uma placa de gama média

Termos relacionados

Fine-tuning (ajuste fino)Parâmetros (7B, 70B)Quantização

Também em:EnglishEspañol

← Todos os termos