Destilação
A destilação treina um modelo pequeno para imitar as respostas de um maior: por isso existem muitos dos melhores modelos pequenos, e por isso herdam os hábitos do grande, bons e maus.
Em vez de aprender apenas com texto bruto, o modelo pequeno («aluno») é treinado com o que um modelo grande («professor») produz: suas respostas, seus rastros de raciocínio, às vezes todo o leque de palavras que ele considerou. O aluno nunca se torna o professor, mas aprende a soar como ele por muito menos do que treinar do zero.
Para uso local, é discretamente a técnica mais importante dos últimos anos. Um modelo destilado de 8B consegue se sair bem em tarefas que antes exigiam um modelo cinco vezes maior, que é exatamente o que cabe em uma placa de gama média. Quando o nome de um modelo traz «distill», é essa a afirmação que está sendo feita.
As ressalvas honestas: um aluno herda os pontos cegos do professor junto com as forças, e «destilado» descreve a receita, não garante a qualidade. A história do hardware não muda: um modelo destilado de 8B é um arquivo de 8B, e o localizador mede o arquivo.
Onde você vê isso no radar
Modelos destilados chegam como arquivos pequenos e medidos com um alcance surpreendente; o localizador os trata como qualquer outro GGUF, então um bom modelo destilado simplesmente aparece como um bom encaixe em hardware modesto.
Ver o que cabe em uma placa de gama média →Termos relacionados