Quantização
A quantização armazena os pesos de um modelo com menos precisão (por exemplo, 4 bits em vez de 16), reduzindo a memória a cerca de um quarto com um pequeno custo em qualidade.
Um modelo são bilhões de números. Guardados na precisão do treinamento, cada número ocupa dois bytes; a quantização os arredonda para uma escala mais grossa, de modo que cada um ocupe apenas uma fração disso. Pense em arredondar todos os preços de um supermercado para reais inteiros: os totais ficam quase certos, e o caderno de que você precisa fica muito menor.
É a tecnologia que torna a IA local possível. Um modelo de 30 bilhões de parâmetros precisa de algo em torno de 60 GB em precisão completa, além de qualquer placa de vídeo de consumo. As quantizações de 4 bits mais comuns trazem isso para cerca de um terço, dentro da faixa que máquinas reais têm.
Os nomes crípticos (Q4_K_M, Q8_0, IQ4_XS) são receitas: quantos bits e qual método de empacotamento. Números maiores preservam mais precisão e mais gigabytes. Para o uso diário em chat, as receitas populares de 4 bits se saem bem; versões muito agressivas de 2 e 3 bits economizam mais memória, mas as arestas começam a aparecer.
Onde você vê isso no radar
Nossas tabelas medem o arquivo Q4_K_M quando ele existe (a quantização que quase todo guia de IA local assume), e cada tabela nomeia a receita exata que mediu.
Conferir um modelo quantizado com o seu hardware →Termos relacionados