Cache KV
O cache KV é a memória de trabalho que o modelo preenche enquanto lê a sua conversa: cresce a cada token e, em contextos longos, pode rivalizar em tamanho com o próprio modelo.
Enquanto gera, o modelo mantém um registro de cada token que já viu: as chaves e os valores das suas camadas de atenção, daí o nome. Esse registro é o que permite que o token dez mil se relacione com o token três sem reler tudo.
O custo: o cache cresce com o comprimento do contexto, camada por camada. A memória da sua máquina precisa conter os pesos do modelo E esse cache ao mesmo tempo; por isso um modelo que cabe confortavelmente em chats curtos pode falhar com um documento longo.
Arquiteturas modernas atacam exatamente isso. Algumas guardam o contexto completo em apenas uma fração das camadas, outras usam janelas deslizantes curtas no restante, e os projetos de atenção latente comprimem o registro de cada token em um vetor pequeno. Dois modelos com o mesmo número de parâmetros podem diferir enormemente no apetite por cache; por isso lê-lo da configuração publicada de cada modelo supera qualquer regra de bolso.
Onde você vê isso no radar
Nosso motor de compatibilidade calcula o cache KV camada por camada a partir do arquivo de configuração de cada modelo: é o número do meio em toda estimativa de memória, ao lado de pesos e sobrecarga.
Ver a aritmética do cache por modelo →Termos relacionados