Skip to content
AI Model Radar

Glossário

Cache KV

O cache KV é a memória de trabalho que o modelo preenche enquanto lê a sua conversa: cresce a cada token e, em contextos longos, pode rivalizar em tamanho com o próprio modelo.

Enquanto gera, o modelo mantém um registro de cada token que já viu: as chaves e os valores das suas camadas de atenção, daí o nome. Esse registro é o que permite que o token dez mil se relacione com o token três sem reler tudo.

O custo: o cache cresce com o comprimento do contexto, camada por camada. A memória da sua máquina precisa conter os pesos do modelo E esse cache ao mesmo tempo; por isso um modelo que cabe confortavelmente em chats curtos pode falhar com um documento longo.

Arquiteturas modernas atacam exatamente isso. Algumas guardam o contexto completo em apenas uma fração das camadas, outras usam janelas deslizantes curtas no restante, e os projetos de atenção latente comprimem o registro de cada token em um vetor pequeno. Dois modelos com o mesmo número de parâmetros podem diferir enormemente no apetite por cache; por isso lê-lo da configuração publicada de cada modelo supera qualquer regra de bolso.

Onde você vê isso no radar

Nosso motor de compatibilidade calcula o cache KV camada por camada a partir do arquivo de configuração de cada modelo: é o número do meio em toda estimativa de memória, ao lado de pesos e sobrecarga.

Ver a aritmética do cache por modelo

Termos relacionados

Janela de contextoMemória unificadaParâmetros (7B, 70B)

Também em:EnglishEspañol

← Todos os termos