Skip to content
AI Model Radar

Glossário

Janela de contexto

A janela de contexto é quanto texto um modelo consegue considerar de uma vez, medido em tokens; e manter esse texto na memória custa VRAM por meio do cache KV.

Modelos leem e escrevem em tokens, fragmentos de palavras: aproximadamente 750 palavras em inglês a cada 1.000 tokens. A janela de contexto é o total que o modelo consegue manter à vista de uma vez: suas instruções, a conversa até agora, qualquer documento colado e a resposta que está sendo escrita.

Os editores anunciam janelas cada vez maiores, e os números são reais, mas na sua máquina a janela não é de graça. Cada token à vista ocupa memória de cache KV; assim, uma janela enorme anunciada e uma placa de vídeo modesta se encontram no meio do caminho: o modelo SUPORTA um milhão de tokens, a sua memória decide quantos você consegue usar de verdade.

É por isso que qualquer afirmação honesta de compatibilidade nomeia o contexto que assumiu. O mesmo modelo na mesma placa pode ser um encaixe confortável no dia a dia em contextos curtos e uma impossibilidade com um livro inteiro carregado.

Onde você vê isso no radar

Toda estimativa de compatibilidade no radar declara o comprimento de contexto com que foi calculada; mude a premissa e o veredito muda honestamente junto.

Ver compatibilidades com o contexto declarado

Termos relacionados

Cache KVVRAM vs. RAM do sistemaParâmetros (7B, 70B)

Também em:EnglishEspañol

← Todos os termos