Janela de contexto
A janela de contexto é quanto texto um modelo consegue considerar de uma vez, medido em tokens; e manter esse texto na memória custa VRAM por meio do cache KV.
Modelos leem e escrevem em tokens, fragmentos de palavras: aproximadamente 750 palavras em inglês a cada 1.000 tokens. A janela de contexto é o total que o modelo consegue manter à vista de uma vez: suas instruções, a conversa até agora, qualquer documento colado e a resposta que está sendo escrita.
Os editores anunciam janelas cada vez maiores, e os números são reais, mas na sua máquina a janela não é de graça. Cada token à vista ocupa memória de cache KV; assim, uma janela enorme anunciada e uma placa de vídeo modesta se encontram no meio do caminho: o modelo SUPORTA um milhão de tokens, a sua memória decide quantos você consegue usar de verdade.
É por isso que qualquer afirmação honesta de compatibilidade nomeia o contexto que assumiu. O mesmo modelo na mesma placa pode ser um encaixe confortável no dia a dia em contextos curtos e uma impossibilidade com um livro inteiro carregado.
Onde você vê isso no radar
Toda estimativa de compatibilidade no radar declara o comprimento de contexto com que foi calculada; mude a premissa e o veredito muda honestamente junto.
Ver compatibilidades com o contexto declarado →Termos relacionados