Skip to content
AI Model Radar

Glossário

RAG (geração aumentada por recuperação)

RAG permite que um modelo responda a partir dos seus próprios documentos: primeiro recupera os trechos relevantes e os coloca no prompt. Conhecimento sem retreinar nada.

A receita tem três passos: seus documentos são divididos em trechos e indexados por significado; quando você faz uma pergunta, os trechos mais relacionados a ela são recuperados; esses trechos entram na janela de contexto junto com a pergunta, e o modelo responde com eles à vista. Nada no modelo muda: ele simplesmente lê antes de falar.

É por isso que o pessoal de IA local se importa: um manual privado, uma base de código ou dez anos de anotações podem ficar na sua máquina e continuar consultáveis por um modelo que nunca os viu. Também é a alternativa sensata ao fine-tuning para tudo o que é factual: fatos ficam em texto recuperável, estilo fica nos pesos.

Dois custos fáceis de ignorar. Trechos recuperados são tokens, então consomem contexto e memória de cache KV a cada pergunta. E a resposta só é tão boa quanto a recuperação: entregue ao modelo o trecho errado e ele explicará com fluência o trecho errado.

Onde você vê isso no radar

RAG vive na janela de contexto: cada trecho recuperado são tokens que o cache KV precisa manter. O motor de compatibilidade calcula isso por comprimento de contexto; por isso o mesmo modelo pode caber em 8K e falhar em 32K.

Conferir compatibilidades em contextos longos

Termos relacionados

Janela de contextoFine-tuning (ajuste fino)Token

Também em:EnglishEspañol

← Todos os termos