Embedding (vetor de significado)
Um embedding é uma lista de números que captura o significado de um texto, de modo que textos sobre a mesma coisa ficam próximos entre si: a engrenagem por trás da busca semântica e do RAG.
Computadores não conseguem comparar significados diretamente, então um modelo de embeddings transforma uma frase, um parágrafo ou um documento inteiro em um vetor: de algumas centenas a alguns milhares de números. Textos com significados parecidos ganham vetores que apontam em direções parecidas, sejam quais forem as palavras. «Como reduzo o uso de VRAM?» e «diminuir a memória gráfica» ficam perto; uma receita de panqueca fica longe.
Esse é o truque da recuperação: você indexa cada trecho dos seus documentos como um vetor uma única vez, transforma a pergunta em vetor na hora da consulta e busca os trechos cujos vetores estão mais próximos. Sem palavras-chave nem correspondência exata: significado. Modelos de embeddings são pequenos perto dos modelos de chat, muitas vezes bem abaixo de um bilhão de parâmetros, então rodam tranquilamente na CPU de um notebook e indexam um arquivo grande localmente.
Duas coisas para saber antes de confiar neles. Vetores de modelos de embeddings diferentes não são comparáveis, então o índice precisa ser reconstruído se você trocar de modelo. E um embedding captura sobre o que um trecho fala, não se ele é verdadeiro: a recuperação encontra texto relevante, e o modelo de chat ainda precisa lê-lo com senso crítico.
Onde você vê isso no radar
Modelos de embeddings não estão no painel: o radar acompanha modelos de chat e de código, e um índice construído na sua máquina não custa contexto. O que custa contexto são os trechos que ele recupera, e o buscador calcula isso por comprimento de contexto.
Ver como o contexto recuperado afeta a compatibilidade →Termos relacionados
RAG (geração aumentada por recuperação)TokenJanela de contexto