RAG (generación aumentada por recuperación)
RAG permite que un modelo responda a partir de tus propios documentos: primero recupera los pasajes relevantes y los coloca en el prompt. Conocimiento sin reentrenar nada.
La receta tiene tres pasos: tus documentos se dividen en pasajes y se indexan por significado; cuando haces una pregunta, se recuperan los pasajes más relacionados con ella; esos pasajes entran en la ventana de contexto junto a tu pregunta, y el modelo responde con ellos a la vista. Nada del modelo cambia: simplemente lee antes de hablar.
Por eso le importa a la gente de IA local: un manual privado, una base de código o diez años de notas pueden quedarse en tu máquina y seguir siendo consultables por un modelo que nunca los ha visto. También es la alternativa sensata al fine-tuning para todo lo factual: los hechos van en texto recuperable, el estilo va en los pesos.
Dos costos fáciles de pasar por alto. Los pasajes recuperados son tokens, así que consumen contexto y memoria de caché KV en cada pregunta. Y la respuesta solo es tan buena como la recuperación: dale al modelo el pasaje equivocado y explicará con fluidez el pasaje equivocado.
Dónde lo ves en el radar
RAG vive en la ventana de contexto: cada pasaje recuperado son tokens que la caché KV debe contener. El motor de compatibilidad lo calcula por longitud de contexto; por eso el mismo modelo puede caber a 8K y fallar a 32K.
Comprobar compatibilidades con contextos largos →Términos relacionados