Knowledge & memory

Generación aumentada por recuperación (RAG)

La generación aumentada por recuperación (RAG) es un patrón en el que se recuperan documentos relevantes de un almacén externo en el momento de la consulta y se insertan en el prompt, de modo que el modelo responde a partir de ese material fresco y específico en lugar de únicamente desde su memoria.

El conocimiento incorporado de un modelo queda fijado en el momento del entrenamiento y no puede cubrir datos privados o actualizados. RAG cierra esa brecha: la consulta del usuario se usa para buscar en una base de conocimiento (a menudo mediante similitud de vectores), las mejores coincidencias se incorporan a la ventana de contexto y se le pide al modelo que responda fundamentándose en ellas. Esto hace que las respuestas sean actuales y específicas, permite que citen fuentes y reduce las alucinaciones, siempre que la recuperación efectivamente saque a la luz el material correcto.

Puntos clave

  • Recupera fragmentos relevantes en el momento de la consulta, los coloca en el prompt y luego genera la respuesta fundamentada en ellos.
  • Mantiene las respuestas actuales y específicas del dominio sin reentrenar el modelo.
  • Permite las citas y reduce las alucinaciones, pero solo en la medida que lo permita la calidad de la recuperación.
  • La calidad de la recuperación (fragmentación, embeddings, ranking) suele importar más que la elección del modelo.

Apréndelo construyendo

Way of the Agent enseña ingeniería de agentes de IA nivel a nivel — conceptos como este y luego práctica, XP y las AI Chronicles.

Empieza gratis →