Retrieval-augmented generation (RAG)
Retrieval-augmented generation (RAG) é um padrão em que documentos relevantes são buscados em um repositório externo no momento da consulta e inseridos no prompt, para que o modelo responda a partir desse material atual e específico, em vez de apenas da memória.
O conhecimento interno de um modelo é fixado no momento do treinamento e não consegue cobrir dados privados ou atualizados. O RAG fecha essa lacuna: a consulta do usuário é usada para buscar em uma base de conhecimento (muitas vezes via similaridade de vetores), os melhores resultados são trazidos para a janela de contexto, e o modelo é solicitado a responder fundamentado neles. Isso torna as respostas atuais e específicas, permite que elas citem fontes e reduz a alucinação — desde que a busca de fato traga o material certo.
Pontos-chave
- Recupere trechos relevantes no momento da consulta, coloque-os no prompt e então gere a resposta fundamentada neles.
- Mantém as respostas atuais e específicas do domínio sem retreinar o modelo.
- Viabiliza citações e reduz a alucinação — mas apenas na medida em que a qualidade da busca permite.
- A qualidade da recuperação (chunking, embeddings, ranqueamento) costuma importar mais do que a escolha do modelo.
Aprenda construindo
O Way of the Agent ensina engenharia de agentes de IA nível a nível — conceitos como este e depois prática, XP e as AI Chronicles.
Começar grátis →