La génération augmentée par récupération (RAG)
La génération augmentée par récupération (RAG) est un motif où des documents pertinents sont récupérés depuis un magasin externe au moment de la requête et insérés dans le prompt, afin que le modèle réponde à partir de ce matériel frais et spécifique plutôt que de sa seule mémoire.
Les connaissances intégrées d'un modèle sont figées au moment de l'entraînement et ne peuvent couvrir des données privées ou à jour. Le RAG comble cet écart : la requête de l'utilisateur sert à rechercher dans une base de connaissances (souvent via la similarité vectorielle), les meilleures correspondances sont tirées dans la fenêtre de contexte, et on demande au modèle de répondre en s'appuyant sur elles. Cela rend les réponses actuelles et spécifiques, leur permet de citer des sources et réduit les hallucinations — à condition que la récupération fasse effectivement remonter le bon matériel.
Points clés
- Récupérer les fragments pertinents au moment de la requête, les placer dans le prompt, puis générer la réponse en s'appuyant sur eux.
- Maintient les réponses actuelles et spécifiques au domaine sans réentraîner le modèle.
- Permet les citations et réduit les hallucinations — mais seulement dans la mesure où la qualité de la récupération le permet.
- La qualité de la récupération (découpage, embeddings, classement) compte généralement plus que le choix du modèle.
Apprends en construisant
Way of the Agent enseigne l'ingénierie des agents IA niveau par niveau — des concepts comme celui-ci, puis de la pratique, de l'XP et les AI Chronicles.
Commencer gratuitement →