Model fundamentals

La fenêtre de contexte

La fenêtre de contexte est la quantité maximale de texte — mesurée en tokens — qu'un modèle peut prendre en compte à la fois, couvrant le prompt système, la conversation jusqu'ici, les résultats d'outils et la réponse qu'il est en train de générer.

Tout ce que le modèle « voit » à un tour donné doit tenir dans la fenêtre de contexte. Pour un agent, elle se remplit vite : le prompt système, chaque message utilisateur et chaque résultat d'outil s'accumulent tour après tour. Lorsque la fenêtre est épuisée, le contenu le plus ancien ou le moins pertinent doit être supprimé ou résumé, sinon le modèle ne peut tout simplement pas l'absorber. Gérer la fenêtre — quoi conserver, compacter ou récupérer à la demande — est l'un des problèmes d'ingénierie centraux de la construction d'agents.

Points clés

  • Mesurée en tokens (environ ¾ d'un mot en anglais) ; elle limite l'entrée et la sortie combinées.
  • Dans un agent, elle est consommée par le prompt système, la conversation en cours et les résultats d'outils.
  • Quand elle se remplit, le contexte doit être compacté, résumé ou récupéré à la demande — voir la génération augmentée par récupération.
  • Une fenêtre plus grande aide mais n'est pas gratuite : plus de tokens signifie plus de coût, de latence et le risque que le modèle perde le fil.

Apprends en construisant

Way of the Agent enseigne l'ingénierie des agents IA niveau par niveau — des concepts comme celui-ci, puis de la pratique, de l'XP et les AI Chronicles.

Commencer gratuitement →