Evaluation

Les évaluations pour agents IA

Les évaluations (evals) sont des tests systématiques qui mesurent la performance d'un agent IA sur une tâche — une suite de tests pour systèmes non déterministes, utilisée pour détecter les régressions et comparer les changements.

Parce que les agents sont non déterministes, on ne peut pas juger un changement en l'essayant une seule fois. Les évaluations exécutent l'agent sur un ensemble fixe de tâches avec des critères de succès définis et notent les résultats — automatiquement, par un autre modèle jouant le rôle de juge, ou par des humains. Un bon jeu d'évaluations transforme « ça semble mieux » en un nombre que l'on peut suivre, afin de savoir si un nouveau prompt, modèle ou outil a réellement amélioré les choses ou a discrètement cassé quelque chose.

Points clés

  • Un ensemble de tâches reproductible avec des critères de succès, noté pour mesurer la qualité de l'agent.
  • Essentiel car les agents sont non déterministes — une seule exécution ne prouve rien.
  • La notation peut être automatisée, jugée par un modèle (LLM-as-judge), ou humaine.
  • Elles transforment le subjectif « semble mieux » en une métrique suivie et détectent les régressions avant les utilisateurs.

Apprends en construisant

Way of the Agent enseigne l'ingénierie des agents IA niveau par niveau — des concepts comme celui-ci, puis de la pratique, de l'XP et les AI Chronicles.

Commencer gratuitement →