Evaluation

Evals für KI-Agenten

Evals sind systematische Tests, die messen, wie gut ein KI-Agent eine Aufgabe erfüllt — eine Testsuite für nichtdeterministische Systeme, eingesetzt, um Regressionen aufzuspüren und Änderungen zu vergleichen.

Weil Agenten nichtdeterministisch sind, kann man eine Änderung nicht beurteilen, indem man sie einmal ausprobiert. Evals lassen den Agenten gegen eine feste Menge von Aufgaben mit definierten Erfolgskriterien laufen und bewerten die Ergebnisse — automatisch, durch ein anderes Modell als Richter oder durch Menschen. Ein guter Eval-Satz verwandelt „es fühlt sich besser an“ in eine Zahl, die man verfolgen kann, sodass man erkennt, ob ein neuer Prompt, ein neues Modell oder ein neues Tool die Dinge wirklich verbessert oder still etwas kaputtgemacht hat.

Kernpunkte

  • Eine wiederholbare Aufgabenmenge mit Erfolgskriterien, bewertet, um die Agentenqualität zu messen.
  • Unverzichtbar, weil Agenten nichtdeterministisch sind — ein einzelner Durchlauf beweist nichts.
  • Die Bewertung kann automatisiert, modellbewertet (LLM-as-Judge) oder menschlich sein.
  • Sie verwandeln das subjektive „scheint besser“ in eine verfolgbare Kennzahl und fangen Regressionen ab, bevor die Nutzer es tun.

Lern es durch Bauen

Way of the Agent bringt dir AI-Agent-Engineering Level für Level bei — Konzepte wie dieses, dann Praxis, XP und die AI Chronicles.

Kostenlos starten →