Evaluation

AI agent 的评测(Evals)

评测是系统性的测试,用来衡量 AI agent 完成某项任务的表现好坏——它是面向非确定性系统的一套测试用例,用于捕捉回归并对比改动。

因为 agent 是非确定性的,你无法靠试一次就判断一个改动。评测让 agent 在一组固定任务上运行,配以明确的成功标准,并对结果打分——可以是自动化的、由另一个充当裁判的模型进行的,或由人工完成。一套好的评测集把"感觉好些了"变成一个你能追踪的数字,从而让你判断一个新提示词、模型或工具究竟是真的改进了,还是悄悄弄坏了什么。

要点

  • 一组可重复的任务,带有成功标准,通过打分来衡量 agent 质量。
  • 至关重要,因为 agent 是非确定性的——单次运行说明不了什么。
  • 打分可以是自动化的、由模型裁判的(LLM-as-judge),或人工的。
  • 它们把主观的"似乎更好"变成可追踪的指标,并在用户之前捕捉到回归。

在实践中学习

Way of the Agent 逐级教授 AI 智能体工程——先掌握这类概念,再进行实操练习、赚取 XP 并解锁 AI 编年史。

免费开始 →