AI agent 的评测(Evals)
评测是系统性的测试,用来衡量 AI agent 完成某项任务的表现好坏——它是面向非确定性系统的一套测试用例,用于捕捉回归并对比改动。
因为 agent 是非确定性的,你无法靠试一次就判断一个改动。评测让 agent 在一组固定任务上运行,配以明确的成功标准,并对结果打分——可以是自动化的、由另一个充当裁判的模型进行的,或由人工完成。一套好的评测集把"感觉好些了"变成一个你能追踪的数字,从而让你判断一个新提示词、模型或工具究竟是真的改进了,还是悄悄弄坏了什么。
要点
- 一组可重复的任务,带有成功标准,通过打分来衡量 agent 质量。
- 至关重要,因为 agent 是非确定性的——单次运行说明不了什么。
- 打分可以是自动化的、由模型裁判的(LLM-as-judge),或人工的。
- 它们把主观的"似乎更好"变成可追踪的指标,并在用户之前捕捉到回归。