幻觉
幻觉是指模型自信地陈述某些虚假或杜撰的东西——编造出从未在其输入中出现、也从未以那种形式为真的事实、来源或细节。
语言模型生成的是最可能的续写,而不是经过验证的真相,因此它们能产出流畅、自信却完全错误的文本:一段编造的引用、一个不存在的 API、一个貌似合理却虚假的事实。对 agent 而言这很危险,因为一个幻觉出来的工具参数或论断可能会在整次运行中传播开来。主要的防御手段是:把答案锚定在检索到的来源上(RAG)、让模型给出引用、验证工具输出,以及把任务设计成允许模型说"我不知道"。
要点
- 模型产出流畅、自信但在事实上错误或杜撰的文本。
- 它之所以发生,是因为模型预测的是可能的文本,而不是经过验证的真相。
- 在 agent 中,一个幻觉出来的值可能会在整次运行中传播。
- 通过锚定/RAG、引用、输出验证,以及留出说"我不知道"的余地来缓解。