Model fundamentals

上下文窗口

上下文窗口是模型一次能够考虑的最大文本量——以 token 计量——涵盖系统提示词、到目前为止的对话、工具结果,以及它正在生成的回复。

模型在某一轮里"看到"的一切都必须装进上下文窗口。对 agent 来说,这会很快被填满:系统提示词、每条用户消息以及每个工具结果一轮接一轮地累积。当窗口耗尽时,最旧或最不相关的内容必须被丢弃或摘要化,否则模型根本无法把它纳入。管理这个窗口——保留什么、压缩什么、按需检索什么——是构建 agent 的核心工程难题之一。

要点

  • 以 token 计量(在英语中大约是四分之三个单词);它约束输入与输出的总和。
  • 在 agent 中,它被系统提示词、持续进行的对话和工具结果所消耗。
  • 当它被填满时,上下文必须被压缩、摘要或按需获取——参见检索增强生成(RAG)。
  • 更大的窗口有帮助但并非免费:更多 token 意味着更高的成本、延迟,以及模型失去焦点的风险。

在实践中学习

Way of the Agent 逐级教授 AI 智能体工程——先掌握这类概念,再进行实操练习、赚取 XP 并解锁 AI 编年史。

免费开始 →