全书技术密度最高的核心章:系统回答同一问题——"怎样以更低成本向模型提供一个信息充分的上下文"。上下文决定 Agent 能力上限,而不仅是对话历史。
上下文质量才是关键——中等模型 + 精心组织的上下文,往往胜过顶级模型在信息匮乏下的盲目摸索;翁家翌:"人和模型一样,最重要的是 Context。"
API 无状态,框架每次重建上下文——Agent 的下一步行动取决于截至当前的完整交互上下文,生产系统可摘要压缩,但不能悄悄丢掉决定下一步所需的信息。
上下文 = 静态前缀 + 轨迹——"前面不能动、后面可以压缩";system/user/assistant/tool 四种角色 + tools 字段恰好覆盖第一章的五个组成部分。
KV Cache 利用前缀不变性,缓存经济性成为架构约束——动态信息永远追加末尾,静态前缀字节级稳定。
上下文学习本质是检索而非推理——状态栏把隐式状态提炼为显式知识;压缩把"需思考的结论"变成"可直接检索的知识",两者是一枚硬币的两面。
提示注入是核心安全威胁——防御核心是"指令/数据分离",但只能降低成功率,必须配合执行层与数据层。

<|im_start|> 等特殊标记划分消息边界与角色| 案例 / 数据 | 要点 |
|---|---|
| 客服 Agent 时间戳事故 | 每天 10 万次对话,系统提示词注入 Current time: {{now}} 后首 token 延迟 0.5s → 3-5s,月度账单几乎翻倍 |
| 提示工程消融(Tau-Bench) | 保留规则但打乱组织结构 → 任务成功率下降超 30%;移除工具描述 → 工具调用错误率增加 45% |
| 六种压缩策略(Kimi K3) | 无压缩第 5 次迭代即超限;上下文感知压缩仅 7 次迭代、压缩率约 3.0%,整体减少 token 使用量 75% 以上 |
| Agent 状态栏 | 小开源模型准确率接近前沿大模型,思考 token 量/延迟/花费降低约一个数量级;详细错误信息使替代方案成功率 60% → 95% |
| Attention Sink | 首 token 是"注意力储存池",吸收超 70% 权重;存在 Lost in the Middle 位置偏好 |