把前八章提供的上下文、知识、工具、评估、后训练组织成"以验证为门槛"的持续进化闭环,让 Agent 从"会完成任务"走向"能够可靠工作"——保存经历不等于从经历中学习。
保存经历 ≠ 从经历中学习——学习发生在系统主动完成"评价、对照、归纳、验证"之后,而不是日志写入磁盘那一刻。
学习要建成模型外围的自主系统——模型自身尚不能可靠地持续学习:记录证据→验证→提炼共性→决定更新载体→回归发布。
学习信号回答"该不该改",更新载体回答"改在哪里"——信号分环境结果/过程规则/LLM Rubric 三层;载体分知识文档/Prompt 与 Skill/程序与 Harness/模型参数。
所有修改先形成待验证版本——经独立回归与安全检查后灰度发布、可回滚;安全机制(验证器、测试用例、发布门槛)不可自我修改。
在线执行与离线学习分离——区分"Harness 更新能力"与"Harness 受益能力"分层评估,防止用端到端分数误判"看起来进化了"。
| 案例 / 数据 | 要点 |
|---|---|
| τ²-bench telecom | 提炼集 20 条任务中 19 条以转接人工收场;模型自行归纳规则后,迁移集通过率 12.3% → 19.3%,零回归 |
| 提炼材料决定结论 | 只给失败摘要 → 归纳"同一工具反复报错即不应继续调用";补充工具清单后 → "用户设备侧问题应引导用户自行操作" |
| PreAct 浏览器工作流 | 重复任务端到端加速 8.5–13 倍,回放不逐步调用 LLM——但强调动作前/后验证 |
| Voyager(Minecraft) | 三机制缺一不可:自动课程生成器、可组合技能库、迭代提示(环境反馈回写代码) |
| DeepSeek Harness(dsh) | "一切皆插件":Cordis 把可撤销效果与反应式协效果提升到运行时,没有特权内核 |