🔄 Agent 的持续进化

把前八章提供的上下文、知识、工具、评估、后训练组织成"以验证为门槛"的持续进化闭环,让 Agent 从"会完成任务"走向"能够可靠工作"——保存经历不等于从经历中学习。

📷 5 张原书配图 + 原创闭环图 🧪 9 个配套实验 ⭐ 难度:进阶 📚 第二部分 · 如何提升 Agent 能力
持续进化闭环
🎯 核心论点
1

保存经历 ≠ 从经历中学习——学习发生在系统主动完成"评价、对照、归纳、验证"之后,而不是日志写入磁盘那一刻。

2

学习要建成模型外围的自主系统——模型自身尚不能可靠地持续学习:记录证据→验证→提炼共性→决定更新载体→回归发布。

3

学习信号回答"该不该改",更新载体回答"改在哪里"——信号分环境结果/过程规则/LLM Rubric 三层;载体分知识文档/Prompt 与 Skill/程序与 Harness/模型参数。

4

所有修改先形成待验证版本——经独立回归与安全检查后灰度发布、可回滚;安全机制(验证器、测试用例、发布门槛)不可自我修改。

5

在线执行与离线学习分离——区分"Harness 更新能力"与"Harness 受益能力"分层评估,防止用端到端分数误判"看起来进化了"。

🗂️ 关键概念卡片

学习信号

判断一次运行好坏的评价依据来自环境结果、过程规则与 LLM Rubric;错误评价会跨任务放大

结果验证器

检查"事情是否真的办成"读取测试、数据库状态、工具返回等环境真值,最可靠

过程验证器

检查"是否以允许的方式办成"核对业务规则、权限与动作序列,防止"结果对但过程错"

LLM Rubric

用评价量表逐项打分代替模糊总分逐维度给分、引用轨迹证据、证据不足时明确表示不确定

四种更新载体

经验可写入的四个位置知识文档/Prompt 与 Skill/程序与 Harness/模型参数;可组合、不互斥

灰度发布

新版本先小流量验证再全量通过边界集与保留集回归、安全检查后分阶段放量,异常即回滚

最小 diff + 可回滚

更新应是最小局部修改且可撤销待验证版本须在触发失败的边界集改善、正常工作保留集不退化

睡眠学习

对离线整合的认知类比触发→定向→采集整合→验证审批→修剪索引五步;与在线采集分离

双循环结构

在线执行与离线进化分开在线只完成任务并记录证据,离线聚合诊断生成提案,经验证门槛发布

可证伪变更契约

每个修改请求的声明格式列失败证据、推断根因、归属组件、预期修复与可能受损行为及对应用例
🖼️ 原书配图详解
图 9-1

持续进化总体闭环

持续进化总体闭环
执行任务 → 记录轨迹 → 形成信号 → 生成候选更新(知识/指令/程序/参数)→ 验证与发布(回归、灰度、回滚)→ 新 Agent 进入下一轮
三层轨迹验证
图 9-2 三层轨迹验证——结果/过程/LLM Rubric 三类验证器汇入"结构化轨迹评价",输出可学习诊断信号
四种更新方式
图 9-3 四种更新方式——知识(Markdown/知识库)、指令(Prompt/Skill)、程序(工具/工作流/Harness)、参数(SFT/蒸馏/RL)
经验知识化管道
图 9-4 经验知识化管道——原始轨迹 → 单次评价 → 跨轨迹比较 → Markdown 文档 → 检索应用;新证据用于修订或淘汰旧知识
在线/离线双循环
图 9-5 在线执行循环(稳定版 Agent)与离线进化循环(聚合诊断 → 候选修改 → 回归验证 → 灰度、监控与回滚)双环
📊 关键案例与数据
案例 / 数据要点
τ²-bench telecom提炼集 20 条任务中 19 条以转接人工收场;模型自行归纳规则后,迁移集通过率 12.3% → 19.3%,零回归
提炼材料决定结论只给失败摘要 → 归纳"同一工具反复报错即不应继续调用";补充工具清单后 → "用户设备侧问题应引导用户自行操作"
PreAct 浏览器工作流重复任务端到端加速 8.5–13 倍,回放不逐步调用 LLM——但强调动作前/后验证
Voyager(Minecraft)三机制缺一不可:自动课程生成器、可组合技能库、迭代提示(环境反馈回写代码)
DeepSeek Harness(dsh)"一切皆插件":Cordis 把可撤销效果与反应式协效果提升到运行时,没有特权内核
💬 金句摘录
保存经历不等于从经历中学习。
反思本身不是证据;只有与环境结果相符、得到跨轨迹支持并在新任务上显示正向迁移的内容,才应进入正式经验文档。
模型会把观察到的行为当作应然的行为。
自我进化的上限,不取决于模型能写出多好的代码,而取决于承载它的系统具有多强的可组合性。
只解决了当前失败案例的问题,却在其他已有案例或新领域中退化,不是成功的持续学习。
🧪 配套实验亮点
实验 9-2 τ²-bench 经验提炼(★★★)通过率 12.3%→19.3% 零回归
实验 9-5 browser-use RPA(★★★)探索、验证、回放与假成功对照
实验 9-7 harness-safety-gate(★★★)"修改者不能自证成功"
实验 9-9 self-evolution-eval(★★★)三臂 × 3 seeds × 14 任务
← 上一章
🧠 第 8 章 模型后训练