🤝 多 Agent 协作

把问题从"如何构建和改进一个 Agent"推进到"如何组织多个 Agent":群体的智能可以高于个体,但工程判据只有一条——协作是否引入了单 Agent 生成时无法获得的新信息。

📷 11 张原书配图 + 原创分类矩阵 🧪 6 个配套实验 ⭐ 难度:进阶 📚 第二部分 · 如何提升 Agent 能力
多 Agent 协作分类框架
🎯 核心论点
1

新信息判据——执行反馈、视觉反馈、工具反馈有增量(Anthropic 漏洞挖掘、WebGen-Agent);自我审查与同文本辩论没有。

2

上下文共享保留细节但会膨胀——带来角色惯性;上下文隔离利于并发、模块化与权限控制,代价是必须通过显式通信传递结构化"移交包"。

3

多 Agent 通信等价于进程间通信——共享文件系统 = 共享内存;工具调用参数与消息总线 = 消息传递的两种形态。

4

引入单 Agent 不存在的失败模式——研究归纳 14 种、三大类;需乐观锁与工作副本、独立交叉验证、差异化信息源、预算与取消机制构成容错闭环。

5

长期开放的群体交互涌现"Agent 社会"——社交(AI 小镇/Agentopia)、经济、策略博弈(狼人杀)等现象。

🗂️ 关键概念卡片

共享上下文

后继 Agent 继承前序完整轨迹每阶段切换系统提示词与工具集即新 Agent,保留前任全部记忆

上下文隔离

各 Agent 维护独立上下文与历史无法访问对方思考过程,靠工具参数/共享文件/消息总线显式交换

协作拓扑

控制权与信息按何结构流动对等协作、管理者(Orchestration)、去中心化三种典型形态

新信息判据

是否引入生成时不存在的信息执行/视觉/工具反馈显著提升;自我审查通常无效甚至有害

移交包

Agent 间传递的结构化交接物任务描述 + 已确认事实与约束 + 结构化产物引用(文件路径而非内容)

消息总线

异步中转消息的"公共公告板"发布-订阅解耦,发送方无需知晓消费者,支持并行协调

虚拟文件系统

多源挂载的统一目录树四类区域:专属工作区/共享空间/外部挂载/系统内置(Skills)

Loop 工程

由验证器判定循环何时停止发现→执行→验证→记录;循环瓶颈在验证器而不在模型

提议者-审核者

最经典的对等协作范式审核者读独立证据、给可定位修复条件,不能修改测试与发布门槛

管理者模式

中心化 Manager 调度子 AgentManager 把子 Agent 建模为工具;弱规划者是系统最大瓶颈

去中心化 handoff

控制权如接力棒对等流转OpenAI Swarm 式,移交携带预算、访问链与循环检测

A2A 协议

跨组织 Agent 互操作标准Agent Card + 任务生命周期状态机;MCP 管 Agent-工具,A2A 管 Agent-Agent
🖼️ 原书配图详解
共享上下文 vs 不共享上下文
图 10-1 左右对比——共享上下文(需求分析师→工程师→代码审查员继承同一对话历史)vs 不共享上下文(经共享文件系统协作)
Agent 虚拟文件系统
图 10-2 Agent 虚拟文件系统——统一 read/write/list 接口下挂载四类区域,用户上传下载
提议者-审核者循环
图 10-3 提议者-审核者循环——Proposer 生成代码,Reviewer 渲染+Vision LLM 评估,迭代至 0 问题
Manager 顺序协调
图 10-4 Manager 顺序协调——按步骤依次调用子 Agent A(数据收集)/B(分析)/C(报告)
书籍翻译架构
图 10-5 书籍翻译架构——Manager 调度 Glossary/Translation×N/Proofreading,共享文件系统交换成果(实验10-2)
Manager 并行协调
图 10-6 Manager 并行协调——消息总线连接 4 个并行 Agent,附 start/completed/data_ready 消息示例
Phone 与 Computer 双 Agent
图 10-7 Phone 与 Computer 双 Agent——语音链路与浏览器链路经 WebSocket 双向通信(实验10-3)
并行 Web Scraping
图 10-8 并行 Web Scraping——Manager 动态创建 10 个 Agent,含级联终止时序与串并行加速对比(实验10-4)
MetaGPT 网络
图 10-9 MetaGPT 网络——PM→Architect→Project Mgr→Engineer×3→QA 流水线,标准化文档传递,Bug 报告回路
AI 小镇架构
图 10-10 AI 小镇架构——单个 Agent 的记忆流(importance/recency)、反思、计划三组件,及派对邀请/选举传播等涌现行为
图 10-11

语音狼人杀系统

语音狼人杀系统
法官(代码驱动)掌握全局状态、按角色分发信息(狼人互知/预言家验人/女巫解药/村民仅公开),含实时语音交互(实验10-6)
📊 关键案例与数据
案例 / 数据要点
Anthropic 漏洞挖掘45 个 Agent 经共享论坛协调,2700 万 token 找到 266 个漏洞;独立并行 Agent 用 650 万 token 只找到 21 个
WebGen-Agent多层视觉反馈脚手架使 Claude 3.5 Sonnet 网页生成成绩从 26.4% 提升到 51.9%(接近翻倍)
LongHorizon-HarnessWeaveBench 51.8%→80.7%、OSWorld 2.0 2.8%→8.3%、Terminal-Bench 69.7%→77.2%
失败模式研究7 个框架、约 150 条轨迹人工标注归纳 14 种失败模式(Cohen's kappa=0.88)
同质趋同30 个并发 Agent 有 18 个创建同名 Git 分支;写作实验不同 Agent 不约而同用相同标题
书籍翻译实验(实验10-2)Manager 上下文缩小 20.43×、token 减少 6.48×,匿名质量 4.654>4.481,但慢 6.57%
💬 金句摘录
群体的智能可以高于个体。
在验证之前,"完成"只是模型的一句宣称,不是证明。
循环的瓶颈在验证器,而不在模型。
进程间传递字节,逐位保真,但 Agent 间传递语义,每转述一次都是有损的重新编码。
你可以外包你的思考,但不能外包你的理解。(引 Andrej Karpathy)
好的协作不是暴露彼此的思考过程,而是约定清晰的接口、边界、权限和验收标准。
🧪 配套实验亮点
实验 10-1 multi-role-transfer(★★)切换系统提示词 vs 加载 Skill 对照
实验 10-3 电话+电脑双 Agent(★★★)真实 ARK 自主工具调用 + WebRTC 双工
实验 10-4 parallel-web-research(★★★)10 站点串并行加速 1.872×
实验 10-5 generative-agents(★★★)三组各 25 Agent、17,280 步 AI 小镇
实验 10-6 voice-werewolf(★★★)信息隔离 + 真实 ASR 回环语音狼人杀
📝 后记速览
模型会不会吃掉 Harness?
  1. 全书公式 Agent = LLM + 上下文 + 工具;三部分:构建(2-6章)、评估与进化(7-9章)、协作(第10章)。
  2. 两朵乌云:① Agent 如何流式实时交互(快慢分离);② Agent 如何从交互成败中持续积累经验。
  3. 模型与 Harness 互喂飞轮——模型"一层层吃掉"Harness 但永不会吃完;只改 harness 不动模型即可把任务准确率从 52.8% 提到 66.5%。
← 上一章
🔄 第 9 章 Agent 的持续进化