将上下文工程与工具设计组合成"能处理任意任务的通用 Agent"架构:核心是 Coding Agent + 文件系统——代码生成不只是一个工具,而是一种元能力,能在运行时动态创造新工具和新能力。
通用 Agent 的核心 = Coding Agent + 文件系统——代码生成是元能力,能在运行时动态创造新工具、新约束、新表达,从 Manus 到 OpenClaw 都遵循这一范式。
只需七个核心工具——Code Interpreter、Bash Shell、读/写/编辑文件、Glob、Grep 即可覆盖绝大部分任务,集成成本极低。
文件系统是记忆、知识与能力的中枢——用 Markdown(MEMORY.md + 日期化日志)而非向量库,可读可改、保留时序、可 Git 回滚。
成熟度来自软件工程基础设施——Coding Agent 成熟不是因为代码模型强,而是测试、CI、Lint、Git 几十年积累天然构成强大 Harness。
元能力六个方向——思考工具、业务规则约束、多媒体生成、系统适配器、生成式 UI、Agent 自举(作用对象由内向外)。
安全防线——"致命三要素"(私有数据 + 不受信任内容 + 外部通信)+ "持久记忆"放大器;以语义解析、沙盒隔离、忠诚度守则、数据层信任边界兜底。
| 案例 / 数据 | 要点 |
|---|---|
| 实验 5-1 跨厂商轨迹接管 | 中立格式 6/6 切换成功,原样直传 3/6——"跨厂商接管能带走的是文字,带不走的是凭证" |
| 实验 5-9 代码 vs 生成模型 | 17 行 CadQuery 全尺寸零偏差;Hunyuan3D 外径偏差 −99.4%;M5→M6 变更代码路线只改一行 |
| 实验 5-6 论文转 PPT | 双 Agent 峰值上下文 24,186 vs 单 Agent 92,601(低 3.83×)——提议者-审核者的上下文优势 |
| 压缩熔断阈值 | "连续 3 次"来自真实统计:曾有会话连续失败 3000+ 次,此类无效重试全球每天约浪费 25 万次 API 调用 |
| 思考工具实验 | 代码臂 AIME 53.3% vs 纯 CoT 36.7%;K&K 84 题负结论如实保留——实验诚实记录 |