"Agent 的手脚与感官"设计指南:从五类工具分类、通用设计原则(ACI)、能力分发生态(MCP 与 Skill Hub)到工具规模化后的发现机制。工具设计决定 Agent 的能力上限。
五类工具,两个特征定位——"调用方向(谁发起)+ 作用对象(作用于什么)":感知/执行/协作由 Agent 主动调用;事件触发与用户沟通依赖异步运行时。
ACI 原则——工具应对应 Agent 的目标而非底层 API 操作;默认通用优于专用,仅在安全权限、参数复杂、使用频率极高、平台差异四种情况退回专用工具。
工具描述的核心是"什么时候用"——边界条件(做不到什么)往往比能力描述更重要;附 1–5 个真实调用示例可把准确率从约 72% 提升到 90%。
参数传递必须保真——模型感知到的世界与工具操作的世界之间不能存在系统性偏差(静默转换、静默注入都是反模式)。
两条分发渠道——MCP 协议统一专用工具接入;Skill Hub 用注册表分发 SKILL.md;第三方能力带来投毒、劫持、遮蔽三类风险。
工具规模化三台阶——层次化组织与按需加载 → 主动工具发现 → Skills 渐进式披露("把选哪个工具变成查哪条资料")。
npx skills add 命令安装,常驻上下文仅 name+description| 案例 / 数据 | 要点 |
|---|---|
| Cursor 弯引号事故 | 参数层把中文弯引号转成直引号,old_string 匹配失败——参数保真性反例 |
| 工具定义膨胀 | 仅 5 个 MCP 服务器即可引入数万 token 工具定义,200K 窗口未开对话已占近三成 |
| Anthropic 检索式预筛选 | Opus 4 工具使用基准准确率 49% → 74%;MCP-Zero 在约 2800 个工具上节省约 98% token |
| 工具描述附示例 | 准确率约 72% → 90% |
| Sidecar 审查 | 轻量审查通常在数百毫秒内完成,与主模型流式输出并行 |