🎯 Agent 的评估

搭建 Agent 评估的完整闭环——"什么算成功、任务从何来、由谁验证、分数如何转化为决策",把表现变成可比较、可复现的信号。它是模型后训练与自我进化的基石。

📷 10 张原书配图 🧪 14 个配套实验 ⭐ 难度:进阶 📚 第二部分 · 如何提升 Agent 能力
🎯 核心论点
1

评估对象是"模型+Harness"组合体——表现差时先分清是模型能力不足还是 Harness 设计缺陷:模型替换实验(只换模型)区分瓶颈归属,消融实验定位 Harness 内部贡献。

2

指标口径决定结论——Pass@k/Best@k 衡量能力上限("技术奇观"),Pass^k(连续 k 次全对)衡量业务可靠性;评估报告必须写清 k 次尝试的口径。

3

可重复评估环境五要素——数据集、环境状态、工具接口、评分标准、执行协议;人机交互型与工具调用型两类环境结构不同。

4

确定性验证器只能判对错、不能给原因——生产评估需沿"可机械验证程度"谱系右移,以 Rubric + LLM-as-a-Judge + 失败归因构成完整闭环。

5

分数差异可能只是抽样噪声——用配对分析(McNemar/配对 bootstrap)与多随机种子,分差超过噪声、配对成立且可复现,才值得切换模型。

6

评估驱动选型是持续过程——成本 = 模型推理 + 工具调用 + 基础设施;可观测性数据脱敏后回流为评估资产。

🗂️ 关键概念卡片

评估环境

能重复运行的"考试装置"五要素:数据集、环境状态、工具接口、评分标准、执行协议;同初始状态给出可比较结果

Pass@k / Best@k

试 k 次中一次成功即算过能力上限指标,Pass@k=1-(1-p)^k;连续得分取最好一次为 Best@k

Pass^k

连续 k 次一次都不能错业务可靠性指标,Pass^k=p^k,回答"能否稳定可靠交付"

渐进式信息透露

模拟用户按提问逐步透露信息把用户知识范围建模为 known_info 字段,Agent 只能靠提问引导获取,防答案被猜测

LLM-as-a-Judge

用语言模型按 Rubric 打分代替人工专家定评分标准、模型评判开放式任务;有长度偏差等局限,需配对与审计

Rubric 四准则

写好评分标准的四条纪律基于专家指导、全面覆盖(含陷阱)、按重要性加权(支持一票否决)、评价标准自包含

失败归因

定位轨迹中首个导致偏离的错误标出错误类别、首错步号与可复核证据,区分根因与连锁后果

轨迹前缀回归任务

冻结首错前状态只测一步决策答案定义为"可接受动作集合+禁止动作",比端到端回归成本更低

配对比较 / Elo

两两对决量化相对强弱统计基础是 Bradley-Terry 模型;匿名对决免绝对标准,交换顺序各评一次防位置偏差

统计显著性

判断分差是噪声还是真差SE≈√(p(1-p)/n);配对分析+3–5 个随机种子,多重比较收紧阈值

可观测性

借日志/指标/追踪推断系统行为Trace 为 span 树(OpenTelemetry/OpenInference);数据脱敏后沉淀为新用例与回归测试

仿真环境

让 Agent 反复练习、自动打分的虚拟操场评估转训练的桥梁;验证器即 RLVR 奖励函数;需可靠 reset 语义与高吞吐
🖼️ 原书配图详解
图 7-1

评估体系四环节(全章总览)

评估体系四环节
① 成功的定义(Pass@k/Pass^k)② 任务来源(公开基准/自建业务集/生产轨迹回流)③ 验证方式(确定性验证器→检查项→Rubric+LLM→配对比较)④ 结果运用 + 支撑设施(可观测性/内部评估/仿真环境)
两类评估环境结构
图 7-2 工具调用型(验证行动)与人机交互型(验证引导)两类评估环境结构对比
τ²-bench 双控环境
图 7-3 τ²-bench 双控环境——用户模拟器(known_info/task_instructions)、Agent、共享环境,四层检查按 reward_basis 聚合
验证方式谱系
图 7-4 验证方式谱系——确定性验证器 → 检查项清单 → Rubric+LLM 评判 → 配对比较,横轴为可机械验证程度
LLM-as-a-Judge 流水线
图 7-5 LLM-as-a-Judge 流水线——Agent 回答 + Rubric → 评判模型 → 分维度打分与理由
Elo 评分与配对比较
图 7-6 Elo 评分与配对比较——Chatbot Arena 匿名对决、Elo 更新公式、实时排行榜
可观测性技术栈
图 7-7 可观测性技术栈——执行追踪树(Trace/span)、成本/性能/质量监控仪表盘、闭环
Benchmark 到改进闭环
图 7-8 Benchmark 到改进闭环——①观察诊断→②假设→③分阶段实验→④成本-收益决策→⑤迭代
仿真保真度谱
图 7-9 仿真保真度谱——Mock API → MCP 沙盒 → AndroidWorld → Isaac Gym → RoboTwin2 → 真实世界
图 7-10

具身智能环境

OpenVLA 与 RoboTwin2
OpenVLA 与 RoboTwin2 具身智能环境——视觉-语言-动作模型架构 + 双臂操作仿真(支撑实验7-14)
📊 关键案例与数据
案例 / 数据要点
Pass@k vs Pass^k单次成功率 p=0.6、k=5 时:Pass@5≈99.0%,而 Pass^5≈7.8%——探索天花板与业务可靠性差异悬殊
GAIA 466 题Level 1/2/3:人类 93.9%/91.8%/87.3% vs GPT-4 30.3%/9.7%/0%——分层具诊断价值
SWE-bench Verified2294 个原始任务经 93 名开发者评估仅保留 500 个(淘汰 71%),评估成本下降约 80%
AndroidWorld 三轮实验加导航提示 25%→25%;换 UIAutomator 25%→100%;精简元素树 100%→100%(token 0.506×)
"做对了但说错了"τ²-bench 704 次运行失败 240 次,其中 80 次环境状态正确但信息告知错误
💬 金句摘录
评估的对象不应只是模型,而应是模型与 Harness 的组合体。
当一个度量指标变成优化目标时,它就不再是好的度量指标。(古德哈特定律)
提示写得更详细,也补不回 Agent 根本没有看到的信息。
获得一条信息和正确地将它用于当前决策是两种不同能力。
🧪 配套实验亮点
实验 7-1 τ²-bench 双控(★★)telecom 领域,失败归因
实验 7-3/7-4 Rubric 多维评估(★★)180 条真实轨迹,幻觉一票否决
实验 7-8 Elo 排行榜实现(★★)180 万条 Chatbot Arena 投票
实验 7-9 行动阈值对比(★★)GPT-5.6 vs Claude Sonnet 5
实验 7-13 AndroidWorld 复测(★★★)116 任务 × 5 种子 580 条 episode
← 上一章
🎙️ 第 6 章 交互:观察与动作空间的扩展