搭建 Agent 评估的完整闭环——"什么算成功、任务从何来、由谁验证、分数如何转化为决策",把表现变成可比较、可复现的信号。它是模型后训练与自我进化的基石。
评估对象是"模型+Harness"组合体——表现差时先分清是模型能力不足还是 Harness 设计缺陷:模型替换实验(只换模型)区分瓶颈归属,消融实验定位 Harness 内部贡献。
指标口径决定结论——Pass@k/Best@k 衡量能力上限("技术奇观"),Pass^k(连续 k 次全对)衡量业务可靠性;评估报告必须写清 k 次尝试的口径。
可重复评估环境五要素——数据集、环境状态、工具接口、评分标准、执行协议;人机交互型与工具调用型两类环境结构不同。
确定性验证器只能判对错、不能给原因——生产评估需沿"可机械验证程度"谱系右移,以 Rubric + LLM-as-a-Judge + 失败归因构成完整闭环。
分数差异可能只是抽样噪声——用配对分析(McNemar/配对 bootstrap)与多随机种子,分差超过噪声、配对成立且可复现,才值得切换模型。
评估驱动选型是持续过程——成本 = 模型推理 + 工具调用 + 基础设施;可观测性数据脱敏后回流为评估资产。
| 案例 / 数据 | 要点 |
|---|---|
| Pass@k vs Pass^k | 单次成功率 p=0.6、k=5 时:Pass@5≈99.0%,而 Pass^5≈7.8%——探索天花板与业务可靠性差异悬殊 |
| GAIA 466 题 | Level 1/2/3:人类 93.9%/91.8%/87.3% vs GPT-4 30.3%/9.7%/0%——分层具诊断价值 |
| SWE-bench Verified | 2294 个原始任务经 93 名开发者评估仅保留 500 个(淘汰 71%),评估成本下降约 80% |
| AndroidWorld 三轮实验 | 加导航提示 25%→25%;换 UIAutomator 25%→100%;精简元素树 100%→100%(token 0.506×) |
| "做对了但说错了" | τ²-bench 704 次运行失败 240 次,其中 80 次环境状态正确但信息告知错误 |