挑战前五章"Agent 与世界轮流行动"的默认前提:回合制是训练留下的假设,不是环境的性质。沿模态与触发时机两个维度扩展观察/动作空间——异步事件驱动、语音、Computer Use、机器人操作。
回合制是训练留下的假设——模型从训练语料学会"世界会等它",而真实环境在 Agent 思考时持续变化,需要事件驱动的异步架构。
观察/动作空间各有三维扩展方向——内容(前五章)、模态(语音/屏幕/传感器)、时机(世界主动推、动作可打断)。
"训练同步/部署异步"是根本矛盾——API 要求"工具调用后必须是工具结果",部署要求随时可打断;占位符等是权宜,根本解法是异步环境下的 RL 训练。
语音三范式演进——级联 → 端到端 Omni → 全双工;快慢分离让交互能力与智能上限分别演进。
Computer Use 瓶颈已转移——从"能否完成任务"转向操作效率与状态确认;视觉定位有三条路线,生态壁垒比技术更难。
四节共享同一控制骨架与一组原语——持续感知→判断→行动→观察反馈;唤醒、安全点、取消、抢占、快慢分离。
| 案例 / 数据 | 要点 |
|---|---|
| PineClaw 案例 | 代打电话需实时身份验证(OTP)、三方确认——Heartbeat 定时轮询延迟不可接受,引入 Channel 实时事件通道 |
| Photon-1 | 仅 3 万小时 H200 GPU 完成 computer use 世界模型预训练,把每帧压缩为离散潜在 token 自回归预测 |
| OSWorld-Human 效率研究 | 即使任务成功,Agent 操作步骤仍明显多于人类——"准确率达到人类水平,并不等于已经足够实用" |
| Pine AI 语音 Agent | 快慢思考分离架构在 τ³-Voice Leaderboard 登顶——解耦架构不天然落后于端到端模型 |