🎙️ 交互:观察与动作空间的扩展

挑战前五章"Agent 与世界轮流行动"的默认前提:回合制是训练留下的假设,不是环境的性质。沿模态与触发时机两个维度扩展观察/动作空间——异步事件驱动、语音、Computer Use、机器人操作。

📷 14 张原书配图 🧪 13 个配套实验 ⭐ 难度:进阶 📚 第一部分 · 如何构建 Agent
🎯 核心论点
1

回合制是训练留下的假设——模型从训练语料学会"世界会等它",而真实环境在 Agent 思考时持续变化,需要事件驱动的异步架构。

2

观察/动作空间各有三维扩展方向——内容(前五章)、模态(语音/屏幕/传感器)、时机(世界主动推、动作可打断)。

3

"训练同步/部署异步"是根本矛盾——API 要求"工具调用后必须是工具结果",部署要求随时可打断;占位符等是权宜,根本解法是异步环境下的 RL 训练。

4

语音三范式演进——级联 → 端到端 Omni → 全双工;快慢分离让交互能力与智能上限分别演进。

5

Computer Use 瓶颈已转移——从"能否完成任务"转向操作效率与状态确认;视觉定位有三条路线,生态壁垒比技术更难。

6

四节共享同一控制骨架与一组原语——持续感知→判断→行动→观察反馈;唤醒、安全点、取消、抢占、快慢分离。

🗂️ 关键概念卡片

模态与触发时机

观察/动作的"形式"与"节奏"两维模态决定形式(文本/语音/屏幕/力矩),时机决定节奏(主动取/被动推)

事件驱动架构

世界主动推事件、到达即处理所有输入输出统一建模为事件流,由事件循环在安全点消费事件驱动 Agent

训练同步/部署异步

模型假设与真实部署的根本矛盾LLM 训练要求工具调用后下一条必须是结果,部署要求随时可打断、多任务并发

安全点

轨迹中可安全消费事件的边界事件只在每轮循环边界被消费;取消也在安全点检查,不强行掐断

取消/队列/并行

按紧急度选择的三种事件策略紧急事件提前制造安全点;常规事件排队批量追加;独立轻量查询另起并行循环

占位符

打断时修补同步格式的假结果为未完成工具生成"正在后台执行"的占位 tool result,保持 assistant/tool result 配对

级联/Omni/全双工

语音交互的三种范式级联=VAD→ASR→LLM→TTS 串行;Omni=原生音频按轮次;全双工=持续听说、重叠与打断

快慢分离

前台快模型交互、后台慢模型思考前台低延迟维持话头,后台负责推理与工具调用;替换后台即承接模型升级红利

视觉定位 Grounding

在截图中找到目标元素三条路线:SoM 视觉标注、DOM/Accessibility Tree 索引(把定位变选择题)、纯坐标预测

世界模型

动作结果预测器当前状态+候选动作→预测下一状态,供规划器比较候选、重规划或安全停止

动作分块

一次只生成一小段未来动作控制线程高频回放、模型后台准备下一段,隐藏推理延迟;平滑性与反应速度的取舍
🖼️ 原书配图详解 · 异步与事件驱动
事件驱动异步架构
图 6-1 事件驱动异步架构——事件源(Email/Timer/Webhook 等 on_* 事件)→ 事件队列 → Agent 处理流程
三种处理策略时间线
图 6-2 三种处理策略时间线——取消式(遇 interrupt 清空队列重新推理)、队列式、并行式
实验6-1 架构
图 6-3 实验 6-1 架构——Web/App、邮件、GitHub、定时器、Webhook 等事件源 → 事件队列 → Agent
同步训练范式 vs 异步部署
图 6-4 同步训练范式(Observation/Thinking/Action 严格配对)vs 异步部署现实——"训练同步/部署异步"根本矛盾
实验6-2 三个并行脚本
图 6-5 实验 6-2——三个并行脚本进度,查询后取消未超过 50% 的——并行工具、进度查询与条件取消
语音串行流水线
图 6-6 语音串行流水线——VAD(500-800ms)→ ASR(50-200ms)→ LLM → TTS 各模块典型延迟
🖼️ 原书配图详解 · 语音交互
延迟瀑布
图 6-7 延迟瀑布——VAD 等待、ASR 转录、LLM TTFT/生成、TTS 合成串行累积总响应时间
排队延迟曲线
图 6-8 排队延迟曲线——利用率 ρ 与总延迟的上升关系,生产环境排队进一步放大空载延迟
Omni 模型对比
图 6-9 Omni 模型对比——OpenAI Realtime(服务端 VAD+轮次检测)、Gemini Live 等方案架构
快/慢思考对比
图 6-10 快/慢思考对比——快思考 ~500ms vs 慢思考 ~8s 结论冲突 → 自相矛盾失信任
🖼️ 原书配图详解 · Computer Use
Computer Use 感知-思考-行动循环
图 6-11 Computer Use 感知-思考-行动循环——①截图(等待稳定)→②模型推理(截图+任务→动作)→③执行→④再截图
Computer Use 动作空间
图 6-12 Computer Use 动作空间——GUI 操作工具(鼠标/键盘/滚动/感知)、bash(120s 超时)、str_replace_editor
Set-of-Mark 与结构化索引
图 6-13 Set-of-Mark 与结构化索引——截图标注 [1]Search/[2]Submit + 对应元素文本列表——把"找按钮"变成"选编号"
分辨率匹配与双向坐标缩放
图 6-14 分辨率匹配与双向坐标缩放——实际屏幕 ↔ 训练分辨率,按宽高比选目标、坐标反向映射
📊 关键案例与数据
案例 / 数据要点
PineClaw 案例代打电话需实时身份验证(OTP)、三方确认——Heartbeat 定时轮询延迟不可接受,引入 Channel 实时事件通道
Photon-1仅 3 万小时 H200 GPU 完成 computer use 世界模型预训练,把每帧压缩为离散潜在 token 自回归预测
OSWorld-Human 效率研究即使任务成功,Agent 操作步骤仍明显多于人类——"准确率达到人类水平,并不等于已经足够实用"
Pine AI 语音 Agent快慢思考分离架构在 τ³-Voice Leaderboard 登顶——解耦架构不天然落后于端到端模型
💬 金句摘录
回合制是训练留下的假设,不是环境的性质。
真正的"主动服务"不仅需要 Agent 能定时检查事件,更需要事件能主动通知 Agent。
模型被训练为对最新的输入做出反应,而批量事件打破了这一假设。
准确率达到人类水平,并不等于已经足够实用。
🧪 配套实验亮点
实验 6-1 事件驱动邮件 Agent(★★★)多事件源统一队列全自动处理
实验 6-2 异步 Agent / Flux(★★★)打断取消、并行取消与状态查询
实验 6-7/6-8 Computer Use 双路径(★★)Anthropic 参考实现 vs 开放模型
实验 6-9~6-13 XLeRobot 五连实验(★★★)遥操作→理想上限→自主→策略→sim2real
← 上一章
💻 第 5 章 Coding Agent 与通用 Agent