🧠 模型后训练

把能力沉淀进参数:讲透预训练 → Mid-training → SFT → RL 四阶段各自的机制与选择,以及两条主线——"SFT 记忆、RL 泛化"与"数据和环境比算法更重要"。

📷 18 张原书配图 + 原创全景图 🧪 19 个配套实验 ⭐ 难度:进阶(可选读) 📚 第二部分 · 如何提升 Agent 能力
模型后训练全景
🎯 核心论点
1

能力开发四环节各有分工——预训练打通用地基(预测下一个词);Mid-training 补领域知识与基础能力;SFT 固化格式/风格/流程协议;RL 最大化期望奖励、塑造可迁移策略。

2

SFT 与 RL 的本质区别在优化目标——SFT 最大化标注回答概率(逐 token 监督、mass-covering);RL 最大化期望奖励(mode-seeking、探索新策略)。

3

数据和环境比算法更重要——语料、示范、仿真环境与奖励决定成败;很多场景只要数据到位根本不需要做 RL。

4

上 RL 的两个前提——格式支持(输出可解析、奖励可计算)与能力支持(pass@1 低但 pass@k 随 k 上升说明有东西可放大)。

5

多轮 RL 的核心难题是信用分配——最终成败难以归因到某一步;奖励设计沿三轴展开:来源、时机、信息量。

6

当前瓶颈是样本效率与分布一致性——在轨蒸馏(On-Policy Distillation)把一条 rollout 变成逐 token 密集监督;sampler/trainer 数值失配会把 on-policy 悄悄变成 off-policy。

🗂️ 关键概念卡片

预训练

海量文本上"猜下一个词"学语言规律、世界知识、基本推理;最贵(数百万~数千万美元),能力的地基

Mid-training

在目标分布上继续预训练对文档/代码全部 token 算损失补知识;别名 CPT/DAPT/TAPT;混入通用数据控制遗忘

SFT

用"输入-输出"示范教模型怎么答数学上与预训练同任务,仅 loss masking 只算回答 token;固化协议性知识而非事实知识

RL

试错+奖惩调策略最大化期望奖励;擅长把"已有但概率低"的成功行为推高,不擅长从全零奖励创造新能力

SFT 记忆、RL 泛化

本章对照实验的概括SFT 过拟合示范,RL 学到可迁移策略;受数据/奖励/环境制约,非普适规律

LoRA

挂小补丁微调省钱低秩适配,参数仅 1%–5%;学习率约为全参的 10 倍;SFT 用 rank 64–256,RL 用 8–32

奖励设计

把任务目标变成学习信号二元奖励最简单但无过程信息;ORM 只判终局;PRM 逐步反馈缓解信用分配;RLVR 用测试/断言当奖励最可靠

GRPO / PPO

两种主流策略优化算法GRPO 用同一问题的多条 rollout 组内比较,免价值网络;PPO 训价值网络+裁剪,适合长轨迹细粒度信用分配

信用分配

判断哪一步贡献了最终结果多轮延迟奖励的核心难题(客服 10 轮好评归功于第 2 轮还是第 7 轮)

在轨蒸馏

学生采样、教师逐 token 监督On-Policy Distillation:学生决定走到哪,教师在其前缀上给完整 token 分布;数学任务步数约纯 RL 的 1/10

RLVP

奖励结果、惩罚路径R=O+βΦ;惩罚可验证违规动作、给可达子目标少量部分奖励
🖼️ 原书配图详解 · 从经典 RL 到预训练
RL Agent-环境交互循环
图 8-1 强化学习 Agent-环境交互循环——状态 → 动作 → 奖励 → 新状态闭环
MDP 示意图
图 8-2 MDP 示意图——寻宝游戏状态网格与 MDP 五元组 (S,A,P,R,γ)
Q-learning 网格世界
图 8-3 Q-learning 网格世界——Agent 探索路径与 Q 值逐步收敛
Q 值更新可视化
图 8-4 Q 值更新可视化——TD 误差计算、奖励向前传播
经典 RL 与现代 LLM Agent 对比
图 8-5 经典 RL 与现代 LLM Agent 对比——动作空间从原始动作到变长组合式
OpenAI 训练范式演进
图 8-6 OpenAI 训练范式演进——算法中心主义 → 环境重要性 → 先验觉醒三阶段
Q-learning 与 LLM Agent 架构对比
图 8-7 Q-learning 与 LLM Agent 在寻宝游戏中的架构对比(实验8-2)
预训练的下一个 Token 预测
图 8-8 预训练的下一个 Token 预测——输入前文 → 预测概率分布 → 与真实比较
VLM 架构
图 8-9 VLM 架构——视觉编码器 + 投影层 + 语言模型三组件(实验8-4)
SFT 流水线
图 8-10 SFT 流水线——数据准备 → 训练优化(最大化条件对数似然)→ 效果评估
🖼️ 原书配图详解 · SFT 与 RL 的关键对照
SFT 到 RL 两阶段流程
图 8-11 SFT→RL 两阶段流程——阶段一 SFT 固化格式(输出可解析)、阶段二 RL 塑形策略;说明为何不能跳过 SFT
GeneralPoints 实验架构
图 8-12 GeneralPoints 实验架构——GP-L/GP-VL 训练集与 OOD 测试集、SFT/RL 两路径、OOD 结果对比(RL 提升、SFT 下降)
GRPO 16 次 rollout
图 8-13 同一 SWE-bench 任务的 16 次 rollout、验证器评分与相对优势计算——GRPO 一次训练迭代四步
单轮 RL 与多轮 RL 对比
图 8-14 单轮 RL 与多轮 RL 对比——交互复杂度与奖励延迟差异
多轮交互中的信用分配
图 8-15 多轮交互中的信用分配——五步导航示例(最终 +10 归功于哪一步),过程奖励 vs 结果奖励对照
工具调用 RL 奖励循环
图 8-16 工具调用 RL 奖励循环——环境配置(MCP 沙盒 26 服务器/126 工具)→ Agent → 适配器层 → 训练框架(GRPO/PPO)
ReTool 交织文本-代码思考
图 8-17 ReTool 交织文本-代码思考与沙盒执行反馈循环(实验8-14)
AWorld-train MCP 沙盒训练架构
图 8-18 AWorld-train MCP 沙盒训练架构与工具生态(Web/文档/多媒体/代码/Excel/知识检索)
📊 关键案例与数据
案例 / 数据要点
GeneralPoints(实验8-11)视觉 OOD:RL +17.6%(23.6→41.2)而 SFT −9.9%——"SFT 记忆、RL 泛化"核心证据
SimpleVLA-RL(实验8-13)每任务仅一条演示 SFT 冷启动,RL 把成功率 17.3% → 91.7%,并发现示范中未出现的"推切"动作
ReTool(实验8-14)AIME 2024 从约 25% 提升到 67.0%;RL 训练时间是 SFT 的 200 倍以上(9 天 vs 1 小时)
RLVP(实验8-16)TerminalBench 违规次数 3.71 → 0.66 且成功率基本持平;miniF2F 达到 0.9 成功率所需迭代 7.0 → 4.4
Q-learning vs LLM Agent表格 Q-learning 约 10000 局(10 秒)才 100% 通关;LLM Agent 第一局 18 步通关——先验知识大幅压缩搜索空间
MiniMind(实验8-3)一亿参数消费级 GPU 全流程,总训练约 14 小时、约 34 美元——固定小预算下算法改进比堆规模更值
💬 金句摘录
预训练是"接受通识教育",Mid-training 是"集中研修专业教材",SFT 是"老师示范答题与表达规范",RL 是"自己下场做题、根据结果反复打磨"。
SFT 细致学习已有地图,RL 则可以拿着奖励这枚指南针探索地图外的候选路线。
数据和环境,比算法更重要。
不是算法 > 环境 > 先验,而是先验 > 环境 > 算法。
🧪 配套实验亮点
实验 8-3/8-4 MiniMind 预训练 + VLM(★★★)一亿参数全流程约 34 美元
实验 8-11 GeneralPoints 对照(★★★)SFT vs RL 记忆-泛化受控实验
实验 8-14 ReTool(★★★)代码解释器增强思考与自我纠错
实验 8-16 RLVP(★★★)"奖励结果、惩罚路径"落地
实验 8-17~8-19 问题案例→后训练全链路(★★★)DPO 修复 / 弯引号 SFT / 精确复制
← 上一章
🎯 第 7 章 Agent 的评估