把能力沉淀进参数:讲透预训练 → Mid-training → SFT → RL 四阶段各自的机制与选择,以及两条主线——"SFT 记忆、RL 泛化"与"数据和环境比算法更重要"。
能力开发四环节各有分工——预训练打通用地基(预测下一个词);Mid-training 补领域知识与基础能力;SFT 固化格式/风格/流程协议;RL 最大化期望奖励、塑造可迁移策略。
SFT 与 RL 的本质区别在优化目标——SFT 最大化标注回答概率(逐 token 监督、mass-covering);RL 最大化期望奖励(mode-seeking、探索新策略)。
数据和环境比算法更重要——语料、示范、仿真环境与奖励决定成败;很多场景只要数据到位根本不需要做 RL。
上 RL 的两个前提——格式支持(输出可解析、奖励可计算)与能力支持(pass@1 低但 pass@k 随 k 上升说明有东西可放大)。
多轮 RL 的核心难题是信用分配——最终成败难以归因到某一步;奖励设计沿三轴展开:来源、时机、信息量。
当前瓶颈是样本效率与分布一致性——在轨蒸馏(On-Policy Distillation)把一条 rollout 变成逐 token 密集监督;sampler/trainer 数值失配会把 on-policy 悄悄变成 off-policy。
| 案例 / 数据 | 要点 |
|---|---|
| GeneralPoints(实验8-11) | 视觉 OOD:RL +17.6%(23.6→41.2)而 SFT −9.9%——"SFT 记忆、RL 泛化"核心证据 |
| SimpleVLA-RL(实验8-13) | 每任务仅一条演示 SFT 冷启动,RL 把成功率 17.3% → 91.7%,并发现示范中未出现的"推切"动作 |
| ReTool(实验8-14) | AIME 2024 从约 25% 提升到 67.0%;RL 训练时间是 SFT 的 200 倍以上(9 天 vs 1 小时) |
| RLVP(实验8-16) | TerminalBench 违规次数 3.71 → 0.66 且成功率基本持平;miniF2F 达到 0.9 成功率所需迭代 7.0 → 4.4 |
| Q-learning vs LLM Agent | 表格 Q-learning 约 10000 局(10 秒)才 100% 通关;LLM Agent 第一局 18 步通关——先验知识大幅压缩搜索空间 |
| MiniMind(实验8-3) | 一亿参数消费级 GPU 全流程,总训练约 14 小时、约 34 美元——固定小预算下算法改进比堆规模更值 |