首页 / 第 5 章

🎲 超参数与实验决策

学科透镜:决策科学 / 行为经济学 难度:★★★☆☆ 本章 4 图 + 1 视频

训练一个模型,本质是在不确定下做一连串选择:学习率设多少?批大小多大?模型多深?训练多久?《思考,快与慢》告诉我们:人最容易在不确定下犯系统性错误(锚定、可得性、赌徒谬误)。本章把决策科学搬进炼丹房:把"碰运气"升级成"决策流程"——画决策树、算权衡、做预验(premortem)、用正确的搜索策略。

⚖️

本学科心法:决策 = 选项 × 概率 × 代价,不是直觉

决策科学把"感觉"翻译成"预期效用":每个超参数选择都有成功概率和资源代价。先算账,再动手;每次实验都记录,让数据替记忆说话(对抗确认偏误)。

5.1实验决策五步法:从"瞎试"到"流程"

一个严谨的深度学习实验,不是"调一调看看效果",而是走完五步的决策过程。

决策五步:想清楚再做,做一次算一次 1 明确目标 要优化的指标 (验证集上的什么?) 预算:几天?几块 GPU? 2 列选项 哪些超参数值得动? 各自取值范围? 先只动 1~2 个,其余固定 3 估代价 每次实验 = 多少 GPU 时 × 电费 × 时间 算力是硬预算,不是无限的 4 做预验 假设已经失败,倒推 最可能的原因并预防 (图 5-4 展开) 5 小试 → 放大 小数据集先快速验证 趋势对了再全量跑 每次实验记日志(防遗忘) 一句话:先花 10 分钟把"要决策什么、代价多少、怎么防失败"写下来,胜过烧 10 小时 GPU 瞎试
图 5-1 · 决策五步法。决策科学把"调参"变成"决策流程"。第 4 步预验是防呆神器:与其祈祷别失败,不如先假定失败、倒推原因。

5.2权衡矩阵:学习率 × 批大小

两个最常见的超参数不是独立转的旋钮,它们是"耦合"的。用 2×2 矩阵看四种组合的命运。

旋钮矩阵:四种组合,四种性格 学习率小 η↓ 学习率大 η↑ 批大小大 ↑ 批大小小 ↓ 稳妥批量型 梯度方向准(噪声小),步子小 → 训练稳定,计算吞吐高 ⚠ 但可能泛化略差 (大 batch 常钻"尖锐最小值") 对策:加学习率 warmup 💥 翻车组合 大步子 + 准方向 = 可能一路冲过头 → 损失震荡,甚至发散成 NaN 要救:大幅降 lr 或加梯度裁剪 (除非配合 lr 调度器精心设计) 精细慢炖型 噪声大(方向抖)但泛化好 → 最稳的"保险配置",就是慢 新手起步推荐这一格 摇滚过山车型 方向抖 × 步子大 = 剧烈震荡 → 训练曲线心电图,难收敛 唯一用处:快速探路(粗搜阶段) 耦合规律:批大小翻 k 倍 → 学习率通常也翻 k 倍(linear scaling rule);动一个,另一个要跟着想
图 5-2 · 旋钮矩阵。决策科学的关键提醒:超参数是联合分布,不是独立变量。只看学习率不看批大小,就像只调方向盘不调油门。记住四格性格,起步选"精细慢炖",翻车先想到"摇滚过山车"。

5.3怎么找最优组合:三种搜索策略

决策定了"要动哪几个旋钮",接下来是怎么在参数空间里找好点。三种策略,预算相同,效率天差地别。

同样的预算,三种找法 网格搜索 Grid 25 次实验全跑—— 细看均匀,实则浪费(很多点没用) 随机搜索 Random ✓ 同样 25 次预算,随机撒点 覆盖维度更全——实践首选 贝叶斯优化(智能) 先粗后细:根据已有结果预测 "哪里最可能更好",集中火力(粉色区)
图 5-3 · 搜索策略。网格搜索整齐但浪费;随机搜索同预算下覆盖更广(维度高时尤其明显);贝叶斯优化用"已有结果"智能选下一个点,最省预算但要额外依赖库(如 Optuna)。预算紧张 → 随机;预算宽裕且想自动化 → 贝叶斯。

5.4预验(Premortem):先假装失败,再倒推原因

《侦察兵思维》与决策科学都推荐这个技巧:项目开始前,假设"它已经失败了",问"最可能败在哪?"——把失败提前想一遍,成功率翻倍。

预验:给未来的失败提前开"追悼会" 假设项目已失败 倒推:最可能死在哪儿? 死因①:数据崩了 标注错、样本少、分布偏 死因②:超参没调好 lr 太大发散 / 太小没收敛 死因③:算力爆预算 模型太大 / 训练太久烧钱 死因④:过拟合没防住 训练集满分,上线即翻车 死因⑤:需求变了 做出来没人用 / 指标不对 死因⑥:没有基线对比 不知道好没好,功劳说不清 对策:把每个死因写成一行"预防清单",开工前逐条打勾——预验 10 分钟,省下 10 天返工
图 5-4 · 预验追悼会。决策科学的"反直觉"技巧:不想成功,想失败。写下的六条死因中,只要预防住最致命的 2~3 条,项目成功率就大增。这就是把"不确定性"翻译成"可管理的风险清单"。

▶配合视频:SGD 到底在随机什么

3 分钟动画讲清"批大小"为什么影响训练——和本章权衡矩阵直接呼应。

🎬 《SGD 到底在"随机"啥?》3 分钟动画扒光随机梯度下降原理 在 B 站打开 ↗

★本章小结

1
流程化目标 → 选项 → 代价 → 预验 → 小试放大。先写决策,再烧 GPU。
2
记耦合学习率 × 批大小是联合旋钮:批大小翻倍,学习率通常也翻倍。
3
选策略预算有限用随机搜索;想自动化用贝叶斯(Optuna);先粗后细,别第一轮就精细网格。
4
做预验假装失败倒推死因,写成预防清单逐条打勾;先跑 baseline 建立参照系。
← 上一章
④ 批判性思维:给模型做体检