首页 / 第 5 章
🎲 超参数与实验决策
训练一个模型,本质是在不确定下做一连串选择:学习率设多少?批大小多大?模型多深?训练多久?《思考,快与慢》告诉我们:人最容易在不确定下犯系统性错误(锚定、可得性、赌徒谬误)。本章把决策科学搬进炼丹房:把"碰运气"升级成"决策流程"——画决策树、算权衡、做预验(premortem)、用正确的搜索策略。
⚖️
本学科心法:决策 = 选项 × 概率 × 代价,不是直觉
决策科学把"感觉"翻译成"预期效用":每个超参数选择都有成功概率和资源代价。先算账,再动手;每次实验都记录,让数据替记忆说话(对抗确认偏误)。
5.1实验决策五步法:从"瞎试"到"流程"
一个严谨的深度学习实验,不是"调一调看看效果",而是走完五步的决策过程。
图 5-1 · 决策五步法。决策科学把"调参"变成"决策流程"。第 4 步预验是防呆神器:与其祈祷别失败,不如先假定失败、倒推原因。
5.2权衡矩阵:学习率 × 批大小
两个最常见的超参数不是独立转的旋钮,它们是"耦合"的。用 2×2 矩阵看四种组合的命运。
图 5-2 · 旋钮矩阵。决策科学的关键提醒:超参数是联合分布,不是独立变量。只看学习率不看批大小,就像只调方向盘不调油门。记住四格性格,起步选"精细慢炖",翻车先想到"摇滚过山车"。
5.3怎么找最优组合:三种搜索策略
决策定了"要动哪几个旋钮",接下来是怎么在参数空间里找好点。三种策略,预算相同,效率天差地别。
图 5-3 · 搜索策略。网格搜索整齐但浪费;随机搜索同预算下覆盖更广(维度高时尤其明显);贝叶斯优化用"已有结果"智能选下一个点,最省预算但要额外依赖库(如 Optuna)。预算紧张 → 随机;预算宽裕且想自动化 → 贝叶斯。
- 先粗后细原则:第一轮大范围粗搜(大步长),锁定有希望的区域,第二轮小范围细搜。不要第一轮就把预算烧在精细网格上。
- 每轮只改一个变量的陷阱(手动调参通病):超参数互相耦合(图 5-2),逐变量调容易反复横跳。用"成对扫描"或干脆交给搜索算法。
5.4预验(Premortem):先假装失败,再倒推原因
《侦察兵思维》与决策科学都推荐这个技巧:项目开始前,假设"它已经失败了",问"最可能败在哪?"——把失败提前想一遍,成功率翻倍。
图 5-4 · 预验追悼会。决策科学的"反直觉"技巧:不想成功,想失败。写下的六条死因中,只要预防住最致命的 2~3 条,项目成功率就大增。这就是把"不确定性"翻译成"可管理的风险清单"。
- 对抗乐观偏差:人类天生乐观(规划谬误),预验是给乐观踩刹车。
- 顺手做"基线":开工第一件事就是跑一个简单 baseline(比如线性模型),给后续所有实验一个参照系——这也是死因⑥的解药。
▶配合视频:SGD 到底在随机什么
3 分钟动画讲清"批大小"为什么影响训练——和本章权衡矩阵直接呼应。
🎬 《SGD 到底在"随机"啥?》3 分钟动画扒光随机梯度下降原理
在 B 站打开 ↗
★本章小结
1
流程化目标 → 选项 → 代价 → 预验 → 小试放大。先写决策,再烧 GPU。
2
记耦合学习率 × 批大小是联合旋钮:批大小翻倍,学习率通常也翻倍。
3
选策略预算有限用随机搜索;想自动化用贝叶斯(Optuna);先粗后细,别第一轮就精细网格。
4
做预验假装失败倒推死因,写成预防清单逐条打勾;先跑 baseline 建立参照系。