首页 / 第 1 章
🧭 先画一张深度学习地图
新手学深度学习最大的坑,是"到处捡碎片":今天学个激活函数,明天看篇注意力机制,最后什么也没串起来。这一章我们先把地图画出来——用结构化思维里最锋利的武器 MECE(Mutually Exclusive, Collectively Exhaustive,不重不漏)把整个领域切成几块。地图在手,后面七章都是"按图索骥"。
✂️
本学科心法:先 MECE 切树,再逐叶深挖
《金字塔原理》的起点:把大问题切成互不重叠、合起来完整的子问题,画成问题树。树上的每一片叶子,都是一个可以单独攻克的"最小学习单元"。
1.1深度学习的问题树:六根树枝
把"我想学懂深度学习"从根上切成 6 块。这 6 块彼此独立(不重),合起来就是全部(不漏)。
图 1-1 · 深度学习知识树。把"学懂深度学习"切成 6 个子问题,每个子问题再切 3 片叶子。注意 MECE 的威力:6 块之间没有重叠(学数据不用学损失),合起来又不缺任何一块(模型 + 数据 + 损失 + 优化 + 评估 + 工程 = 全部)。
- 为什么先切树?人的工作记忆只有 4±1 个槽位。直接面对"深度学习"是 100 个概念糊成一团;切成 6×3 的树,一次只看一片叶子。
- 树的检验标准:MECE 两个问题——"这块和那块有重叠吗?"(不重)"还有别的重要块吗?"(不漏)。比如有人会把"正则化"单列,其实它属于"损失"的扩展,这就是不重。
- 树的用武之地:遇到任何新概念(注意力、扩散模型、LoRA……),先问一句"它挂在哪根树枝上?"——立刻就知道它的定位。
1.2第二种切法:架构层 / 训练层 / 推理层
同一门学科,可以换坐标系再切一次。这次按"生命周期"竖切三层:模型先被搭出来(架构),再被学出来(训练),最后被用起来(推理)。
图 1-2 · 三层架构。底层支撑上层:没有架构就没有训练,没有训练就没有推理。读论文时先问"这篇属于哪一层"——是改结构(架构层)、改训练方法(训练层),还是加速部署(推理层)?三秒定位。
- 一次切法不够,就换坐标系:知识树按"组件"切(六类对象),三层按"生命周期"切(三个阶段)。两棵树的交叉,就是每个概念的精确坐标,例如"学习率" = 训练层 × 优化分支。
- 面试与求职视角:算法工程师主要泡在架构层 + 训练层,推理工程化则是"推理层"的专门职业——地图直接告诉你怎么选方向。
1.3最小训练脚本:六行代码 = 六根树枝
知识树不是抽象画——任何一份真实的训练脚本,都是这六根树枝的直译。看懂这张对照图,你就同时看懂了代码和知识树。
图 1-3 · 代码与地图的对应。右侧六个模块的颜色与知识树六根树枝一一对应。从此以后,看到任何深度学习代码,你都能条件反射地把每一行归类到地图上。
- 六行代码 = 整个领域的最小骨架:几乎所有深度学习项目——图像分类、语音识别、大模型微调——都是这个骨架换皮。
- 第 5 行是"系统":它不在六根树枝里,因为它是"重复"本身——这正是下一章系统思维的主角:一个循环(回路)。
1.4边界检查:什么算深度学习,什么不算
MECE 还要求"不漏"和"不重"——这逼我们把"邻居"也划清楚。这一节用一张包含图看深度学习与相邻领域的关系。
图 1-4 · 边界检查。MECE 的"不漏"逼我们承认:深度学习外层还有机器学习、再外层还有 AI;而数学与系统工程是"支撑层"而不是"本体"。这样分类时你才不会把"框架选型"误当成深度学习核心。
- 一句话边界:深度学习 = 用"多层神经网络"从数据中自动学出表示(特征)的机器学习方法。
- 为什么边界有用:当别人说"AI 会取代 X",你可以立刻判断他说的到底是 AI、ML 还是 DL——三者的能力范围差很远,这是批判性思维的第一课(第 4 章会放大讲)。
▶配合视频:先看一遍"全貌"
这节视频用一小时给你"整棵树"的体感。看完再回来读第 2 章,你会知道每个细节该挂在哪根树枝上。
🎬 李宏毅《机器学习深度学习》合集(2026 最新 86 集)——按你自己的节奏选看
在 B 站打开 ↗
★本章小结
1
切树"学懂深度学习" → 6 根树枝:数据 / 模型 / 损失 / 优化 / 评估 / 工程,每根 3 片叶子。
2
换坐标系按生命周期再切一刀:架构层 → 训练层 → 推理层,与知识树交叉定位每个概念。
3
对照代码六行训练脚本就是六根树枝的直译,从此读代码 = 在地图上做标注。
4
画边界深度学习 ⊂ 机器学习 ⊂ AI;数学与工程是支撑,不是本体。