首页 / 第 1 章

🧭 先画一张深度学习地图

学科透镜:结构化思维(MECE / 问题树) 难度:★☆☆☆☆ 本章 4 图 + 1 视频

新手学深度学习最大的坑,是"到处捡碎片":今天学个激活函数,明天看篇注意力机制,最后什么也没串起来。这一章我们先把地图画出来——用结构化思维里最锋利的武器 MECE(Mutually Exclusive, Collectively Exhaustive,不重不漏)把整个领域切成几块。地图在手,后面七章都是"按图索骥"。

✂️

本学科心法:先 MECE 切树,再逐叶深挖

《金字塔原理》的起点:把大问题切成互不重叠、合起来完整的子问题,画成问题树。树上的每一片叶子,都是一个可以单独攻克的"最小学习单元"。

1.1深度学习的问题树:六根树枝

把"我想学懂深度学习"从根上切成 6 块。这 6 块彼此独立(不重),合起来就是全部(不漏)。

我想学懂深度学习 ① 数据 喂什么 ② 模型 怎么算 ③ 损失 怎么算错 ④ 优化 怎么改 ⑤ 评估 怎么算好 ⑥ 工程 怎么跑起来 收集与清洗 去重、去噪、脱敏 标注 打标签、质检 划分 训练 / 验证 / 测试 网络结构 CNN / RNN / Transformer 参数量 宽度 × 深度 激活 / 归一化 ReLU、LayerNorm 分类损失 交叉熵 回归损失 MSE、MAE 正则项 L1/L2、约束先验 梯度下降 SGD / Adam 学习率 大小、调度、warmup 批大小 / Epoch 样本量与轮数 指标 准确率、F1、AUC 混淆矩阵 错在哪种类别 泛化测试 没见过的新数据 框架 PyTorch / TensorFlow 算力 GPU / 显存 / 分布式 实验管理 版本、日志、复现 记忆口诀:数模损优评工 —— 喂数据 → 搭模型 → 算损失 → 做优化 → 看评估 → 上工程 后面每一章,都在为这棵树的某根树枝补充细节
图 1-1 · 深度学习知识树。把"学懂深度学习"切成 6 个子问题,每个子问题再切 3 片叶子。注意 MECE 的威力:6 块之间没有重叠(学数据不用学损失),合起来又不缺任何一块(模型 + 数据 + 损失 + 优化 + 评估 + 工程 = 全部)。

1.2第二种切法:架构层 / 训练层 / 推理层

同一门学科,可以换坐标系再切一次。这次按"生命周期"竖切三层:模型先被搭出来(架构),再被学出来(训练),最后被用起来(推理)。

同一个模型的三种"姿态" 架构层 静态 · 长什么样 模型是一张"计算蓝图":层数、宽度、连接方式、激活函数—— 此时参数还是随机数,模型什么都不会。 例子:一个 4 层 MLP · 一个 12 层 Transformer · 一个 ResNet-50 训练层 动态 · 怎么学出来 用大量数据反复修正参数:前向算错 → 反向求梯度 → 更新权重。 这一层是"学习"真正发生的地方,也是最耗时、最烧钱的地方。 产出:一组学好的参数(权重文件),通常有几百 MB 到几百 GB 推理层 服务 · 怎么用起来 把学好的参数固定下来,对新输入做一次前向计算,返回结果。 要求从"准"变成"快 + 稳 + 便宜":延迟、吞吐、显存都要精打细算。 例子:GPT 聊天、人脸识别 API、手机上的离线小模型 先有架构,才能训练 训练好了,才能推理
图 1-2 · 三层架构。底层支撑上层:没有架构就没有训练,没有训练就没有推理。读论文时先问"这篇属于哪一层"——是改结构(架构层)、改训练方法(训练层),还是加速部署(推理层)?三秒定位。

1.3最小训练脚本:六行代码 = 六根树枝

知识树不是抽象画——任何一份真实的训练脚本,都是这六根树枝的直译。看懂这张对照图,你就同时看懂了代码和知识树。

一行代码 = 一根树枝,一个模块 = 一片叶子 1 dataset = load_data("cats.csv") 2 model = NeuralNet(hidden=64) 3 loss_fn = CrossEntropyLoss() 4 optim = Adam(model.parameters(), lr=1e-3) 5 for epoch in range(30): train_one_epoch(model, dataset) 6 acc = evaluate(model, test_set) # 六行代码,六个模块,一个训练 # 换掉其中任意一行 = 换一种做法 ① 数据模块 读入 + 清洗 + 划分 ② 模型模块 结构 + 参数量 ③ 损失模块 衡量错多少 ④ 优化模块 怎么更新参数 ⑤ 训练循环(系统) 重复 30 轮 ⑥ 评估模块 测试集上算分
图 1-3 · 代码与地图的对应。右侧六个模块的颜色与知识树六根树枝一一对应。从此以后,看到任何深度学习代码,你都能条件反射地把每一行归类到地图上。

1.4边界检查:什么算深度学习,什么不算

MECE 还要求"不漏"和"不重"——这逼我们把"邻居"也划清楚。这一节用一张包含图看深度学习与相邻领域的关系。

深度学习 ≠ 人工智能的全部 人工智能 AI(最外层) 机器学习 ML(中间层) 深度学习 多层神经网络 数据 模型 优化 评估 损失 工程 传统机器学习 决策树、SVM、KNN 数学 / 统计基础 线代、概率、最优化 系统工程 部署、运维、产品化 深度学习 = 机器学习的一个子集(用多层神经网络学表示);机器学习 = AI 的一个子集(从数据学规律)
图 1-4 · 边界检查。MECE 的"不漏"逼我们承认:深度学习外层还有机器学习、再外层还有 AI;而数学与系统工程是"支撑层"而不是"本体"。这样分类时你才不会把"框架选型"误当成深度学习核心。

▶配合视频:先看一遍"全貌"

这节视频用一小时给你"整棵树"的体感。看完再回来读第 2 章,你会知道每个细节该挂在哪根树枝上。

🎬 李宏毅《机器学习深度学习》合集(2026 最新 86 集)——按你自己的节奏选看 在 B 站打开 ↗

★本章小结

1
切树"学懂深度学习" → 6 根树枝:数据 / 模型 / 损失 / 优化 / 评估 / 工程,每根 3 片叶子。
2
换坐标系按生命周期再切一刀:架构层 → 训练层 → 推理层,与知识树交叉定位每个概念。
3
对照代码六行训练脚本就是六根树枝的直译,从此读代码 = 在地图上做标注。
4
画边界深度学习 ⊂ 机器学习 ⊂ AI;数学与工程是支撑,不是本体。
← 返回
首页 · 总览