深度学习入门站 · 理解深度学习
首页 › 第 1 章

介绍

深度学习是什么?一张 AI 全景图,认识监督/无监督/强化学习三大门派。
图 1-1:深度学习在人工智能中的位置与应用
图 1-1:深度学习在人工智能中的位置与应用

这一章是整本书的"地图":先弄清人工智能、机器学习、深度学习的关系,再认识三大学习范式——监督学习(带答案学)、无监督学习(没答案找规律)、强化学习(靠奖励试错),最后聊聊绕不开的伦理问题。学完你就有了读全书的全局视角。

深度学习是什么?

人工智能(AI)想造出能模仿智能行为的系统。机器学习(Machine Learning)是 AI 的一个分支:把观测数据喂给数学模型,让它自己学会做决策。这几年它发展太快,现在大家说 AI 几乎就是指机器学习。

深度学习(Deep Learning)是机器学习里的一类:把深度神经网络应用到数据上。它目前是最强大实用的机器学习模型,就藏在你天天用的东西里:翻译(自然语言处理)、按内容搜图(计算机视觉)、语音助手(语音识别),背后都是它。

和"传统机器学习"比,最大的区别是特征从哪来。传统方法要人先挑出有用特征(如预测房价时选"面积、卧室数")喂给模型;深度网络则直接吃原始数据(像素、文字),自己层层提炼——网络越深,学到的越是抽象的整体概念。

🧭
**一句话关系**:人工智能 ⊃ 机器学习 ⊃ 深度学习。"深度"指层数多,能层层递进自动学特征。

监督学习:带着答案学习

想象一个模型预测房价:输入是一串数字(面积、卧室数等特征),输出是一个价格。训练时我们手里有一堆"输入 + 答案"的样本对,答案扮演教师(监督者)——这正是"监督学习"名字的由来。

按输出类型,监督学习分两大类:

  • 回归(Regression):输出连续数值,如房价、分子的熔点和沸点。
  • 分类(Classification):输出是类别。两类叫二元分类(评论是好评还是差评);多类叫多类别分类(音频属于哪种音乐、图片里是什么物体),输出一个"各类别概率"的向量。

那"模型"是什么?先当它是黑盒子:进一个向量,出一个向量。打开盒子,其实是一大堆方程——一个"方程家族"。所谓训练(拟合),就是在这个家族里挑一个最能描述数据的方程。深度神经网络就是其中能表达极其广泛关系的方程家族。

🍳
生活类比
学做红烧肉:师傅给你配方和成品照片(输入 + 标准答案),你照着做、和成品对比、调整火候——每道菜都配了标准答案,这就是监督学习。将来来道没做过的菜(测试数据),也能照葫芦画瓢。

无监督学习:没有答案,只有数据

如果手里只有一堆数据、没有任何"标准答案"呢?这就叫无监督学习——没有标签,就没有"监督者"。它的目标不是学"输入→输出"的映射,而是描述或理解数据本身的结构:把相似的聚在一起、发现隐藏规律。

本书重点讲其中的生成式模型:它们学习数据的统计规律,能合成与训练数据"统计上难分真假"的新样本——以假乱真的猫图、建筑图、短篇故事;还能条件生成:在部分内容固定时补齐其余部分,如图像修复、文本补全。

泼盆冷水:文本生成模型看起来"像有智能",其实只掌握语言的统计规律,并不理解含义——做的只是生成"最可能的下文"。

用代码感受"没有答案的学习":把一堆无标签的点自动分成三组——模型自己发现了结构:

import numpy as np

# 无标签数据:三团点云(模拟没有标准答案的样本)
np.random.seed(0)
centers = np.array([[2, 2], [8, 8], [2, 8]])
data = centers + 0.6 * np.random.randn(150, 2)

# K 均值聚类:自动把数据分成 k 组,事先并不知道谁属于哪组
k = 3
cent = data[np.random.choice(len(data), k, replace=False)]
for _ in range(10):
    dist = ((data[:, None] - cent[None]) ** 2).sum(axis=2)  # 每个点到各中心的距离
    label = dist.argmin(axis=1)                             # 归到最近的中心
    cent = np.array([data[label == j].mean(axis=0) for j in range(k)])

print("自动学到的三个聚类中心:\n", cent)

整个过程没用任何标签,却把数据分成了三簇——这就是无监督学习的直觉。

强化学习:靠奖励试错

第三种范式叫强化学习(Reinforcement Learning),主角是一个代理(Agent):它生活在一个环境里,每步可以执行动作,动作会改变环境状态,还可能带来奖励。目标是让代理学会选择"平均能拿到高奖励"的动作。

这里有两个经典难题。一是时间性信用分配:奖励往往很久以后才来,很难说清该归功于哪一步动作。二是探索与利用的权衡:已有能拿不错奖励的策略,该继续用(利用),还是冒险试新动作(探索)?

书里给了两个例子。教类人机器人走路:障碍赛道设检查点,到达就给奖励;但走到检查点需要几十个关节动作,收到奖励时根本分不清谁有功,而且"侧躺滑行"也能前进拿奖励——虽远不如站立行走快,于是要在利用滑行和探索站立间选择。学下棋同理:对手回应不确定,若只在终局给一次胜负奖励,信用分配问题尤其严重。

深度学习怎么参与?一个办法是训练策略网络:用深度网络建立"状态 → 动作"的映射,如机器人从传感器读数到关节运动、下棋从棋盘局面到走法。

🐶
生活类比
强化学习像训小狗:做对动作给零食(奖励),做错没有。小狗不知道"坐下"和零食的因果,只能反复试探、记住哪些动作能换来奖励——奖励归因全靠它自己摸索。
💡
**三大范式一句话**:监督学习 = 带标准答案,学"输入→输出"映射;无监督学习 = 无答案,找结构、生成新样本;强化学习 = 靠"动作-奖励"试错学决策。三大范式的最前沿方法如今都依赖深度学习。

伦理:强大技术的另一面

深度学习将至少像电力、内燃机、晶体管或互联网一样改变世界,医疗、教育、交通等领域益处巨大。但工程师们常高估好处、低估伤害。书中列出五个关注点:

  • 偏见与公平:系统从历史数据学习,就会复现历史偏见——用薪酬数据预测薪资,可能预测女性拿更低工资。
  • 可解释性:深度网络可能有数十亿个参数,我们常常说不清它依据什么做出决定。
  • 武器化:几乎所有重要技术都被用于战争,AI 也不会例外。
  • 权力集中:公司投入 AI 是为了利润;自动化会冲击低薪岗位,影响不成比例。
  • 存在风险:我们正在构建比人更有能力、更可扩展的系统,最坏情况下可能无法控制它。

清单远未列完——还有监控、虚假信息、隐私侵犯、欺诈,以及训练消耗的能源。每个学习、使用 AI 的人都该想一想:我该为什么样的组织工作?它是在认真治理风险,还是只在"伦理洗白"?

⚠️
**算法是一面镜子**:你喂给它的数据里有什么偏见,它就会学出什么偏见。AI 的"客观"是假象——它的判断标准,来自我们给它的人类历史。

🎯 小测验

1. 用房子的面积、卧室数预测房价,属于哪类问题?
2. 手里只有一大堆没有标签的照片,想让模型自动把它们按内容分组,应该用哪种学习?
3. 学走路的机器人已经能靠"侧躺滑行"拿到奖励,但它仍可能尝试"站立行走"等新动作,这是在权衡什么?