介绍
这一章是整本书的"地图":先弄清人工智能、机器学习、深度学习的关系,再认识三大学习范式——监督学习(带答案学)、无监督学习(没答案找规律)、强化学习(靠奖励试错),最后聊聊绕不开的伦理问题。学完你就有了读全书的全局视角。
深度学习是什么?
人工智能(AI)想造出能模仿智能行为的系统。机器学习(Machine Learning)是 AI 的一个分支:把观测数据喂给数学模型,让它自己学会做决策。这几年它发展太快,现在大家说 AI 几乎就是指机器学习。
深度学习(Deep Learning)是机器学习里的一类:把深度神经网络应用到数据上。它目前是最强大实用的机器学习模型,就藏在你天天用的东西里:翻译(自然语言处理)、按内容搜图(计算机视觉)、语音助手(语音识别),背后都是它。
和"传统机器学习"比,最大的区别是特征从哪来。传统方法要人先挑出有用特征(如预测房价时选"面积、卧室数")喂给模型;深度网络则直接吃原始数据(像素、文字),自己层层提炼——网络越深,学到的越是抽象的整体概念。
监督学习:带着答案学习
想象一个模型预测房价:输入是一串数字(面积、卧室数等特征),输出是一个价格。训练时我们手里有一堆"输入 + 答案"的样本对,答案扮演教师(监督者)——这正是"监督学习"名字的由来。
按输出类型,监督学习分两大类:
- 回归(Regression):输出连续数值,如房价、分子的熔点和沸点。
- 分类(Classification):输出是类别。两类叫二元分类(评论是好评还是差评);多类叫多类别分类(音频属于哪种音乐、图片里是什么物体),输出一个"各类别概率"的向量。
那"模型"是什么?先当它是黑盒子:进一个向量,出一个向量。打开盒子,其实是一大堆方程——一个"方程家族"。所谓训练(拟合),就是在这个家族里挑一个最能描述数据的方程。深度神经网络就是其中能表达极其广泛关系的方程家族。
学做红烧肉:师傅给你配方和成品照片(输入 + 标准答案),你照着做、和成品对比、调整火候——每道菜都配了标准答案,这就是监督学习。将来来道没做过的菜(测试数据),也能照葫芦画瓢。
无监督学习:没有答案,只有数据
如果手里只有一堆数据、没有任何"标准答案"呢?这就叫无监督学习——没有标签,就没有"监督者"。它的目标不是学"输入→输出"的映射,而是描述或理解数据本身的结构:把相似的聚在一起、发现隐藏规律。
本书重点讲其中的生成式模型:它们学习数据的统计规律,能合成与训练数据"统计上难分真假"的新样本——以假乱真的猫图、建筑图、短篇故事;还能条件生成:在部分内容固定时补齐其余部分,如图像修复、文本补全。
泼盆冷水:文本生成模型看起来"像有智能",其实只掌握语言的统计规律,并不理解含义——做的只是生成"最可能的下文"。
用代码感受"没有答案的学习":把一堆无标签的点自动分成三组——模型自己发现了结构:
import numpy as np
# 无标签数据:三团点云(模拟没有标准答案的样本)
np.random.seed(0)
centers = np.array([[2, 2], [8, 8], [2, 8]])
data = centers + 0.6 * np.random.randn(150, 2)
# K 均值聚类:自动把数据分成 k 组,事先并不知道谁属于哪组
k = 3
cent = data[np.random.choice(len(data), k, replace=False)]
for _ in range(10):
dist = ((data[:, None] - cent[None]) ** 2).sum(axis=2) # 每个点到各中心的距离
label = dist.argmin(axis=1) # 归到最近的中心
cent = np.array([data[label == j].mean(axis=0) for j in range(k)])
print("自动学到的三个聚类中心:\n", cent)
整个过程没用任何标签,却把数据分成了三簇——这就是无监督学习的直觉。
强化学习:靠奖励试错
第三种范式叫强化学习(Reinforcement Learning),主角是一个代理(Agent):它生活在一个环境里,每步可以执行动作,动作会改变环境状态,还可能带来奖励。目标是让代理学会选择"平均能拿到高奖励"的动作。
这里有两个经典难题。一是时间性信用分配:奖励往往很久以后才来,很难说清该归功于哪一步动作。二是探索与利用的权衡:已有能拿不错奖励的策略,该继续用(利用),还是冒险试新动作(探索)?
书里给了两个例子。教类人机器人走路:障碍赛道设检查点,到达就给奖励;但走到检查点需要几十个关节动作,收到奖励时根本分不清谁有功,而且"侧躺滑行"也能前进拿奖励——虽远不如站立行走快,于是要在利用滑行和探索站立间选择。学下棋同理:对手回应不确定,若只在终局给一次胜负奖励,信用分配问题尤其严重。
深度学习怎么参与?一个办法是训练策略网络:用深度网络建立"状态 → 动作"的映射,如机器人从传感器读数到关节运动、下棋从棋盘局面到走法。
强化学习像训小狗:做对动作给零食(奖励),做错没有。小狗不知道"坐下"和零食的因果,只能反复试探、记住哪些动作能换来奖励——奖励归因全靠它自己摸索。
伦理:强大技术的另一面
深度学习将至少像电力、内燃机、晶体管或互联网一样改变世界,医疗、教育、交通等领域益处巨大。但工程师们常高估好处、低估伤害。书中列出五个关注点:
- 偏见与公平:系统从历史数据学习,就会复现历史偏见——用薪酬数据预测薪资,可能预测女性拿更低工资。
- 可解释性:深度网络可能有数十亿个参数,我们常常说不清它依据什么做出决定。
- 武器化:几乎所有重要技术都被用于战争,AI 也不会例外。
- 权力集中:公司投入 AI 是为了利润;自动化会冲击低薪岗位,影响不成比例。
- 存在风险:我们正在构建比人更有能力、更可扩展的系统,最坏情况下可能无法控制它。
清单远未列完——还有监控、虚假信息、隐私侵犯、欺诈,以及训练消耗的能源。每个学习、使用 AI 的人都该想一想:我该为什么样的组织工作?它是在认真治理风险,还是只在"伦理洗白"?