首页 / 第 6 章
🌀 Transformer 与涌现
前五章学的都是"单个模型怎么训练好"。这一章视角突变:复杂科学告诉我们,当大量简单单元按简单规则组织起来,系统会涌现出个体没有的性质——就像蚂蚁单只很蠢,蚁群却能建桥。Transformer 把这句话放大到了极致:几亿个"乘加+拐弯"的神经元、一个"互相看"的注意力机制,量变堆出了质变。本章拆开注意力、缩放定律和"涌现"这三件事。
🐜
本学科心法:整体 > 部分之和
《一般系统论》的一句话。复杂科学的四件套:自组织(没有中央指挥)、涌现(个体没有的性质)、幂律(规模与能力的标度关系)、反馈(行为塑造环境)。Transformer 四样全占。
6.1注意力机制:每个词都在"互相看"
Transformer 的核心不是神经元(还是老一套),而是连接方式:词与词之间动态建立"关注关系"。这符合复杂科学——系统行为由"关系"而非"零件"决定。
图 6-1 · 注意力 = 动态的关系。QKV 的直觉:Q 是"我想问什么",K 是"我能答什么"(匹配 Q·K 得相关度),V 是"我实际提供的信息"。相关度高的词,信息被多吸收。复杂科学视角:模型的能力不来自某个词,而来自词与词之间动态形成的关系网。
- 为什么叫"自"注意力:同一句话里的词互相看,不需要外部知识——这行文本自己给自己当上下文。
- 位置信息从哪来:注意力本身不分顺序("猫吃鱼"和"鱼吃猫"对称),所以 Transformer 要加"位置编码"告诉模型词的位置——这是它和 RNN 最大的不同(RNN 天然按顺序读)。
- 复杂度代价:两两互看是 O(n²):句子长一倍,计算多四倍。这就是为什么长文本很贵(第 7 章工程会算这笔账)。
6.2缩放定律:规模与能力之间的"幂律"
复杂科学的看家本领——标度律(Scaling Law):在双对数坐标里,loss 与规模呈直线关系。这是"为什么大模型值得做大"的科学依据。
图 6-2 · 缩放定律。OpenAI/DeepMind 的经典发现(Kaplan 等):在双对数坐标系中,测试损失与参数量、数据量、算力各呈直线关系。这让"造多大的模型、配多少数据"从赌博变成工程预算。
- 幂律 = "长尾"规律:投入翻 10 倍,收益只涨一小截——但永远有收益,所以大厂一路卷到千亿参数。
- Chinchilla 定律(数据均衡):参数量 × 训练数据量应大致同比例增长,大约"20 个 token 养 1 个参数"。参数太多数据太少 = 浪费。
6.3涌现阶梯:能力是"跳"出来的
损失曲线平滑下降(图 6-2),但能力曲线不是——有些能力小模型完全没有,跨过某个规模阈值后突然出现。这就是复杂科学最著名的"涌现"。
图 6-3 · 涌现阶梯。每上一级台阶,模型"会"的事情发生质变。复杂科学解释:个体(神经元)没有的能力,系统(大模型)有了——就像水分子没有"湿",但水的集合有。注意:涌现与任务相关,不是所有任务都涌现。
- 涌现 ≠ 玄学:它是在大量"简单规则 + 海量数据 + 规模"下的统计性自组织现象,有理论可以部分解释(信息瓶颈、机制稀疏性等),但远未完全解释——这是目前最活跃的研究前沿。
- 给你的实际意义:想复现某种能力,与其改结构,不如先堆规模和数据(缩放定律说这是最可预测的路);算力不够就用"蒸馏/量化"把大模型能力"压缩"给小模型(第 7 章)。
6.4自监督:让"数据自己出题"的训练回路
传统监督学习需要人工标注(贵、慢、少),大模型之所以能吞下整个互联网,靠的是自监督——把"预测下一个词"当考题,文本本身就是答案。
图 6-4 · 自监督回路。把第 3 章的反馈回路改装一下:监督学习用"人工标签"当答案,自监督用"文本自身"当答案。控制论视角:系统从自己的预测误差中学习,无需外部教师——这是自组织的机器形态。
- 预测 = 理解:"能预测下一个词"意味着模型编码了语言的结构和世界的常识——这是预训练(pre-training)的意义。
- 预训练 + 微调两步走:先用自监督在海量通用文本上"预训练"(学语言),再用少量带标签数据"微调"(学任务),兼顾通用与专业(呼应第 7 章工程流程)。
▶配合视频:Transformer 与注意力动画
图 6-1 是静态的,这支动画把 QKV 和注意力"动"起来给你看。另附一支注意力机制数学讲解。
🎬 《Transformer 最强动画讲解》—— 从零详解,通俗易懂版
在 B 站打开 ↗
- 想更抠数学,可看 《注意力机制到底在做什么》(B 站公开课)。
★本章小结
1
注意力Q 提问、K 应答、V 给料;两两互看 = 自注意力;动态关系网决定模型能力。
2
缩放定律双对数下的直线:loss 随规模平滑下降;参数量、数据量、算力要同步涨。
3
涌现能力跨过规模阈值突然出现;个体没有的性质,系统有了——复杂科学的核心。
4
自监督预测下一个词 = 数据自己出题;反馈回路 + 互联网文本 = 大模型的燃料。