首页 / 第 6 章

🌀 Transformer 与涌现

学科透镜:复杂科学 / 控制论(涌现 / 自组织 / 幂律) 难度:★★★★☆ 本章 4 图 + 1 视频

前五章学的都是"单个模型怎么训练好"。这一章视角突变:复杂科学告诉我们,当大量简单单元按简单规则组织起来,系统会涌现出个体没有的性质——就像蚂蚁单只很蠢,蚁群却能建桥。Transformer 把这句话放大到了极致:几亿个"乘加+拐弯"的神经元、一个"互相看"的注意力机制,量变堆出了质变。本章拆开注意力、缩放定律和"涌现"这三件事。

🐜

本学科心法:整体 > 部分之和

《一般系统论》的一句话。复杂科学的四件套:自组织(没有中央指挥)、涌现(个体没有的性质)、幂律(规模与能力的标度关系)、反馈(行为塑造环境)。Transformer 四样全占。

6.1注意力机制:每个词都在"互相看"

Transformer 的核心不是神经元(还是老一套),而是连接方式:词与词之间动态建立"关注关系"。这符合复杂科学——系统行为由"关系"而非"零件"决定。

自注意力:以"垫子"为查询,看每个词该听谁 Q 查询 Query:"垫子"想问:谁跟我有关? 猫 token 1 分数 0.12 在 token 2 分数 0.15 垫子(查询词) token 3 · 正在"看"别人 分数 0.55(最相关) 上 token 4 分数 0.18 怎么用分数? Softmax 把分数变成权重(和为 1) → 按权重把每个词的值 V 加权求和 输出:"垫子"的上下文向量 = 0.12·V猫 + 0.15·V在 + 0.55·V垫子 + 0.18·V上 主要吸取"自己"的信息,兼顾周围 → 理解位置 每个词都当一次"查询" → 整句两两互看 → 这叫自注意力(Self-Attention);"多头" = 多组 QKV 并行,各看各的方面
图 6-1 · 注意力 = 动态的关系。QKV 的直觉:Q 是"我想问什么",K 是"我能答什么"(匹配 Q·K 得相关度),V 是"我实际提供的信息"。相关度高的词,信息被多吸收。复杂科学视角:模型的能力不来自某个词,而来自词与词之间动态形成的关系网。

6.2缩放定律:规模与能力之间的"幂律"

复杂科学的看家本领——标度律(Scaling Law):在双对数坐标里,loss 与规模呈直线关系。这是"为什么大模型值得做大"的科学依据。

缩放定律:损失与规模在双对数下是直线(幂律) 规模(参数量 / 数据量 / 算力)→ 对数刻度 训练损失 → 对数刻度 参数量 ↑ 数据量 ↑ 算力 ↑ 三个震撼结论 ① 幂律:没有"拐点",规模越大   损失平滑下降(预测性强) ② 三者要同步涨:光加参数量,   数据跟不上,收益会打折 它解释了什么 为什么大厂疯狂堆算力? 因为"花钱买 loss 下降"是 一条可预测的直线—— 预算多少能降到多少,能算出来 注意:幂律说的是"下一个词的预测误差"平滑下降;而"能力"的涌现是另一回事(见 6.3)——误差连续,能力却可能"跳变"
图 6-2 · 缩放定律。OpenAI/DeepMind 的经典发现(Kaplan 等):在双对数坐标系中,测试损失与参数量、数据量、算力各呈直线关系。这让"造多大的模型、配多少数据"从赌博变成工程预算。

6.3涌现阶梯:能力是"跳"出来的

损失曲线平滑下降(图 6-2),但能力曲线不是——有些能力小模型完全没有,跨过某个规模阈值后突然出现。这就是复杂科学最著名的"涌现"。

规模阶梯:量变在哪一级堆出了质变? 10M 级(数百万参数) 词法、拼写、简单补全 —— "说话的能力" 百 M 级 语法正确、常识问答 —— "有条理地说话" 十亿级 推理、写代码、翻译 —— "会做事" 百亿级 思维链、少样本学习 —— "会思考" 千亿级+ 上下文学习、指令遵循 —— "涌现" 规模 ↑(参数量 + 数据量 + 算力) 涌现的定义:某个能力在小于某规模时完全不存在,跨过阈值后突然可用(能力曲线不连续)
图 6-3 · 涌现阶梯。每上一级台阶,模型"会"的事情发生质变。复杂科学解释:个体(神经元)没有的能力,系统(大模型)有了——就像水分子没有"湿",但水的集合有。注意:涌现与任务相关,不是所有任务都涌现。

6.4自监督:让"数据自己出题"的训练回路

传统监督学习需要人工标注(贵、慢、少),大模型之所以能吞下整个互联网,靠的是自监督——把"预测下一个词"当考题,文本本身就是答案。

两种"出题方式":人工出题 vs 数据自己出题 监督学习(要人工出题) 图片 (输入) "猫" (人工标签) 瓶颈:标签要人一个个标 → 数据贵、量小、易出错 适合:任务明确、样本可控的垂直场景 自监督(数据自己出题)✓ "猫 __ 垫子 上"(遮住一个词) 考题:预测被遮住的词 模型预测 → 对比真实答案 → 修正 (还是第 3 章那个反馈回路!) 互联网文本 = 免费无限的"题海" → 这是大模型能"读完全网"的根本 "预测下一个词"听起来很笨,但它逼模型学会:语法、事实、推理、世界观—— 因为"能预测" = "理解了规律"。这就是 GPT 的预训练:用自监督回路吸收海量文本
图 6-4 · 自监督回路。把第 3 章的反馈回路改装一下:监督学习用"人工标签"当答案,自监督用"文本自身"当答案。控制论视角:系统从自己的预测误差中学习,无需外部教师——这是自组织的机器形态。

▶配合视频:Transformer 与注意力动画

图 6-1 是静态的,这支动画把 QKV 和注意力"动"起来给你看。另附一支注意力机制数学讲解。

🎬 《Transformer 最强动画讲解》—— 从零详解,通俗易懂版 在 B 站打开 ↗

★本章小结

1
注意力Q 提问、K 应答、V 给料;两两互看 = 自注意力;动态关系网决定模型能力。
2
缩放定律双对数下的直线:loss 随规模平滑下降;参数量、数据量、算力要同步涨。
3
涌现能力跨过规模阈值突然出现;个体没有的性质,系统有了——复杂科学的核心。
4
自监督预测下一个词 = 数据自己出题;反馈回路 + 互联网文本 = 大模型的燃料。
← 上一章
⑤ 决策科学:超参数与实验决策