首页 / 第 2 章
🔬 神经元到底在算什么
"神经网络"这名字吓退了一半人——听起来像科幻。第一性原理的做法是:剥掉类比、剥掉术语、剥掉营销,问一句"最底层的事实到底是什么?"答案朴素得惊人:神经网络 = 一大堆"乘法、加法、再拐个弯"的嵌套。一个神经元不是大脑细胞,它就是一个会算数的小机器。本章把它的五脏六腑拆开给你看。
⚛️
本学科心法:如果不能简单讲清楚,就是还没懂
费曼工作法:把概念拆到"连外行都听得懂"的基本事实,再重新推起来。拆到不能再拆的那一层,就是第一性原理。
2.1先做一次"剥洋葱":从现实问题到数字
第一性原理的第一步:把所有语言包装剥掉,看最底层在算什么。
图 2-1 · 剥洋葱。从"猫"到"数字"到"概率",语言包装一层层剥掉,最后只剩乘法和加法。先记住这个结论,再看神经元内部。
2.2一个神经元的解剖:四步流水线
神经元 = 一台四步流水线小机器。名字再花哨("感知机""人工神经元"),内部就这四步。
图 2-2 · 神经元四步流水线。输入数字 → 加权求和(加偏置)→ 激活拐弯 → 输出。权重 w 和偏置 b 是"旋钮",训练就是在拧这些旋钮(第 3 章)。激活函数 f 是灵魂:没有它,多层网络就会塌缩成一层。
- 为什么必须有"拐弯"(激活函数)?因为"直线 + 直线"还是直线。没有激活函数,堆 100 层也等价于 1 层,学不了复杂东西。拐弯 = 引入非线性 = 引入表达能力。
- 激活函数长什么样:ReLU(负数归零,正数不变)最常用;Sigmoid 把任意数字压到 0~1,适合当概率;Softmax 把一组数字变成"加和为 1"的概率分布,分类输出用它。
- 偏置 b 的作用:让决策边界可以不经过原点——就像直线 y = kx + b 里的 b,负责上下平移。
2.3一个神经元能干什么:在平面上画一条线
用最朴素的二维例子看:猫和狗各有两个特征(毛长、体重),一个神经元 = 画一条直线把它们分开。
图 2-3 · 感知机画线。二维里,神经元是"一条直线";三维里是"一个平面";高维里是"一个超平面"。所谓深度学习,就是让无数这样的直线/平面互相叠加,拼出任意复杂的形状。
2.4把神经元叠起来:多层感知机(MLP)
第一性原理的最后一推:为什么"叠起来"就能从画直线升级到画任意形状?因为每一层都在"组合上一层的结果"。
图 2-4 · 堆叠的力量。上面是网络结构(怎么连),下面是它的表达能力(能画出多复杂的形状):神经元是"直线级",一层是"折线级",很多层是"任意形状级"。记住:网络只是一个"表达式",还没学——怎么让它学会,是第 3 章。
- MLP(多层感知机)就是"全连接层叠全连接层",是最朴素也最完整的神经网络,后面所有模型(CNN、Transformer)都是它的变体或进阶。
- "深"和"宽":层数多叫深(深度学习的"深"),每层节点多叫宽。深比宽更"会分层抽象":先学边缘 → 再学形状 → 再学部件 → 最后学"猫"。
- 第一性原理检验:现在再看到任何模型图,你已经能认出它的本质零件——全都是图 2-2 那个小机器。第 6 章讲 Transformer 时,你会发现它只是换了"连接方式"(注意力),零件还是那套。
▶配合视频:3Blue1Brown 的神经网络可视化
这大概是全网把"神经元在算什么"讲得最清楚的可视化,与本图 2-2 / 2-4 一一对应。
🎬 3Blue1Brown《人工智能》系列(含神经网络、反向传播、Transformer)
在 B 站打开 ↗
★本章小结
1
剥洋葱"识别猫"→ 像素数字 → 加权求和 → 概率。底层只有乘法和加法。
2
解剖神经元加权求和(+偏置)→ 激活拐弯 → 输出。w、b 是可拧的旋钮。
3
看能力边界一个神经元 = 一条决策线;只能切一刀,叠起来才能画任意形状。
4
背下定理万能近似:够宽的单层网络能逼近任何连续函数——"能表示"不等于"学得到"。