首页 / 第 2 章

🔬 神经元到底在算什么

学科透镜:第一性原理(回到不可再分的基本事实) 难度:★★☆☆☆ 本章 4 图 + 1 视频

"神经网络"这名字吓退了一半人——听起来像科幻。第一性原理的做法是:剥掉类比、剥掉术语、剥掉营销,问一句"最底层的事实到底是什么?"答案朴素得惊人:神经网络 = 一大堆"乘法、加法、再拐个弯"的嵌套。一个神经元不是大脑细胞,它就是一个会算数的小机器。本章把它的五脏六腑拆开给你看。

⚛️

本学科心法:如果不能简单讲清楚,就是还没懂

费曼工作法:把概念拆到"连外行都听得懂"的基本事实,再重新推起来。拆到不能再拆的那一层,就是第一性原理。

2.1先做一次"剥洋葱":从现实问题到数字

第一性原理的第一步:把所有语言包装剥掉,看最底层在算什么。

"识别猫"是怎么变成加减乘除的 现实问题 "这张图里有猫吗?" 语言 · 模糊 · 人类直觉 剥离① 像素 = 数字 一张 100×100 的图 = 10000 个 0~255 的数字 剥离② 加权求和 每个数字 × 一个权重, 再全部加起来(+偏置) 剥离③ 一个概率 0.87 → "是猫" 就一个数字 全程只有两类操作:乘法(数字×权重)和 加法(求和)——这就是第一性原理:底层没有魔法,只有算术 难点从来不是"算",而是"权重取什么值"——这正是第 3 章"训练"要解决的事
图 2-1 · 剥洋葱。从"猫"到"数字"到"概率",语言包装一层层剥掉,最后只剩乘法和加法。先记住这个结论,再看神经元内部。

2.2一个神经元的解剖:四步流水线

神经元 = 一台四步流水线小机器。名字再花哨("感知机""人工神经元"),内部就这四步。

神经元解剖:x 进来,y 出去 x₁ x₂ x₃ 输入数字 × w₁ × w₂ × w₃ 每条线上的权重 w 是"这道题有多重要" Σ + 偏置 b 步骤1:全部加权求和 z f(z) 激活 "拐弯"函数 例:ReLU(z)=max(0,z) 例:Sigmoid → 0~1 步骤2:拐个弯 a y 步骤3:输出 y = f( w₁x₁ + w₂x₂ + w₃x₃ + b ) 第一性原理结论 神经元 = 加权求和 + 一个拐弯 ① 每个输入 × 权重 ② 全部相加 + 偏置 ③ 激活函数拐弯 ④ 输出一个数字
图 2-2 · 神经元四步流水线。输入数字 → 加权求和(加偏置)→ 激活拐弯 → 输出。权重 w 和偏置 b 是"旋钮",训练就是在拧这些旋钮(第 3 章)。激活函数 f 是灵魂:没有它,多层网络就会塌缩成一层。

2.3一个神经元能干什么:在平面上画一条线

用最朴素的二维例子看:猫和狗各有两个特征(毛长、体重),一个神经元 = 画一条直线把它们分开。

一个神经元 = 一条决策线 毛的长度 → 体重 → w₁x + w₂y + b = 0 猫(毛短体轻) 狗(毛长体重) 线下方 → 输出 0(猫) 线上方 → 输出 1(狗) 局限:只能分"一刀切" 一条直线只能把平面分成两半 猫围在狗中间?一个神经元搞不定 → 解决办法:把神经元叠起来(下节) 关键直觉 权重 w = 线的斜率(朝向) 偏置 b = 线的平移(位置) 训练 = 调 w 和 b,让线"转对方向、 挪对位置"把两类点分开 (这就是第 3 章梯度下降的雏形)
图 2-3 · 感知机画线。二维里,神经元是"一条直线";三维里是"一个平面";高维里是"一个超平面"。所谓深度学习,就是让无数这样的直线/平面互相叠加,拼出任意复杂的形状。

2.4把神经元叠起来:多层感知机(MLP)

第一性原理的最后一推:为什么"叠起来"就能从画直线升级到画任意形状?因为每一层都在"组合上一层的结果"。

叠层 = 把直线拼成曲线,把曲线拼成任意形状 输入层 隐藏层 1 隐藏层 2 输出层 像素 猫? 狗? 每个圆圈 = 一个"加权求和 + 拐弯"的神经元(图 2-2);每条线 = 一个权重 w(要学的旋钮) "全连接" = 上一层每个神经元都连到下一层每个神经元 1 个神经元 一条直线,分成两半 一层神经元 几条直线拼成折线 / 凸形 很多层神经元 任意形状(万能近似) 万能近似定理(Universal Approximation Theorem) 只要隐藏层够宽,一个"单隐藏层"网络就能以任意精度逼近任何连续函数——不管形状多怪。 注意:定理保证"能表示",不保证"学得到"(要靠训练 + 数据)——这正是第 4 章批判性思维要打的预防针
图 2-4 · 堆叠的力量。上面是网络结构(怎么连),下面是它的表达能力(能画出多复杂的形状):神经元是"直线级",一层是"折线级",很多层是"任意形状级"。记住:网络只是一个"表达式",还没学——怎么让它学会,是第 3 章。

▶配合视频:3Blue1Brown 的神经网络可视化

这大概是全网把"神经元在算什么"讲得最清楚的可视化,与本图 2-2 / 2-4 一一对应。

🎬 3Blue1Brown《人工智能》系列(含神经网络、反向传播、Transformer) 在 B 站打开 ↗

★本章小结

1
剥洋葱"识别猫"→ 像素数字 → 加权求和 → 概率。底层只有乘法和加法。
2
解剖神经元加权求和(+偏置)→ 激活拐弯 → 输出。w、b 是可拧的旋钮。
3
看能力边界一个神经元 = 一条决策线;只能切一刀,叠起来才能画任意形状。
4
背下定理万能近似:够宽的单层网络能逼近任何连续函数——"能表示"不等于"学得到"。
← 上一章
① 先画一张深度学习地图