别被“数学”吓跑,这本书用恶魔、乒乓球和Excel,把深度学习讲透了
如果你关注人工智能,一定听过“深度学习”这个词。它让AlphaGo打败了围棋冠军,让自动驾驶成为可能,让手机能听懂你的话。但一翻开相关书籍,满眼的偏导数、矩阵、梯度下降,是不是瞬间头大?
别怕。今天要聊的这本《深度学习的数学》,就是专门为被数学吓跑的初学者准备的“救星”。作者涌井良幸和涌井贞美用最通俗的比喻、最直观的图示、甚至Excel实操,把深度学习的数学原理拆解得明明白白。
下面,我就带你一口气读懂这本书的精华——从生物神经元到卷积神经网络,全程不绕弯子,不堆公式(但保留最核心的逻辑),让你真正理解“神经网络到底怎么学东西”。
一、从“玫瑰花的难题”说起
书一开头就抛出一个扎心的问题:让计算机识别一朵玫瑰花,为什么这么难?
对于人眼,无论玫瑰是红是白,是含苞还是盛放,我们一眼就能认出来。但如果你试图用传统编程方式——把“玫瑰具有什么特征”写成规则教给计算机,你会发现根本写不完。形状太多变,颜色太丰富,光照、角度、遮挡……无穷无尽的例外。
这就是传统“人教导机器”型人工智能的致命伤:现实世界没有标准答案,规则无法穷举。
深度学习的思路截然相反:不教规则,只给数据,让机器自己学。你给神经网络看成千上万张玫瑰图片,它自己“总结”出玫瑰长什么样。这种“自学习”的能力,正是神经网络的核心魅力。
二、神经单元的数学“小模型”——加权输入 + 激活函数
书中从生物神经元讲起:树突接收信号,细胞体加工,轴突输出。但真正关键的,是数学家如何
抽象这个过程的。
一个神经单元(人工神经元)做的事情,就两步:
- 1. 把多个输入信号加权求和,再加上一个偏置
( z = w_1x_1 + w_2x_2 + ... + b ) - 2. 把总和 (z) 扔进一个“激活函数”,得到输出
( y = a(z) )
激活函数最常用的是 Sigmoid函数,它长这样:
[
\sigma(z)=\frac{1}{1+e^{-z}}
]
它的输出永远在0~1之间,光滑可导,而且形状像个“平滑的阶梯”。为啥要光滑?因为后面我们要求导,利用梯度下降法来学习参数。如果像最早的单位阶跃函数那样在0处断开,就没法求导了。
书中用了一个特别形象的比喻:“恶魔组织”。输入层的“手下”把信息传给隐藏层的“恶魔”,恶魔们各有喜好(权重不同),然后综合判断交给输出层的“老大”。这比枯燥的数学公式生动一百倍。
三、深度学习 = 多层“特征提取”的叠加
简单神经网络(一个隐藏层)可以解决一些简单问题,但面对复杂图像、语音,就需要多层隐藏层——这就是“深度”的含义。
但层数一多,参数(权重和偏置)数量暴涨。比如书中那个识别 (4\times3) 像素数字0/1的小网络,参数就有47个。如果换成 (100\times100) 的彩色图片,参数轻松上百万。如何高效地求出这些参数,是整个深度学习的核心工程问题。
四、核心武器:梯度下降法 + 误差反向传播法
这本书最精彩的部分,就是把两个最关键的数学工具讲得透透的。
1. 梯度下降法——像下山一样找最小值
神经网络的学习,本质上是让预测值与真实值之间的误差(代价函数)最小化。代价函数通常取平方误差的总和。
怎么找最小值?书中用“乒乓球下山”来比喻:你站在山坡上某个点,想知道哪里最低。最聪明的做法是沿着最陡的坡面往下滚,滚一小段,停住,再感受当前最陡的方向,继续滚。重复多次,就能到达山脚。
数学上,最陡方向就是梯度(偏导数组成的向量)的反方向。于是我们得到更新公式:
[
\Delta \mathbf{w} = -\eta \nabla C
]
其中 (\eta) 是学习率,控制每一步迈多大。学习率太小,走得慢;太大,可能直接跨过谷底。书中专门用Excel演示了这个过程,直观得令人感动。
2. 误差反向传播法——让链式法则“反向”飞驰
梯度下降法需要计算代价函数对每一个参数的偏导数。如果直接算,每一层都要对前面所有层求导,计算量爆炸。
误差反向传播法(BP)的伟大之处,就是把复杂的求导转化为从输出层向输入层的递推关系。它引入一个中间变量——神经单元误差 (\delta_j^l),表示第 (l) 层第 (j) 个神经元的加权输入对最终误差的“敏感度”。
然后,利用高数中的链式法则,可以推导出:
- • 输出层的 (\delta) 很容易由预测值与正解的差算出。
- • 前一层的 (\delta) 可以由后一层的 (\delta) 乘以权重再乘以激活函数的导数得到——信息从后往前传,这就是“反向传播”名字的由来。
书中把这个过程比喻成“多米诺骨牌”或“递推数列”,一旦你理解了数列的递推(已知首项,逐项推出后续),反向传播就是反过来——已知末项,反向推出前面的项。这种视角极大降低了理解门槛。
五、卷积神经网络——让“小恶魔”动起来
全书最后两章介绍了大名鼎鼎的卷积神经网络(CNN),这是图像识别领域的绝对主力。
CNN的思想,书中再次祭出“恶魔”升级版——活跃的小恶魔。这些小恶魔不再傻等数据,而是拿着一个小的“过滤器”(比如3×3像素块)在整个图像上滑动扫描,检查哪里与自己偏好的模式(比如一条斜线、一个拐角)相似。扫描结果形成一张特征映射,再经过池化(比如取2×2区域的最大值)压缩信息,最后交给输出层综合判断。
数学上,过滤器就是一组可学习的权重参数。卷积运算本质就是滤波器与图像局部区域的内积——内积越大,表示越相似。这正是向量相似度最自然的度量。
CNN比全连接网络优势明显:
- • 参数共享:同一个过滤器滑动整个图像,参数数量大幅减少。
- • 平移不变性:无论特征出现在图像哪个位置,都能被检测到。
- • 层次化特征:浅层识别边缘、角点,深层组合成更复杂的形状(如眼睛、嘴巴),再上层识别整个物体。
书中同样用Excel演示了CNN的训练过程,虽然实际应用中我们会用Python和GPU,但Excel的“可视化”对于理解底层机制无可替代。
六、Excel:笨拙但真诚的数学实验室
这本书有一个非常独特的设计——大量使用Excel示例。你可以在官网下载配套的.xlsx文件,亲自操作梯度下降法、BP算法、CNN的迭代过程。
有人可能会问:现在谁还用Excel做深度学习?没错,Excel算力极弱,但它的单元格、公式、图表能让你“看见”每一步数值变化,比黑盒的深度学习框架(如TensorFlow)透明得多。书中用Excel验证了所有核心算法,相当于手把手带你“手算”了一遍神经网络,这种扎实感是很多理论书给不了的。
七、总结:数学不难,难的是没人给你讲“为什么”
这本书最值得推荐的地方,不是它罗列了多少公式,而是它始终把数学工具和生物直觉、工程需求绑在一起讲。
- • 为什么需要偏置?为了去掉讨厌的负号,让式子更漂亮。
- • 为什么梯度下降有效?因为内积在方向相反时最小。
- • 为什么反向传播能避过“导数地狱”?因为递推关系式让计算机发挥擅长。
学好深度学习的数学,不是为了成为数学家,而是为了读懂模型的“脾气”——知道它为什么收敛慢,为什么过拟合,怎么调参才合理。
如果你正在入门AI,强烈建议把这本书放在案头。它不会让你变成调参侠,但会让你变成一个懂原理的实践者。
最后,用书里的一句玩笑收尾:
“人工智能的奇点可能在2045年,但理解它的数学,今天就可以。”
本文基于《深度学习的数学》([日]涌井良幸、涌井贞美 著)内容整理撰写,结合个人解读。
关注我,用最通俗的语言,拆解最硬核的技术。
关注微信公众号“人工智能产业链union”回复关键字“AI加油站186”获取下载地址。
【AI加油站】第八部:《模式识别(第四版)-模式识别与机器学习》(附下载)