深度学习天然是神经网络,但神经网络天然不是深度学习
前言:一本书与一个时代
2016年,AlphaGo击败李世石的消息引爆了全球对人工智能的关注。同年,一位复旦大学的年轻教授开始在网络上分享自己的深度学习讲义。五年后,这份讲义已成长为这本《神经网络与深度学习》——一本在GitHub上获得广泛好评、被无数AI学习者奉为经典的著作。
邱锡鹏教授在序言中引用了他导师吴立德教授的一句话,点出了深度学习的数学本质:“深度学习相当于函数逼近问题,所不同的是,这里用作基函数的是非线性的神经网络函数,而原来数学中用的则是多项式、三角多项式等线性组合。”
这段话看似抽象,实则道出了深度学习的核心优势——更强的表达能力。当你有更多的选择时,你有可能做出更好的选择。神经网络的非线性复杂性,正是其强大能力的根源,也是其难以解释的症结所在。
一、人工智能的三次浪潮与深度学习的位置
理解深度学习,需要先理解人工智能的发展脉络。书中将AI发展史清晰地划分为三个阶段:
推理期(1956-1960年代) :研究者们乐观地认为,只要编写足够的逻辑规则,机器就能拥有智能。结果发现,现实世界的复杂性远超预期。
知识期(1970-1980年代) :专家系统登上舞台,试图通过构建知识库来模拟专家思维。但很快人们意识到,很多知识我们根本不知道如何用规则描述——比如如何识别一张猫的照片。
学习期(1980年代至今) :与其告诉机器“是什么”,不如让机器自己从数据中学习。这正是机器学习、深度学习的时代。
书中引用了一个深刻观点:
“我们不能脱离具体问题来谈论算法的优劣,任何算法都有局限性。” 这就是“没有免费午餐定理”在AI领域的体现。
二、机器学习的三个基本要素
任何机器学习方法都离不开三个核心要素:模型、学习准则、优化算法。
模型决定了假设空间的大小。线性模型简单但表达有限,神经网络复杂但能力强大。通用近似定理告诉我们:只要有足够的神经元,一个两层神经网络可以逼近任何连续函数。 但定理只说“能做到”,没说“怎么做到”——这正是深度学习的核心挑战。
学习准则是模型的评价标准。书中详细介绍了多种损失函数,其中最值得关注的是交叉熵损失——它已经成为分类问题的标配。原因在于,交叉熵直接对应负对数似然,从概率角度天然契合分类任务。
优化算法是让模型“学会”的手段。梯度下降是最基础的方法,但深度学习的优化远比线性模型困难——非凸性、高维空间中的鞍点、梯度消失,都是让研究者头疼的问题。
书中用一句通俗的话解释了高维空间中为什么局部最小值不是主要问题:“在高维空间中,大部分驻点都是鞍点。” 也就是说,真正让训练停滞的不是掉进“盆地”底部,而是被困在“马鞍”上——在一个方向上是最低点,在另一个方向上是最高点。
三、神经网络三部曲:前馈、卷积、循环
前馈神经网络:深度学习的基石
前馈神经网络是最基础的结构,信息单向传播,没有反馈。它解决了一个关键问题——贡献度分配问题:在多层网络中,如何判断每个参数对最终结果的贡献?
答案是反向传播算法。书中详细推导了误差项如何从输出层反向传播到每一层:
这个公式的含义其实很直观:第l层神经元的误差,等于下一层误差的加权和,再乘以当前层激活函数的导数。 误差反向传播本质上是在问:如果最终结果错了,每个神经元该负多大责任?
卷积神经网络:让机器“看懂”世界
卷积神经网络有三个核心特性:局部连接、权重共享、汇聚。
为什么需要这些设计?书中的解释很精辟:“自然图像中的物体都具有局部不变性特征,比如尺度缩放、平移、旋转等操作不影响其语义信息。” 全连接网络无法有效提取这些特征,而卷积网络天然具备这种能力。
书中对感受野的解释通俗易懂:“一个神经元的感受野是指视网膜上的特定区域,只有这个区域内的刺激才能够激活该神经元。” 这就像我们看一张脸时,每个视觉神经元只负责一小块区域的信息。
LeNet-5是卷积网络的鼻祖,用于手写数字识别;AlexNet是第一个现代深度卷积网络,开启了深度学习的爆发期;残差网络通过“直连边”解决了梯度消失问题,让网络可以深达上百层。
书中对残差网络的解释简洁明了:“非线性单元去近似残差函数,比近似原始目标函数更容易。” 这就好比你要画一条复杂的曲线,与其直接画出来,不如画一条直线再加上微小的修正——后者容易得多。
循环神经网络:让机器拥有“记忆”
如果说前馈网络处理的是“静态”数据,循环网络处理的就是“动态”序列。语音、文本、时间序列,都需要循环网络来处理。
简单循环网络存在一个致命问题:长程依赖。当序列很长时,梯度要么爆炸要么消失,网络无法记住很久以前的信息。
LSTM(长短期记忆网络)通过门控机制解决了这个问题。书中用了一个生动的比喻:“记忆单元c中保存信息的生命周期要长于短期记忆h,但又远远短于长期记忆,因此称为长短期记忆。”
忘记门、输入门、输出门分别控制“忘什么”“记什么”“输出什么”。这个设计让LSTM能够在数百步前保留有用信息,成为序列建模的事实标准。
四、优化与正则化:训练的艺术
训练神经网络远比理论上复杂。书中从优化和正则化两个维度展开,揭示了让深度学习“工作”的关键技巧。
优化的难点
深度学习的损失函数是一个非凸函数,且参数空间是高维的。书中的分析很透彻:“在高维空间中,局部最小值要求在每一维度上都是最低点,这种概率非常低。” 所以,鞍点才是真正的敌人。
如何逃离鞍点?随机梯度下降通过在梯度方向上引入随机性,可以有效逃离。这也解释了为什么小批量训练比全批量训练效果更好——随机性本身就是一种“逃生机制”。
学习率调整的艺术
学习率是深度学习中最重要的超参数。书中的建议很实用:
- • 学习率预热:初始几轮使用小学习率,等梯度稳定后再恢复到正常值
- • 周期性学习率调整:让学习率周期性地增大,帮助模型逃离尖锐最小值
- • 自适应方法:AdaGrad、RMSprop、Adam等算法为每个参数分别调整学习率
Adam结合了动量法和RMSprop的优点,已经成为深度学习优化的默认选择。
正则化:对抗过拟合
神经网络的强大拟合能力是一把双刃剑——它既能学到规律,也能“记住”噪声。
丢弃法(Dropout)是最具创意的正则化方法之一。书中给出了两个有趣的解释:
从集成学习角度看:“每做一次丢弃,相当于从原始网络中采样得到一个子网络。最终的网络可以近似看作集成了指数级个不同网络的组合模型。”
从贝叶斯角度看:丢弃法相当于对网络参数进行采样,是一种近似贝叶斯学习。
批量归一化则从另一个角度解决问题——让每层的输入分布保持稳定,避免“内部协变量偏移”。书中引用了最新的研究观点:“其主要优点不是解决内部协变量偏移,而是归一化会导致更平滑的优化地形。”
五、注意力机制:从“死记硬背”到“按需查阅”
传统的编码器-解码器模型试图将所有信息压缩到一个固定向量中,这就像要求学生把整本教科书的内容都记住——既不现实也不合理。
注意力机制改变了这一范式。书中用阅读理解任务来说明:
“提出的问题只和段落中的一两个句子相关,其余部分都是无关的。为了减小神经网络的计算负担,只需要把相关的片段挑选出来让后续的神经网络来处理。”
注意力机制的核心思想是:给定一个查询,在所有信息上计算一个“注意力分布”,然后根据这个分布来加权求和。 这就像我们在阅读时,根据问题来“扫描”文章,只关注相关的部分。
自注意力模型更进一步——让序列中的每个元素都关注其他所有元素,动态生成连接权重。与全连接网络不同,自注意力的权重不是固定的,而是根据输入动态计算,因此可以处理变长序列。
Transformer模型完全基于自注意力,抛弃了循环和卷积,成为当前自然语言处理的主流架构。
六、生成模型:让AI学会“创造”
如果说分类和识别是AI的“理解”能力,生成就是AI的“创造”能力。
变分自编码器巧妙地将神经网络引入概率图模型。它用“推断网络”来近似后验分布,用“生成网络”来重构数据。书中用一个形象的比喻:“推断网络可以看作编码器,生成网络可以看作解码器,但它们的输出是分布,而不是确定的编码。”
生成对抗网络开创了全新的范式——两个网络互相对抗,一个负责生成,一个负责判别。书中引用了费曼的名言:“我不能创造的东西,我就不了解。” 这恰好道出了生成模型的核心价值:能生成数据,才意味着真正理解了数据分布。
GAN的训练是一个“最小最大化游戏”,但书中也指出了其不稳定性:“当两个分布没有重叠时,它们之间的JS散度恒等于常数log2,生成网络的梯度为0。” 这就是为什么GAN训练困难——一旦判别器太强,生成器就学不到任何东西。
W-GAN用Wasserstein距离替代JS散度,解决了这个问题。书中形象地解释了Wasserstein距离:“搬运土堆的最小工作量。” 即使两个分布完全没有重叠,Wasserstein距离依然能反映它们的远近。
七、深度强化学习:在试错中成长
强化学习的核心是从交互中学习。与监督学习不同,强化学习不给出“正确”答案,只给一个延迟的奖励信号。
书中用了一个生动的比喻:“在大脑神经元中,多巴胺的释放机制和时序差分学习十分吻合。如果猴子获得比预期更多的果汁,多巴胺释放大增;如果没有喝到本来预期的果汁,多巴胺释放大减。” 强化学习正是基于同样的原理——用“预期回报”和“实际回报”的差异来更新策略。
深度Q网络(DQN)通过两个创新让强化学习变得可行:目标网络冻结(稳定学习目标)和经验回放(打破样本相关性)。
演员-评论员算法将策略学习和值函数学习结合起来,成为当前深度强化学习的主流框架。书中用了一个形象的比喻:“演员随机表演,评论员随机打分。通过不断学习,评论员的评分越来越准,演员的动作越来越好。”
八、序列生成模型:从N元模型到Transformer
序列生成是自然语言处理的核心问题。N元模型通过马尔可夫假设简化问题,但数据稀疏问题始终存在。
深度序列模型用神经网络来估计条件概率。书中介绍了三种实现方式:简单平均、前馈神经网络、循环神经网络。其中循环神经网络最为灵活,可以处理变长序列。
序列生成面临三个核心问题:曝光偏差、训练目标不一致、计算效率。
曝光偏差问题是说:训练时模型看到的是真实数据,测试时看到的是自己生成的数据,两者分布不一致。计划采样通过在训练中混入生成数据来解决这个问题。
训练目标不一致是说:我们希望BLEU等指标高,但训练的损失函数是交叉熵。用强化学习直接优化评价指标成为一种解决方案。
计算效率问题源于Softmax归一化需要在整个词表上求和。层次化Softmax、重要性采样、噪声对比估计三种方法从不同角度加速了这一过程。
Transformer基于纯注意力机制,多头自注意力在多个投影空间中捕捉不同交互信息,成为当前最成功的序列到序列模型。
结语:深度学习的现在与未来
这本书的深度和广度令人叹服。从基础的线性模型到前沿的生成对抗网络,从数学公式到工程实践,邱锡鹏教授构建了一个完整的知识体系。
书中最后一句话意味深长:“虽然深度生成模型取得了巨大的成功,但是作为一种无监督模型,其主要的缺点是缺乏有效的客观评价。” 这指出了深度学习当前的根本局限——我们能做出惊人的结果,却难以解释为什么有效,也难以衡量无监督学习的真正进展。
深度学习天然是神经网络,但神经网络天然不是深度学习。理解这句话,就理解了这本书的灵魂。
无论你是AI领域的新手还是从业者,这本书都值得放在案头反复研读。