☰
深度学习数学基础完整指南:李宏毅深度学习教程的 6 个核心公式入门
2026/10/11 7:47:01 网站建设 项目流程

深度学习数学基础完整指南:李宏毅深度学习教程的 6 个核心公式入门

【免费下载链接】leedl-tutorial《李宏毅深度学习教程》(李宏毅老师推荐👍,苹果书🍎),PDF下载地址:https://github.com/datawhalechina/leedl-tutorial/releases项目地址: https://gitcode.com/GitHub_Trending/le/leedl-tutorial

《李宏毅深度学习教程》(leedl-tutorial)是基于台大李宏毅老师公开课整理的中文深度学习教材,覆盖从数学基础到前沿专题的完整知识体系,每章都配有可运行的 Notebook 作业,适合想系统搞懂神经网络、梯度下降与反向传播背后数学的新手。这篇文章按"公式地图"方式带练:每章从一个核心公式出发,先给公式,再讲直觉,最后落到项目里能动手验证的作业。想从零学反向传播怎么学、梯度下降入门教程怎么跑,照这个顺序走一遍即可。

一、网络凭什么能拟合函数:前向传播只有一个公式

全连接网络的前向传播可以压缩成一个式子:z = Wx + b,再经过激活a = σ(z),一层层"加权求和 + 非线性"堆叠起来,数学上就是函数复合。

加权求和加非线性,叠出近似能力

网络能"学会"复杂模式,靠的正是这种复合的表达能力:W 就是网络需要拧动的一组旋钮。在 HW2 分类作业目录 里,你会亲手写最简分类损失,观察参数变化时损失如何响应,先建立"调旋钮"的体感。

上图是三层网络的前向传播:输入 x 逐层线性变换、过激活函数,最后加权合成输出 y。

二、预测错了,网络怎么知道该调哪:反向传播是链式法则

有了损失 L,每个参数需要知道自己的"锅有多大",即偏导∂L/∂W。反向传播就是把链式法则倒着走一遍:从输出层把误差一层层传回去,每层只算自己这一段的贡献。

一次前向加一次反向,算完所有梯度

它的巧妙在于每个中间量只算一次,避免了重复劳动。建议对照 HW1 回归作业目录 逐项手推一遍,教材的数学基础章节(书籍目录)也给出了完整推导。

三、大雾中怎么下山:梯度下降与自适应学习率

有了梯度,更新就照固定套路走:θ ← θ − η·g,朝损失最陡的下坡方向迈一步。雾中下山的比喻:看不见山脚,只能摸脚下的坡度,每次更新就是"摸一下坡度,走一步"。

固定步长不够用:动量与自适应学习率

步长太大会跳过谷底,太小又磨蹭,固定步长还会在陡坡上反复震荡。动量法像跑步带惯性,RMSprop、Adam 这类自适应学习率则像"根据坡度平缓程度自动调步长"。

上图左侧是 RMSprop 的更新公式,右侧是二维损失曲面上的参数轨迹:在陡峭处步长自动变小,绕开了红圈里的震荡区。做梯度下降入门教程练习时,可以在 HW2 分类作业 里改学习率,亲眼看收敛快慢的变化。

四、认物到底要看多大范围:卷积是局部滑窗加权求和

全连接让每个像素都连到整张图,又贵又浪费。CNN 用一个小的滤波器做"滑窗加权求和":输出 = 核内元素 × 对应窗口元素之和,只提取局部特征,且同一套核参数在整张图上共享。

上图是两种不同滤波器滑过同一输入:每个 3×3 窗口算出一个数,拼成特征图。CNN 作业目录 会带你从零写卷积层并做数据增强,是验证本章数学的最佳位置。

五、模型开始背题了,用哪三种正则化

过拟合指训练集损失很低、测试集却崩了——网络把训练数据"背下来了"。数学工具箱里的对策有三类:

惩罚项、随机性与更多数据

  • L1/L2 正则化:给损失加惩罚项L = 数据项 + λ·惩罚项,让参数别长得太大;
  • Dropout:每次训练随机"关"掉一部分神经元,逼网络别依赖个别单位;
  • 数据增强:对样本做随机翻转、加噪,凭空多出训练多样性。

上图是增强思想的延伸:对测试样本做多种变换,把各版本的预测取平均,结果更稳,竞赛中常用。

六、把模型当分布生成器:GAN 的概率模型视角

生成模型换了个问法:不预测标签,而是学会数据本身的分布。GAN 的思路是:随机噪声 z 服从一个简单分布,让生成器把它映射到复杂的数据分布,再用判别器"以假乱真"地对抗训练;VAE 则把隐变量约束成概率分布。

上图展示了从简单分布学出复杂分布的过程,这就是概率模型的核心数学思想。想动手看效果的,去 GAN 作业目录 训练一个能画出动漫头像的生成器。

下一步行动指南

3 步走,完成数学基础的闭环:

  1. 拉环境:用git clone https://gitcode.com/GitHub_Trending/le/leedl-tutorial拿到仓库,先跑 Warmup 教程目录 熟悉 Colab 与 PyTorch;
  2. 看曲线:运行 HW1 回归作业,在 TensorBoard 里盯住训练与验证损失曲线——两条曲线分开走高就是过拟合,正好用上第五章的正则化;
  3. 升难度:按 HW2 分类 → HW3 CNN 的顺序推进,每次只改一个变量(学习率、正则强度),观察曲线变化,能预判效果才算真正吃透。

上图是回归作业中的真实监控界面:训练损失(上)与验证损失(下)同步下降且贴近,就是健康状态。

【免费下载链接】leedl-tutorial《李宏毅深度学习教程》(李宏毅老师推荐👍,苹果书🍎),PDF下载地址:https://github.com/datawhalechina/leedl-tutorial/releases项目地址: https://gitcode.com/GitHub_Trending/le/leedl-tutorial

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询