AI大模型与数学第18课:全微分、多元链式法则
2026/8/5 12:22:13 网站建设 项目流程

第17课掌握偏导数:固定其余变量,单变量变化率。
本节课两大核心工具全微分、多元链式法则,是反向传播完整推导的核心骨架:

  1. 全微分:刻画多元函数所有参数同步微小变动带来的总损失变化;
  2. 多元链式法则:多层网络嵌套复合函数求导必备,解决“输入→权重→激活→损失”多层嵌套求偏导问题。

AI核心价值
3. 全微分对应单次迭代中,所有权重微小调整带来的总误差变化;
4. 多元链式法则 = 反向传播数学原型,没有链式法则无法推导多层神经网络梯度;
5. 打通单层偏导到多层网络梯度传递的逻辑闭环。

前置基础:导数、一元链式求导、多元函数。
目标:看懂神经网络损失函数、梯度下降的底层数学。
开篇导入
一元函数 y=f(x),只有一个自变量,导数描述唯一的变化率。
但现实世界、AI模型几乎全是多元函数:
损失函数取决于几百万、上亿个权重参数;一个输出同时受几十上百个变量共同影响。
问题来了:很多变量同时在变,怎么单独看某一个变量带来的变化?
这就是偏导数要解决的问题。
什么是偏导数
定义人话:把其余所有变量全部固定不动,只允许其中一个变量发生微小变化,求这个方向上的变化率。
二元函数举例 z=f(x,y)
对 x 的偏导数:\displaystyle \frac{\partial f}{\partial x}
👉固定y不变,只让x动,求变化率。
对 y 的偏导数:\displaystyle \frac{\partial f}{\partial y}
👉固定x不变,只让y动,求变化率。
符号小提示:
偏导符号\partial,和一元导数d区分开,代表:还有别的变量被按住不动。
几何图像
想象一张三维曲面 z=f(x,y)。
1.求\frac{\partial f}{\partial x}:把y固定,相当于用一个竖直平面横向切曲面,切出来一条曲线;偏导数就是这条曲线的切线斜率。
2.求\frac{\partial f}{\partial y}:把x固定,纵向切曲面,得到另一条曲线,取切线斜率。
书稿金句:
偏导数,就是高维曲面,沿着某一个坐标轴方向上的局部斜率。
AI直观例子
损失函数 L(w_1,w_2),损失受权重w_1、w_2共同控制。
\frac{\partial L}{\partial w_1}:把w_2锁死不动,仅仅改动w_1,看损失上升还是下降。
梯度下降更新权重,靠的就是每一个权重对应的偏导数。
2.工具一:全微分
一元函数微分:dy = f’(x),dx
含义:自变量微小变化dx,带来输出y的近似改变量dy。
多元函数,每个变量都可以产生一份贡献。
二元函数全微分公式:
dz=\frac{\partial f}{\partial x}dx+\frac{\partial f}{\partial y}dy
人话解读:
z的总微小变化 = x变动带来的变化贡献 + y变动带来的变化贡献。
每个变量各自产生一份改变,全部直接相加。
拓展到n维(AI真实场景,上亿参数)
dL=\frac{\partial L}{\partial w_1}dw_1+\frac{\partial L}{\partial w_2}dw_2+\dots+\frac{\partial L}{\partial w_n}dw_n
关键理解:
全微分告诉我们,总变化量,是所有各个维度偏导数,分别乘各自微小扰动之后的总和。
神经网络做扰动分析、梯度、泰勒展开,根基就是全微分。
⚠️注意:全微分成立前提,函数需要足够光滑连续;如果曲面出现尖角、断裂,全微分失效。
3.工具二:多元链式法则(本课重中之重,神经网络反向传播的心脏)
回顾一元链式法则
y=f(u),\ u=g(x)
\frac{dy}{dx}=\frac{dy}{du}\cdot\frac{du}{dx}
多元情况复杂度上来:中间变量不止一个。
举标准模型:
z = f(u,v),而 u、v 又都是 x,y 的函数
u=u(x,y),\quad v=v(x,y)
求z对x的偏导:
\frac{\partial z}{\partial x}=
\frac{\partial z}{\partial u}\frac{\partial u}{\partial x}
+\frac{\partial z}{\partial v}\frac{\partial v}{\partial x}
人话翻译:
想要看x改变对z造成多大影响:
x先改变u,u再改变z;
同时x还改变v,v再改变z;
两条传播路径全部算出来,结果相加。
核心思想:所有可以传导过去的路径,全部算一遍,路径结果做加法。
这就是神经网络反向传播的数学本质。
误差Loss,顺着网络一层一层反向往回传导,每一层都跑一遍多元链式法则,算出每一个权重的偏导数。
AI大模型通俗类比
损失就像源头的水流。
误差要回流更新每一个权重;
一条误差可以通过多条通路传递到同一个参数;
多元链式法则,就是把每一条通路的贡献全部求和。
4、梯度概念自然引出(承上启下)
把全部偏导数打包成一个向量,就是梯度:
\nabla f=\left( \frac{\partial f}{\partial x},\frac{\partial f}{\partial y} \right)
梯度向量每一个分量,就是对应方向的偏导数。
梯度下降:沿着梯度反方向,更新全部参数。
一句话串逻辑:
偏导数=单个方向变化率;
全微分=把所有方向的微小贡献加总,得到总变化;
多元链式法则=处理变量层层嵌套,计算误差如何跨层传递。
5、易错点(绝大多数人踩坑)
1.求偏导,一定要记住:其余变量视作常数,直接当成数字对待。
2.多元链式法则不要漏项!有几条中间传递路径,就要有几项相加,不要直接照搬一元链式直接相乘。
3.\partial不是普通分数,不能随意约分消掉。
6、联系全书知识
1.一元导数:一维直线斜率;
2.偏导数:高维曲面,单一坐标轴方向的斜率;
3.梯度:把一堆偏导数打包成向量(高维空间中的一个箭头);
4.链式法则:处理嵌套复合关系,神经网络反向传播完全建立在此之上。
书稿金句:
一元导数看见一维世界的变化;
偏导数帮我们在万千纠缠的变量之中,按住其余变量,单独看清某一个变量带来的改变。
课后思考题

  1. 为什么神经网络反向传播离不开多元链式法则?
  2. 全微分中,每一项分别代表什么物理含义?
  3. 函数 z=f(x,y),如果x、y同时发生微小改变,总变化是否等于两个偏导数简单相加?

本节课我们搞懂了偏导数、全微分、多元链式法则,这正是神经网络反向传播的数学内核。
但偏导数只代表坐标轴方向的斜率。现实中,我们可以沿着曲面上任意方向前进,不一定非要沿着坐标轴。下一课《第18课:梯度与方向导数》,我们会揭晓:哪个方向下降最快,也就是梯度下降真正的底层原理。
思考题留在文中,欢迎在评论区写下你的理解。如果这篇文章帮你打通了多元微积分的认知,欢迎点赞收藏,订阅专栏,跟随这套体系看懂AI背后的数学。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询