泰勒展开在深度学习中的妙用:Maths, CS AI Compendium函数近似篇精读
2026/9/15 13:39:41 网站建设 项目流程

泰勒展开在深度学习中的妙用:Maths, CS & AI Compendium函数近似篇精读

【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium

Maths, CS & AI Compendium是一本以"直觉优先"著称的开源数学/AI 教材,而 函数近似篇 正是全书的"理论地基"之一:它用短短一页讲透了泰勒展开(Taylor Series)如何从高中数学跃升为深度学习训练的数学引擎。本文带你精读这一章,看懂一阶泰勒展开背后的梯度下降、二阶泰勒展开背后的海森矩阵,以及"函数近似"思想在神经网络中的三个落点——全程不需要啃大部头教材。

📌 30 秒抓住核心:为什么"近似"这么重要

深度学习中几乎每个环节都在"近似":

  • 激活函数在局部用直线近似曲线;
  • 优化器用二次曲面近似损失函数;
  • 神经网络本身被证明可以近似任意连续函数(万能近似定理)。

而把这些统一起来的语言,就是泰勒展开。

一阶泰勒展开 = 梯度下降的数学本质

教材从最简单的**线性化(linearisation)**讲起:在点 $x = a$ 附近,用切线代替函数:

$$L(x) = f(a) + f'(a)(x - a)$$

这就是一阶泰勒近似:先站在已知的值 $f(a)$ 上,再按斜率乘以距离做修正。教材给出的例子很妙——在 $x=0$ 处线性化 $\sin(x)$,得到 $\sin(x) \approx x$,而 $\sin(0.1) = 0.0998\ldots$ 几乎分毫不差。

把这个思想搬到多参数场景(见 多元微积分篇):损失函数 $f(\theta)$ 在参数点附近的一阶近似就是"当前损失 + 梯度方向 × 步长"。梯度下降每一步做的,就是沿着损失函数的一阶泰勒近似往下走——这就是它统治深度学习训练的原因:只需一阶导数,每一步计算都很便宜。

二阶泰勒展开 = 牛顿法与海森矩阵

一阶近似只告诉你的"坡度",不知道"碗有多弯"。教材接着给出多元二阶泰勒展开(源码第 74 行):

$$f(\mathbf{x}) \approx f(\mathbf{a}) + \nabla f(\mathbf{a})^T (\mathbf{x} - \mathbf{a}) + \frac{1}{2} (\mathbf{x} - \mathbf{a})^T H(\mathbf{a}) (\mathbf{x} - \mathbf{a})$$

第二项是梯度(向量),第三项是海森矩阵$H$(二阶导数构成的矩阵,捕捉曲面弯曲程度)。

优化篇 紧接着揭示了这个公式的妙用(源码第 57 行):

多项式优化更新 $\mathbf{x}_{n+1} = \mathbf{x}_n - H^{-1} \nabla f(\mathbf{x}_n)$,本质是"用二次型近似函数,跳到这个二次型的最低点,再来一次"——这就是二阶泰勒近似在行动

实用洞察:二阶方法(牛顿法、BFGS)收敛极快,但计算海森矩阵代价是 $O(n^3)$。当模型有上亿参数时,这完全不划算——所以深度学习用 Adam 等一阶优化器称霸,而小问题的调参(如贝叶斯优化)则偏爱二阶/拟牛顿方法。选谁,取决于参数规模。

余项分析:怎么判断近似"够不够好"?

教材的一个亮点是用Lagrange 余项给出误差上界(源码第 68 行):

$$R_n(x) = \frac{f^{(n+1)}(c)}{(n+1)!}(x-a)^{n+1}$$

分母里 $(n+1)!$ 增长飞快,所以每多取一项,误差就以阶乘的速度塌缩。书中算例:$e^{0.5}$ 用 4 项泰勒展开得到 1.6458,真值是 1.6487——4 项就拿下三位小数精度。

另外两个关键词也值得记住:

  • 收敛半径:泰勒级数只在中心点附近一定范围内有效,超出即发散(可用比值判别法求);
  • 良态函数(well-behaved):连续、可导、光滑、有界——函数越"乖",所需项数越少。

🧠 这解释了深度学习里的一个经验法则:激活函数越光滑(如 GELU 相对 ReLU),梯度传播越平稳,训练越不容易崩。

函数近似思想在神经网络中的三个落点

教材明确把"神经网络"列为与多项式、样条、傅里叶级数并列的近似工具,并在 深度学习篇 展开:

1️⃣ 激活函数:局部线性化的艺术每层网络 $Wx + b$ 都是线性的,真正干活的是激活函数的"局部弯曲"。教材第 21 行 指出GELU 是对 ReLU 的光滑近似,是 GPT 和 BERT 的默认激活——它允许小幅负值通过,梯度曲线没有 ReLU 的"折角",正是一阶泰勒友好度更高的体现。

2️⃣ 万能近似定理教材第 29 行:单个隐藏层加足够多的神经元,就能以任意精度逼近紧集上的任意连续函数。深度不是用来"增加表达能力",而是用来节省参数——深度网络可以用指数级更少的参数表示同样的函数。

3️⃣ 反向传播 = 链式法则 + 局部线性化微积分篇 指出链式法则是反向传播的基础:每一层前向传播都在做"局部线性化",反向传播则把这些一阶近似沿链乘起来——泰勒展开在反向传播的每一步都在默默工作。

📚 延伸阅读与学习路径

建议按以下顺序阅读本仓库的"数学地基"章节:

顺序文件看点
101. differential calculus.md导数、链式法则(反向传播的根基)
204. function approximation.md泰勒展开、收敛半径、余项(本篇主角)
305. optimisation.md牛顿法、凸性、拉格朗日乘子
402. gradient machine learning.mdSGD/Adam、损失函数——泰勒思想的实战

💡学习小贴士:仓库的 MCP 服务 可让任意 AI 助手(Claude Code、Cursor、VS Code)把这本教材当作知识库,边读边问,效率翻倍。

一句话总结

泰勒展开不是大学数学的"应试工具",而是深度学习的通用语言:一阶项是梯度下降,二阶项是海森矩阵,余项分析教你量化误差,万能近似定理证明网络"为什么能学"。读完 函数近似篇 这一页,你再看任何优化器论文,都会多一层"原来如此"的通透感。

【免费下载链接】maths-cs-ai-compendiumBecome a cracked AI/ML researcher/engineer with this unconventional textbook covering maths, computing, and ML with intuition.项目地址: https://gitcode.com/GitHub_Trending/mat/maths-cs-ai-compendium

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询