☰
12 · 逐层量化适配:让 MCU 跑更大模型的后续路线
2026/10/8 11:11:19 网站建设 项目流程

12 · 逐层量化适配:让 MCU 跑更大模型的后续路线

English version:en/12-layer-wise-adaptation.md

本篇对应源码:docs/layerwise_adaptation.md·tools/legacy/train_moe_qat.py·tools/legacy/train_moe.py

目标:讲清楚「逐层适配优化」这个后续研究方向——大参数模型在有限算力/显存下如何训练?
答案是逐层差异化适配,而非全局统一策略。本篇整理公理库中的数学底座,标注置信度。

定位:尚未进入正式技术点落地,是训练框架的后续方向。详细文档见
kestrel_mcu/docs/layerwise_adaptation.md。

一、问题定义:为什么要逐层

「运行大参数模型的关键」本质是三类硬约束:

约束表现逐层适配的应对
显存激活 + 优化器状态超出显存逐层冻结 / 梯度检查点(重算激活)
带宽每层权重读写受限逐层量化(敏感层保精度、不敏感层激进压缩)
收敛深层/浅层学习速率不同逐层学习率衰减(LLRD)

当前框架(train_moe.py/train_moe_qat.py)用的是全局统一的 λ 退火与量化。
逐层适配是把它推广为「每层独立 λ_m」。

二、公理库数学底座(按置信度,诚实标注)

底座一:λ 可加性分层分解律【confidence 0.72,consistent】

对任意 λ1, λ2 ∈ [0,1] 且 λ1+λ2 ≤ 1,两步复合result_λ2(result_λ1(x,y))等于
单步result_{λ1+λ2}(x,y)。

这是「逐层适配」最硬的合法性底座——全局 λ 过渡可被任意切分成多段、逐层推进,
数学等价。把全局 λ 退火拆成每层一个 λ_m,各自独立走过渡区间,不违反 SHS 体系。

底座二:SHS-T 万能扩展模板【confidence 0.99,最可靠】

M(λ) = (1-λ)·经典基态 A ⊕ λ·新基态 B

每一层的适配(量化/稀疏化/冻结)都是这个模板的一个实例M_m(λ_m)。
配合 SHS-3 连续可还原律(0.98)——逐层过渡也必须连续,禁止硬切。

底座三:Bregman 散度最优调度【confidence 0.65】

“minimum divergence path corresponds to optimal scheduling”

逐层适配的顺序不是任意的,应沿「累积 Bregman 散度最小」路径推进——
每步选散度增量最小的层先过渡。工程对应:按层敏感度排序做逐层量化/冻结。

底座四:tensor graph decomposition【confidence 0.72】

“Graph decomposition quality determines communication cost”

逐层/分块的通信成本由分解质量决定,为逐层切分提供「通信代价」优化维度。

底座五:Depth Phase-Density Axiom【confidence 0.464,⚠️ refuted】

λ_m = min(1, (min(π_m, π*) · d_m^α_m) · λ₁)

每层 λ_m 由「宽度 × 深度」决定。⚠️symbolic_validator: refuted,仅作启发式形式,
不可当可靠公式直接使用。

三、融合方案

把底座一、三组合成可落地的「逐层适配」框架(不依赖 refuted 的底座五):

全局: M(λ) = (1-λ)·经典 ⊕ λ·新 (SHS-T,0.99) 逐层: M_m(λ_m) = (1-λ_m)·经典_m ⊕ λ_m·新_m (λ 可加性,0.72) 调度: 顺序 = argmin 累积 Bregman 散度增量 (Bregman 最优调度,0.65) 约束: λ_m 连续过渡,禁止硬切 (SHS-3,0.98)

关键结论:逐层适配 = 全局 λ 退火的「逐层实例化」,合法性与最优顺序都有高置信度
底座支撑,缺的只是「λ_m 的具体赋值规则」(底座五是 refuted 的候选,需另立)。

四、落地路径(按优先级)

优先级方向说明依赖底座
高逐层量化不同层对 q4 敏感度不同,按敏感度分配位宽或 λ_q 速率一、三
高逐层学习率衰减(LLRD)底层小 lr、顶层大 lr,经典做法一
中逐层冻结训练后期逐步冻结底层、只训顶层,省显存一、三
中梯度检查点逐层重算激活换显存,大模型训练标配四
低逐层稀疏化每层独立 λ_s 过渡到 MoE一、三

五、与当前技术点的衔接

  • 技术点 2(λ_q 量化感知)当前是全模型统一 λ_q,逐层化后即「逐层量化」——
    最自然的第一步落地,只需把set_lam_q(qparams, lam_q)改为set_lam_q_per_layer(lam_q_dict)。
  • 逐层稀疏化可复用技术点 1-b(全量 MoE)的 λ 退火,改为每层独立退火。

六、待办 / 开放问题

  1. 新公理草稿:基于底座一 + 底座三推导「逐层适配公理」,替代 refuted 的 Depth 公式,写入 axiom_registry。
  2. 层敏感度度量:用 Bregman 散度量化每层 q4/稀疏化的 ppl 损失增量,作为排序依据。
  3. 最小验证:在 ffn_e=128 的 MoE 模型上做「逐层量化 vs 全模型量化」对比。

七、结论

公理库方向性支持逐层适配:λ 可加性分层分解律(0.72)是最硬合法性底座,
Bregman 最优调度(0.65)给顺序,SHS-T/SHS-3(0.99/0.98)给形式与约束。
缺一条专门公理——现成的 Depth Phase-Density(0.464)是 refuted,需基于高置信度底座另立。


对应源码

文件关键符号 / 位置支撑本文哪部分
docs/layerwise_adaptation.mdset_lam_q_per_layer逐层适配的数学底座与落地方案
tools/legacy/train_moe_qat.pyset_lam_q()、Q4Param全模型统一 λ_q 量化感知(逐层化起点)
tools/legacy/train_moe.pylambda_at()、set_lambda()全局统一 λ 退火(被逐层实例化)

《Kestrel-MCU 手记》· 全系列 28 篇:在 ESP32-P4 上从零训练并部署 32M~64M 参数 MoE 大模型(5.7~6.4 tok/s),源码、权重、训练脚本与全部文章开源可复现。

仓库:https://gitee.com/pei-xiaoguang/kestrel-llm-mcu · 觉得有用欢迎 Star

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询