☰
LLM Internals 完全指南:从分词到注意力到推理优化,18个主题带你彻底拆解大模型内部
2026/10/11 15:15:28 网站建设 项目流程

【免费下载链接】llm-internals

Learn LLM internals step by step - from tokenization to attention to inference optimization.

项目地址:https://gitcode.com/gh_mirrors/ll/llm-internals
点击查看免费下载

LLM Internals是一个手把手教你学习大模型内部原理的开源教程项目,覆盖从Tokenization(分词)到Attention(注意力机制)再到LLM 推理优化的完整学习路径。它不堆砌代码,而是用一步步的数值例子把大模型"拆开给你看",非常适合想搞懂大模型内部的新手和普通开发者。

📌 这个项目是什么?

一句话概括:LLM Internals 是一个"大模型内部拆解"系列教程,由 Outcome School 创始人 Amit Shekhar 编写维护。

它的核心特点是:

  • 📖循序渐进:从"LLM 到底是什么"讲起,逐步深入到注意力数学、推理加速
  • 🔢数值例子驱动:每个主题都配 step-by-step 的数值演示,不靠背公式
  • 🧠面向理解而非调包:目标是让你真正明白 Transformer 每个组件在做什么
  • 🚀贴近生产:KV Cache、Flash Attention、连续批处理都是线上推理服务的核心技术

所有主题的总目录维护在 README.md 中,项目采用 Apache 2.0 协议开源,内容还在持续更新。

🧭 18 个主题学习路线总览

整个项目可以把主题归纳为4 大阶段、18 个核心主题,由浅入深:

阶段编号主题你会学到什么
一、基础篇1LLM 全景概览LLM、RAG、MCP、Agent、微调、量化的整体地图
2Tokenization 与 BPE大模型如何把文本切成 Token,BPE 算法逐步拆解
3Transformer 架构编码器/解码器、数据流、三大架构变体
二、注意力篇4注意力数学(Q、K、V)Q×Kᵀ、缩放、Softmax、加权和的完整数值推导
5因果掩码 Causal Masking如何阻止模型"偷看"未来的 Token
6RoPE 旋转位置编码用 2D 旋转数学注入相对位置信息的原理
三、训练篇7反向传播 Backpropagation链式法则、前向/反向传播、梯度下降更新权重
8交叉熵损失 Cross-Entropy语言模型训练最核心损失函数的数学与梯度
9前馈网络 FFNTransformer 每层中"膨胀-收缩"结构学什么
10归一化:BatchNorm vs LayerNorm vs RMSNorm三种归一化的区别,以及为什么现代 LLM 偏爱 RMSNorm
四、推理优化篇11KV Cache为什么只缓存 K 和 V,速度提升多少,内存代价几何
12Flash Attention分块 + 在线 Softmax,吃透 GPU 显存的注意力加速
13Paged Attention借鉴操作系统分页思想,解决 KV Cache 内存碎片
14Speculative Decoding 投机解码小模型打草稿 + 大模型验证,2~3 倍加速且零质量损失
15Continuous Batching 连续批处理"拼车"式调度让 GPU 全程满载
16Prompt Caching 提示词缓存精确前缀规则、TTL,AI 助手如何省成本
17Prefill vs Decode推理两大阶段的差异,TTFT/TPOT 等核心指标
18Mixture of Experts(MoE)路由器 + 专家 + 稀疏激活,大模型为何又强又省

📘 一、基础篇:先搭起大模型的地基

1. LLM 全景概览

入门第一课先回答"LLM 到底是什么",并顺带串起RAG(检索增强生成)、MCP、Agent、Fine-tuning(微调)、Quantization(量化)这几个高频概念,帮你建立整体坐标系。

2. Tokenization 与 BPE

大模型不认识字符,只认识 Token。这一主题回答三个问题:为什么要分词、怎么切才合理、以及Byte Pair Encoding(字节对编码)如何一步步把词表"训"出来,包括 BPE 遇到新文本时的处理逻辑。

3. Transformer 架构

把 Transformer 逐块解码:Tokenization、Embedding、位置编码、Multi-Head Attention、FFN、残差连接、Layer Normalization 各自负责什么,数据如何流经整个架构,以及 Encoder-only / Decoder-only / Encoder-Decoder 三种变体的取舍。

🧠 二、注意力篇:大模型真正的"大脑"

4. 注意力数学:Q、K、V

这是全项目最硬核的数值推导之一:从"词 → 向量"出发,构造Q(Query)、K(Key)、V(Value)矩阵,计算 Q×Kᵀ 得到注意力分数,再经过√dₖ 缩放、Softmax 归一化,最后与 V 加权求和。每个步骤都有具体数字,看完注意力机制不再"玄学"。

5. 因果掩码(Causal Masking)

生成文本时,当前词不能参考后面的词。这个主题用一个"看到未来 Token"的反例说明问题,再给出下三角掩码矩阵的实现方式,解释 GPT 这类自回归模型为何"只能往前看"。

6. RoPE 旋转位置编码

Transformer 本身不感知词序,RoPE 通过2D 旋转矩阵把位置信息"编码"进 Q 和 K,让点积天然携带相对位置信息。文章会讲清旧方案(可学习位置编码)的局限、RoPE 的核心思想和一个小数值例子。

📐 三、训练篇:模型是怎么学会"说话"的

7. 反向传播(Backpropagation)

神经网络学习的核心算法:从链式法则讲起,走一遍前向传播 → 计算损失 → 反向传播 → 梯度下降更新权重的完整流程,并用 Python 风格的小例子把梯度"算给你看"。

8. 交叉熵损失(Cross-Entropy Loss)

"我有 70% 把握这是猫"——模型预测的概率和真实答案差多少?交叉熵损失就是这个度量尺,它驱动着包括 GPT、BERT 在内的几乎所有现代 AI 模型训练。主题覆盖公式推导、为什么取负对数、语言模型场景下的用法及其梯度。

9. 前馈网络(FFN)

注意力负责"信息交互",FFN 负责"加工理解"。这个主题拆解 Transformer 每层中的Expand-then-Contract(先膨胀后收缩)结构、ReLU 等激活函数的作用,以及 FFN 到底"占了模型多少参数"——顺便引出 Mixture of Experts 的伏笔。

10. 归一化三兄弟:BatchNorm vs LayerNorm vs RMSNorm

深度网络为什么需要归一化?BatchNorm 和 LayerNorm 差在哪?为什么 Llama、Mistral、Qwen、DeepSeek 等现代大模型几乎都选RMSNorm?主题会用具体数值对比三者计算差异,并给出"何时用哪个"的实用建议。

🚀 四、推理优化篇:让大模型又快又省

这一篇直接对接生产环境的 LLM 推理优化,是普通用户感知最明显的部分(响应速度、服务成本)。

11. KV Cache:生成加速的第一把钥匙

LLM 逐 Token 生成时,历史 Token 的 K、V 会反复计算。KV Cache 把结果存下来复用,只缓存 K 和 V 而不缓存 Q 的原因、能快多少、以及"速度 vs 内存"的权衡,都会讲透。

12. Flash Attention:吃透 GPU 显存的注意力算法

标准注意力为什么慢?答案藏在 GPU 的 HBM 与 SRAM 层级里。Flash Attention 通过分块(Tiling)+ 在线 Softmax + 反向重计算把注意力计算"贴"在高速显存里,如今几乎每个现代 LLM 都在用。主题还会顺带介绍 Flash Attention 2 / 3 的演进。

13. Paged Attention:给 KV Cache 做"分页"

KV Cache 会浪费显存?Paged Attention 借鉴操作系统的虚拟内存分页思想,把注意力 KV 存储切成小页动态分配,并支持请求间共享,让同一张 GPU 服务更多用户。

14. Speculative Decoding 投机解码

小模型快速"打草稿",大模型批量"批改验证"——拒绝采样保证输出质量零损失,实测可带来2~3 倍生成加速。这是当下推理加速最热门的技巧之一。

15. Continuous Batching 连续批处理

静态批处理要"等最短的请求跑完"才放新请求,GPU 大量空转。连续批处理像"拼车"一样,每生成一步都可插入新请求、放走已完成请求,显著提升服务吞吐。

16. Prompt Caching 提示词缓存

AI 助手的系统提示往往很长且固定。Prompt Caching 按精确前缀规则缓存前缀计算结果,配合写缓存/读缓存与 TTL 机制,直接降低时延和成本。主题还会给出"什么内容值得放进缓存"的实战建议。

17. Prefill vs Decode:推理优化的两阶段地图

LLM 推理分Prefill(预填充,计算密集)和Decode(解码,内存带宽密集)两个阶段,KV Cache 是连接二者的桥梁。理解这个划分,才能对号入座地选优化手段,也才能真正看懂TTFT、TPOT、吞吐、端到端时延这些核心指标。

18. Mixture of Experts(MoE)混合专家

为什么有的模型参数量巨大却推理便宜?MoE 用路由器(Router)从众多专家中稀疏激活少数几个,把"大模型容量"和"小模型成本"兼得,支撑着今天许多最强 LLM。主题涵盖专家的本质、MoE 在 Transformer 中的位置、负载均衡与工程挑战。

🎁 加餐:进阶主题(持续更新中)

完成 18 个核心主题后,项目里还有一批进阶内容等你探索:

  • Grouped Query Attention(GQA):MHA / MQA / GQA 三者对比与"上训练"迁移方法
  • LoRA 低秩适配:不动主干、只训小矩阵的微调方案
  • Large Reasoning Models(LRM):会"先思考再回答"的推理大模型
  • RLHF:SFT → 奖励模型 → PPO 三阶段,把模型调得有用且安全
  • Decoding DeepSeek-V4:百万 Token 上下文、混合注意力、FP4 量化感知训练的前沿拆解
  • Prompt Injection 提示词注入:AI 应用安全必修课,含攻击演练与防御清单
  • Harness Engineering:AI Agent 与评测系统中的"挽具工程"

🛠️ 如何开始学习

  1. 打开 README.md,每个主题都有内容大纲摘要,挑一个感兴趣的切入点
  2. 建议按上面基础篇 → 注意力篇 → 训练篇 → 推理优化篇的顺序学,前期打地基、后期看工程
  3. 项目会持续新增博客和视频,保持关注即可同步最新主题

✅ 小结

LLM Internals的价值在于"把大模型拆成人话":

  • 18 个核心主题覆盖分词 → 注意力 → 训练 → 推理优化全链路
  • 每个主题都带数值例子,新手也能跟推
  • 推理优化篇(KV Cache、Flash Attention、投机解码、连续批处理)直接对齐工业界实践

如果你一直想系统搞懂大模型内部,这就是目前最友好的一条学习路径,Keep learning!

【免费下载链接】llm-internals

Learn LLM internals step by step - from tokenization to attention to inference optimization.

项目地址:https://gitcode.com/gh_mirrors/ll/llm-internals
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询