【免费下载链接】llm-internals
Learn LLM internals step by step - from tokenization to attention to inference optimization.
LLM Internals是一个手把手教你学习大模型内部原理的开源教程项目,覆盖从Tokenization(分词)到Attention(注意力机制)再到LLM 推理优化的完整学习路径。它不堆砌代码,而是用一步步的数值例子把大模型"拆开给你看",非常适合想搞懂大模型内部的新手和普通开发者。
📌 这个项目是什么?
一句话概括:LLM Internals 是一个"大模型内部拆解"系列教程,由 Outcome School 创始人 Amit Shekhar 编写维护。
它的核心特点是:
- 📖循序渐进:从"LLM 到底是什么"讲起,逐步深入到注意力数学、推理加速
- 🔢数值例子驱动:每个主题都配 step-by-step 的数值演示,不靠背公式
- 🧠面向理解而非调包:目标是让你真正明白 Transformer 每个组件在做什么
- 🚀贴近生产:KV Cache、Flash Attention、连续批处理都是线上推理服务的核心技术
所有主题的总目录维护在 README.md 中,项目采用 Apache 2.0 协议开源,内容还在持续更新。
🧭 18 个主题学习路线总览
整个项目可以把主题归纳为4 大阶段、18 个核心主题,由浅入深:
| 阶段 | 编号 | 主题 | 你会学到什么 |
|---|---|---|---|
| 一、基础篇 | 1 | LLM 全景概览 | LLM、RAG、MCP、Agent、微调、量化的整体地图 |
| 2 | Tokenization 与 BPE | 大模型如何把文本切成 Token,BPE 算法逐步拆解 | |
| 3 | Transformer 架构 | 编码器/解码器、数据流、三大架构变体 | |
| 二、注意力篇 | 4 | 注意力数学(Q、K、V) | Q×Kᵀ、缩放、Softmax、加权和的完整数值推导 |
| 5 | 因果掩码 Causal Masking | 如何阻止模型"偷看"未来的 Token | |
| 6 | RoPE 旋转位置编码 | 用 2D 旋转数学注入相对位置信息的原理 | |
| 三、训练篇 | 7 | 反向传播 Backpropagation | 链式法则、前向/反向传播、梯度下降更新权重 |
| 8 | 交叉熵损失 Cross-Entropy | 语言模型训练最核心损失函数的数学与梯度 | |
| 9 | 前馈网络 FFN | Transformer 每层中"膨胀-收缩"结构学什么 | |
| 10 | 归一化:BatchNorm vs LayerNorm vs RMSNorm | 三种归一化的区别,以及为什么现代 LLM 偏爱 RMSNorm | |
| 四、推理优化篇 | 11 | KV Cache | 为什么只缓存 K 和 V,速度提升多少,内存代价几何 |
| 12 | Flash Attention | 分块 + 在线 Softmax,吃透 GPU 显存的注意力加速 | |
| 13 | Paged Attention | 借鉴操作系统分页思想,解决 KV Cache 内存碎片 | |
| 14 | Speculative Decoding 投机解码 | 小模型打草稿 + 大模型验证,2~3 倍加速且零质量损失 | |
| 15 | Continuous Batching 连续批处理 | "拼车"式调度让 GPU 全程满载 | |
| 16 | Prompt Caching 提示词缓存 | 精确前缀规则、TTL,AI 助手如何省成本 | |
| 17 | Prefill vs Decode | 推理两大阶段的差异,TTFT/TPOT 等核心指标 | |
| 18 | Mixture of Experts(MoE) | 路由器 + 专家 + 稀疏激活,大模型为何又强又省 |
📘 一、基础篇:先搭起大模型的地基
1. LLM 全景概览
入门第一课先回答"LLM 到底是什么",并顺带串起RAG(检索增强生成)、MCP、Agent、Fine-tuning(微调)、Quantization(量化)这几个高频概念,帮你建立整体坐标系。
2. Tokenization 与 BPE
大模型不认识字符,只认识 Token。这一主题回答三个问题:为什么要分词、怎么切才合理、以及Byte Pair Encoding(字节对编码)如何一步步把词表"训"出来,包括 BPE 遇到新文本时的处理逻辑。
3. Transformer 架构
把 Transformer 逐块解码:Tokenization、Embedding、位置编码、Multi-Head Attention、FFN、残差连接、Layer Normalization 各自负责什么,数据如何流经整个架构,以及 Encoder-only / Decoder-only / Encoder-Decoder 三种变体的取舍。
🧠 二、注意力篇:大模型真正的"大脑"
4. 注意力数学:Q、K、V
这是全项目最硬核的数值推导之一:从"词 → 向量"出发,构造Q(Query)、K(Key)、V(Value)矩阵,计算 Q×Kᵀ 得到注意力分数,再经过√dₖ 缩放、Softmax 归一化,最后与 V 加权求和。每个步骤都有具体数字,看完注意力机制不再"玄学"。
5. 因果掩码(Causal Masking)
生成文本时,当前词不能参考后面的词。这个主题用一个"看到未来 Token"的反例说明问题,再给出下三角掩码矩阵的实现方式,解释 GPT 这类自回归模型为何"只能往前看"。
6. RoPE 旋转位置编码
Transformer 本身不感知词序,RoPE 通过2D 旋转矩阵把位置信息"编码"进 Q 和 K,让点积天然携带相对位置信息。文章会讲清旧方案(可学习位置编码)的局限、RoPE 的核心思想和一个小数值例子。
📐 三、训练篇:模型是怎么学会"说话"的
7. 反向传播(Backpropagation)
神经网络学习的核心算法:从链式法则讲起,走一遍前向传播 → 计算损失 → 反向传播 → 梯度下降更新权重的完整流程,并用 Python 风格的小例子把梯度"算给你看"。
8. 交叉熵损失(Cross-Entropy Loss)
"我有 70% 把握这是猫"——模型预测的概率和真实答案差多少?交叉熵损失就是这个度量尺,它驱动着包括 GPT、BERT 在内的几乎所有现代 AI 模型训练。主题覆盖公式推导、为什么取负对数、语言模型场景下的用法及其梯度。
9. 前馈网络(FFN)
注意力负责"信息交互",FFN 负责"加工理解"。这个主题拆解 Transformer 每层中的Expand-then-Contract(先膨胀后收缩)结构、ReLU 等激活函数的作用,以及 FFN 到底"占了模型多少参数"——顺便引出 Mixture of Experts 的伏笔。
10. 归一化三兄弟:BatchNorm vs LayerNorm vs RMSNorm
深度网络为什么需要归一化?BatchNorm 和 LayerNorm 差在哪?为什么 Llama、Mistral、Qwen、DeepSeek 等现代大模型几乎都选RMSNorm?主题会用具体数值对比三者计算差异,并给出"何时用哪个"的实用建议。
🚀 四、推理优化篇:让大模型又快又省
这一篇直接对接生产环境的 LLM 推理优化,是普通用户感知最明显的部分(响应速度、服务成本)。
11. KV Cache:生成加速的第一把钥匙
LLM 逐 Token 生成时,历史 Token 的 K、V 会反复计算。KV Cache 把结果存下来复用,只缓存 K 和 V 而不缓存 Q 的原因、能快多少、以及"速度 vs 内存"的权衡,都会讲透。
12. Flash Attention:吃透 GPU 显存的注意力算法
标准注意力为什么慢?答案藏在 GPU 的 HBM 与 SRAM 层级里。Flash Attention 通过分块(Tiling)+ 在线 Softmax + 反向重计算把注意力计算"贴"在高速显存里,如今几乎每个现代 LLM 都在用。主题还会顺带介绍 Flash Attention 2 / 3 的演进。
13. Paged Attention:给 KV Cache 做"分页"
KV Cache 会浪费显存?Paged Attention 借鉴操作系统的虚拟内存分页思想,把注意力 KV 存储切成小页动态分配,并支持请求间共享,让同一张 GPU 服务更多用户。
14. Speculative Decoding 投机解码
小模型快速"打草稿",大模型批量"批改验证"——拒绝采样保证输出质量零损失,实测可带来2~3 倍生成加速。这是当下推理加速最热门的技巧之一。
15. Continuous Batching 连续批处理
静态批处理要"等最短的请求跑完"才放新请求,GPU 大量空转。连续批处理像"拼车"一样,每生成一步都可插入新请求、放走已完成请求,显著提升服务吞吐。
16. Prompt Caching 提示词缓存
AI 助手的系统提示往往很长且固定。Prompt Caching 按精确前缀规则缓存前缀计算结果,配合写缓存/读缓存与 TTL 机制,直接降低时延和成本。主题还会给出"什么内容值得放进缓存"的实战建议。
17. Prefill vs Decode:推理优化的两阶段地图
LLM 推理分Prefill(预填充,计算密集)和Decode(解码,内存带宽密集)两个阶段,KV Cache 是连接二者的桥梁。理解这个划分,才能对号入座地选优化手段,也才能真正看懂TTFT、TPOT、吞吐、端到端时延这些核心指标。
18. Mixture of Experts(MoE)混合专家
为什么有的模型参数量巨大却推理便宜?MoE 用路由器(Router)从众多专家中稀疏激活少数几个,把"大模型容量"和"小模型成本"兼得,支撑着今天许多最强 LLM。主题涵盖专家的本质、MoE 在 Transformer 中的位置、负载均衡与工程挑战。
🎁 加餐:进阶主题(持续更新中)
完成 18 个核心主题后,项目里还有一批进阶内容等你探索:
- Grouped Query Attention(GQA):MHA / MQA / GQA 三者对比与"上训练"迁移方法
- LoRA 低秩适配:不动主干、只训小矩阵的微调方案
- Large Reasoning Models(LRM):会"先思考再回答"的推理大模型
- RLHF:SFT → 奖励模型 → PPO 三阶段,把模型调得有用且安全
- Decoding DeepSeek-V4:百万 Token 上下文、混合注意力、FP4 量化感知训练的前沿拆解
- Prompt Injection 提示词注入:AI 应用安全必修课,含攻击演练与防御清单
- Harness Engineering:AI Agent 与评测系统中的"挽具工程"
🛠️ 如何开始学习
- 打开 README.md,每个主题都有内容大纲摘要,挑一个感兴趣的切入点
- 建议按上面基础篇 → 注意力篇 → 训练篇 → 推理优化篇的顺序学,前期打地基、后期看工程
- 项目会持续新增博客和视频,保持关注即可同步最新主题
✅ 小结
LLM Internals的价值在于"把大模型拆成人话":
- 18 个核心主题覆盖分词 → 注意力 → 训练 → 推理优化全链路
- 每个主题都带数值例子,新手也能跟推
- 推理优化篇(KV Cache、Flash Attention、投机解码、连续批处理)直接对齐工业界实践
如果你一直想系统搞懂大模型内部,这就是目前最友好的一条学习路径,Keep learning!
【免费下载链接】llm-internals
Learn LLM internals step by step - from tokenization to attention to inference optimization.
相关推荐
Pusher-js 高级功能实战:在线状态、订阅计数和客户端事件的深度应用
Pusher js 高级功能实战:在线状态、订阅计数和客户端事件的深度应用 Pusher js 是一款功能强大的实时通信库,为开发者提供了构建实时应用的核心能力
深入解析Aceso核心原理:从Instant Run Hot Swap到Android热修复的完整实现
深入解析Aceso核心原理:从Instant Run Hot Swap到Android热修复的完整实现 Aceso作为一款专注于Android平台的热修复库,能
攻克自底向上注意力模型十大技术难题:从环境配置到性能优化全指南
攻克自底向上注意力模型十大技术难题:从环境配置到性能优化全指南 引言:自底向上注意力模型的实践痛点与解决方案 你是否在配置自底向上注意力(Bottom Up A
计算机视觉深度学习人工智能
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考