文章目录
- 一、GPT 路线的底层选择:Decoder-Only
- 二、GPT-1:预训练 + 微调的生成式路线
- 三、GPT-2:规模扩大和零样本能力的信号
- 四、GPT-3:In-Context Learning 变成核心能力
- 五、为什么 next-token prediction 能产生多任务能力
- 六、Prompt:把任务写进上下文
- 七、InstructGPT:从会续写到会听指令
- 八、SFT:监督微调让模型学回答格式
- 九、RLHF 和 DPO:从示范答案到偏好对齐
- 十、ChatGPT:模型能力和交互产品的结合
- 十一、GPT-4:更强能力和更复杂系统化路线
- 十二、GPT 演进主线总结
- 十三、GPT 路线的工程启发
- 十四、常见误区
- 十五、你应该记住的最小心智模型
- 总结
- 大模型视角
- 下一篇
摘要:GPT 系列的演进不是简单的“参数越来越大”。它背后有一条清晰技术路线:用 Decoder-Only Transformer 做自回归语言建模,用大规模预训练学习通用文本分布,用上下文学习把任务写进 prompt,用监督微调让模型更会按指令回答,再用偏好对齐改善有用性和安全性。本文从 GPT-1、GPT-2、GPT-3、InstructGPT/ChatGPT 到 GPT-4,讲清每一阶段解决了什么问题、技术重点如何变化,以及为什么 GPT 路线会从“语言模型”发展成“通用助手”。读完后,你应该能理解 GPT 系列的主线,而不是只记发布时间和参数规模。
前置知识: Transformer,多头注意力,架构对比, BERT
阅读时间:约 65 分钟
代码环境:Python 3.10+,少量概念代码
入门导读:先抓住主线
GPT 的全称是 Generative Pre-trained Transformer。
三个词分别说明了它的核心:
Generative:从左到右生成文本 Pre-trained:先在大规模文本上预训练 Transformer:使用 Transformer 架构,主要是 Decoder-Only 路线GPT 系列最重要的训练目标是 next-token prediction:给定前文,预测下一个 token。
输入:我 喜欢 机器 目标:学习这个目标看起来简单,但当模型、数据和算力足够大时,它会学到语言、知识、代码、格式、推理模式和任务泛化能力。
读完先达到这个程度就够了:
- 能解释 GPT 为什么使用 Decoder-Only 和因果 mask;
- 能说清 GPT-1、GPT-2、GPT-3、InstructGPT/ChatGPT、GPT-4 的演进主线;
- 能理解 next-token prediction 为什么能支持多任务能力;
- 能解释 in-context learning 和 prompt 的关系;
- 能知道 SFT、RLHF 在 GPT 产品化中的作用;
- 能避免把 GPT 演进简单理解成“只靠参数变大”。
带着这 3 个问题读:
- GPT 为什么选择从左到右预测,而不是像 BERT 那样双向 Mask?
- 为什么 GPT-3 之后,prompt 和 in-context learning 变得如此重要?
- 为什么 ChatGPT 的关键不只是基础模型更大,而是指令微调和对齐?
一、GPT 路线的底层选择:Decoder-Only
GPT 类模型使用 Decoder-Only Transformer。
它的注意力是因果的:当前位置只能看自己和之前的 token,不能看未来。
因果 mask 如下:
1 0 0 0 0 1 1 0 0 0 1 1 1 0 0 1 1 1 1 0 1 1 1 1 1这和训练目标一致:预测下一个 token。
importnumpyasnp seq_len=5# 与上面示意矩阵的 5×5 保持一致mask=np.tril(np.ones((seq_len,seq_len),dtype=int))print(mask)# 输出的下三角矩阵与前面的示意图对应为什么不用 BERT 那样的双向 Encoder?
因为 GPT 的目标是生成。生成时模型只能看到已经生成的内容,不能看到未来答案。Decoder-Only 的训练方式和推理方式一致:训练时预测下一个 token,推理时也一步步生成下一个 token。
这种一致性非常适合做开放式生成、对话、代码和任务统一。
二、GPT-1:预训练 + 微调的生成式路线
GPT-1 的重要意义是把 Transformer Decoder 和“先预训练、再微调”的范式结合起来。
流程可以简化成:
大规模无标注文本上做语言模型预训练 再在下游任务标注数据上微调这和 BERT 的思路有相似之处:都依赖预训练。但它们训练目标不同。
| 模型 | 架构 | 预训练目标 | 强项 |
|---|---|---|---|
| BERT | Encoder-Only | Masked Language Modeling | 双向理解 |
| GPT | Decoder-Only | Causal Language Modeling | 自回归生成 |
GPT-1 时代的重点还不是“聊天助手”,而是证明:生成式 Transformer 预训练可以学到可迁移表示,再迁移到下游 NLP 任务。
这条路线后来变得极其重要,因为它把任务工程从“为每个任务设计模型”推向“用一个通用预训练模型适配很多任务”。
三、GPT-2:规模扩大和零样本能力的信号
GPT-2 延续了 GPT-1 的自回归语言建模路线,但扩大了模型和数据规模。
更重要的是,它让人们看到一个现象:当语言模型在足够大规模文本上训练后,即使没有针对某个任务做专门微调,也能通过自然语言提示完成一些任务。
例如:
Translate English to French: cat => chat dog => chien book =>模型可能继续生成:
livre这就是零样本或少样本能力的早期信号。
GPT-2 说明:语言模型学到的不只是词频和语法,还可能学到任务格式、知识模式和文本中的隐含映射。
当然,GPT-2 时代的能力还远不如后来的 GPT-3/ChatGPT,但方向已经很清楚:扩大预训练规模会带来更强的通用生成能力。
四、GPT-3:In-Context Learning 变成核心能力
GPT-3 最重要的影响之一是让 In-Context Learning 变得非常突出。
In-Context Learning 指的是:不更新模型参数,只在 prompt 里给任务说明或示例,模型就能按这个模式完成任务。
例如 few-shot prompt:
把中文翻译成英文: 中文:今天天气很好 英文:The weather is nice today. 中文:我喜欢机器学习 英文:I like machine learning. 中文:请打开窗户 英文:模型根据上下文中的示例模式继续生成答案。
这和传统微调很不一样。
传统微调:
用任务数据更新模型参数In-Context Learning:
不更新参数,把任务写进上下文这让 prompt engineering 成为一种新的交互方式。开发者不一定要训练模型,而是可以通过任务描述、示例、格式约束和上下文信息引导模型。
五、为什么 next-token prediction 能产生多任务能力
很多人第一次听说大模型时会困惑:只是预测下一个 token,为什么能做翻译、代码、问答和推理?
关键在于训练数据里包含大量任务形式。
互联网文本中有:
- 问题和答案;
- 教程和解释;
- 翻译对照;
- 代码和注释;
- 数学推导;
- 对话记录;
- 表格和列表;
- 文档和规范。
模型做 next-token prediction 时,需要学会这些文本模式。
例如它看到:
问题:什么是 Transformer? 回答:下一个 token 的合理分布会偏向解释文本。
看到:
def quicksort(arr):下一个 token 的合理分布会偏向代码。
所以 next-token prediction 看似简单,实际上迫使模型学习很多隐含任务的条件分布。
六、Prompt:把任务写进上下文
GPT-3 之后,prompt 变得非常重要。因为模型可以从上下文中理解任务。
一个好 prompt 通常包含:
- 角色或任务说明;
- 输入数据;
- 输出格式;
- 示例;
- 约束条件;
- 必要背景信息。
例如信息抽取:
请从下面文本中抽取公司名、金额和日期,输出 JSON。 文本:A 公司于 2024 年 3 月获得 5000 万元融资。 输出:模型如果足够强,就能继续生成结构化结果。
但 prompt 不是魔法。它受上下文长度、模型能力、示例质量、指令清晰度和输出约束影响。复杂任务仍然可能需要微调、工具调用、RAG 或程序化校验。
七、InstructGPT:从会续写到会听指令
基础 GPT 模型擅长续写文本,但不一定擅长做用户助手。
用户问:
请解释一下梯度下降。基础语言模型可能会续写成不同风格:百科、论坛、代码片段、甚至跑题文本。它的目标是“像训练语料”,不一定是“对用户有帮助”。
InstructGPT 解决的是指令跟随和人类偏好问题。
典型流程:
1. SFT:用人工示范回答做监督微调 2. Reward Model:用人类偏好数据训练奖励模型 3. RLHF:用奖励模型优化语言模型,让回答更符合偏好这一步很关键。它让模型从“文本续写器”更接近“助手”。
换句话说,ChatGPT 类产品的突破不只来自基础模型预训练,也来自指令微调和对齐流程。
八、SFT:监督微调让模型学回答格式
SFT 数据形式通常是:
输入:用户指令 + 上下文 标签:理想回答训练目标仍然可以是交叉熵,只是通常只对 assistant 回答部分计算 loss。
示意:
User: 解释什么是 overfitting Assistant: 过拟合是指模型在训练集上表现很好...SFT 让模型学会:
- 按指令回答;
- 使用合适语气;
- 遵循格式;
- 拒绝明显不合适请求;
- 进行分步骤解释。
但 SFT 的问题是:它只模仿示范答案,不直接优化“哪个回答更好”。同一个问题可能有多个回答,SFT 不知道人类更偏好哪一个。
这就需要偏好对齐。
九、RLHF 和 DPO:从示范答案到偏好对齐
RLHF(Reinforcement Learning from Human Feedback,在 InstructGPT(2022)中成为大模型对齐的标准流程)使用人类偏好数据,例如:
对同一个问题,回答 A 比回答 B 更好然后训练一个奖励模型(Reward Model),最后用 PPO 等强化学习方法让语言模型生成更高奖励的回答。
DPO(Direct Preference Optimization,Rafailov et al., 2023)是 RLHF 的一种更晚出现的简化替代方案:它不再训练独立的奖励模型,也不用 PPO,而是直接把偏好对(chosen / rejected)代入一个封闭形式的 loss,用普通 SFT 式的训练循环就能优化模型,让被偏好的回答概率相对提高。因此工程上 DPO 通常更稳定、更省算力,2024 年之后很多开源模型(LLaMA-3 系列、Qwen、Zephyr 等)都改用 DPO 或其变体(IPO、KTO、ORPO 等)替代 PPO-RLHF。可以把两者的时间线记成:先有 SFT,再有 RLHF(2022),再有 DPO(2023)作为 RLHF 的简化路线;三者共同解决"如何让模型对齐人类偏好"这个问题。
你可以先这样理解:
| 阶段 | 数据 | 目标 |
|---|---|---|
| 预训练 | 大规模文本 | 学语言和知识模式 |
| SFT | 指令 + 示范回答 | 学会按指令回答 |
| RLHF/DPO | 回答偏好对 | 学会更符合人类偏好 |
这些阶段叠加后,模型才更像今天的聊天助手。
十、ChatGPT:模型能力和交互产品的结合
ChatGPT 的影响不只是模型本身,也在于把大模型能力包装成普通用户可用的对话界面。
从技术角度看,它体现了几件事的组合:
- 强大的基础模型;
- 指令微调;
- 偏好对齐;
- 多轮对话格式;
- 安全策略;
- 系统 prompt;
- 工具和产品工程;
- 持续评估和迭代。
这说明 GPT 路线已经从“预训练语言模型”走向“可交互 AI 系统”。
对开发者来说,重要启发是:模型能力只是系统的一部分。真正的应用还需要 prompt、检索、工具、权限、安全、缓存、评估和成本控制。
十一、GPT-4:更强能力和更复杂系统化路线
GPT-4 通常被理解为更强的基础模型和对齐系统。公开信息中可以确定的是,它在复杂任务、推理、代码、多轮指令和多模态方向上表现更强,但具体训练数据、参数规模和架构细节并未完整公开。
因此讨论 GPT-4 时要谨慎,不要编造未公开细节。
更稳妥的理解是:GPT-4 代表了 GPT 路线的进一步系统化:
- 更强的预训练基础能力;
- 更好的指令跟随和对齐;
- 更强的复杂任务泛化;
- 更完善的安全评估;
- 更接近产品级多模态和工具生态。
它说明大模型竞争不再只是“谁的参数更多”,而是数据、训练、对齐、推理系统、产品反馈和安全评估的综合竞争。
十二、GPT 演进主线总结
可以用一张表记住:
| 阶段 | 核心变化 | 关键词 |
|---|---|---|
| GPT-1 | 生成式 Transformer 预训练 + 微调 | CLM、迁移学习 |
| GPT-2 | 扩大模型和数据,展示零样本能力 | scaling、zero-shot |
| GPT-3 | In-Context Learning 成为亮点 | few-shot、prompt |
| InstructGPT | 让模型更会听指令 | SFT、RLHF |
| ChatGPT | 对话产品化 | 多轮对话、助手体验 |
| GPT-4 | 更强综合能力和系统化对齐 | 复杂任务、多模态、安全 |
这条线不是简单的参数表,而是能力形成机制的演进:
语言建模 -> 规模化 -> 上下文学习 -> 指令跟随 -> 偏好对齐 -> 产品系统十三、GPT 路线的工程启发
GPT 系列对开发者有几条重要启发。
第一,统一生成接口很强。很多任务可以变成 prompt 到 completion,降低任务建模成本。
第二,数据和规模很关键。next-token prediction 的威力来自大量高质量文本和足够模型容量。
第三,基础模型不等于助手。没有 SFT 和对齐,模型可能会续写但不一定有帮助。
第四,prompt 是上下文编程。开发者通过自然语言、示例和格式约束配置模型行为。
第五,复杂应用需要系统工程。RAG、工具调用、函数调用、缓存、评估、安全和成本控制都很重要。
第六,公开信息有边界。不要把未公开参数、架构、训练细节当事实。
十四、常见误区
误区 1:GPT 的进步只是参数变大。
规模很重要,但数据、训练目标、指令微调、偏好对齐、系统工程同样关键。
误区 2:GPT 是为了聊天从零设计的。
GPT 最初是生成式预训练语言模型,聊天能力来自后续指令微调、对齐和产品化。
误区 3:Next-token prediction 太简单,学不到推理。
目标形式简单,但大规模文本中包含大量推理、代码、问答和任务模式。模型会从预测任务中学习复杂分布。
误区 4:Prompt 可以替代一切训练。
Prompt 很强,但复杂、稳定、高可靠任务仍可能需要微调、RAG、工具和评估。
误区 5:RLHF 让模型一定真实可靠。
RLHF 改善偏好和安全表现,但不能完全解决幻觉、事实错误和复杂推理问题。
误区 6:GPT-4 的所有细节都已公开。
没有。讨论未公开模型时,应区分公开事实、合理推断和猜测。
十五、你应该记住的最小心智模型
GPT 可以这样记:
Decoder-Only Transformer + Causal Mask + Next Token Prediction + 大规模预训练 + Prompt / In-Context Learning + SFT 指令微调 + RLHF/DPO 偏好对齐 = 现代通用助手能力基础它的演进不是单线条,而是三条线一起推进:
模型规模和数据规模 训练目标和对齐方法 产品交互和系统工程总结
GPT 系列从 GPT-1 到 GPT-4 的演进,核心不是简单参数增长,而是一条从生成式预训练到通用助手的技术路线。GPT-1 证明 Decoder-Only Transformer 预训练可以迁移到下游任务;GPT-2 展示规模扩大后的零样本信号;GPT-3 让 In-Context Learning 和 prompt 成为核心交互方式;InstructGPT 和 ChatGPT 通过 SFT、RLHF 和产品化对话界面,让模型更会按人类指令工作;GPT-4 则体现了更强基础能力、对齐和系统化评估的综合路线。
第一遍记住一句话:GPT 的主线是用自回归预训练学通用能力,再用上下文、指令微调和偏好对齐把能力变成可用助手。
大模型视角
理解 GPT 系列后,你再看 LLaMA、Qwen、Claude、Gemini 等模型,会更容易抓住共同框架:基础模型靠大规模预训练,对话能力靠指令微调和对齐,应用能力靠 RAG、工具和系统工程。现代大模型不是单个神秘网络,而是一整套训练和产品化流程。
下一篇
Tokenization 详解:BPE、WordPiece、SentencePiece—— GPT 的训练和推理都以 token 为单位。下一篇看文本如何被切成 token,以及 tokenizer 为什么会影响成本、上下文长度和多语言效果。