☰
【Transformer】GPT系列演进_从GPT1到GPT4的技术路线
2026/9/30 1:54:56 网站建设 项目流程

文章目录

    • 一、GPT 路线的底层选择:Decoder-Only
    • 二、GPT-1:预训练 + 微调的生成式路线
    • 三、GPT-2:规模扩大和零样本能力的信号
    • 四、GPT-3:In-Context Learning 变成核心能力
    • 五、为什么 next-token prediction 能产生多任务能力
    • 六、Prompt:把任务写进上下文
    • 七、InstructGPT:从会续写到会听指令
    • 八、SFT:监督微调让模型学回答格式
    • 九、RLHF 和 DPO:从示范答案到偏好对齐
    • 十、ChatGPT:模型能力和交互产品的结合
    • 十一、GPT-4:更强能力和更复杂系统化路线
    • 十二、GPT 演进主线总结
    • 十三、GPT 路线的工程启发
    • 十四、常见误区
    • 十五、你应该记住的最小心智模型
    • 总结
    • 大模型视角
    • 下一篇

摘要:GPT 系列的演进不是简单的“参数越来越大”。它背后有一条清晰技术路线:用 Decoder-Only Transformer 做自回归语言建模,用大规模预训练学习通用文本分布,用上下文学习把任务写进 prompt,用监督微调让模型更会按指令回答,再用偏好对齐改善有用性和安全性。本文从 GPT-1、GPT-2、GPT-3、InstructGPT/ChatGPT 到 GPT-4,讲清每一阶段解决了什么问题、技术重点如何变化,以及为什么 GPT 路线会从“语言模型”发展成“通用助手”。读完后,你应该能理解 GPT 系列的主线,而不是只记发布时间和参数规模。

前置知识: Transformer,多头注意力,架构对比, BERT
阅读时间:约 65 分钟
代码环境:Python 3.10+,少量概念代码

入门导读:先抓住主线

GPT 的全称是 Generative Pre-trained Transformer。

三个词分别说明了它的核心:

Generative:从左到右生成文本 Pre-trained:先在大规模文本上预训练 Transformer:使用 Transformer 架构,主要是 Decoder-Only 路线

GPT 系列最重要的训练目标是 next-token prediction:给定前文,预测下一个 token。

输入:我 喜欢 机器 目标:学习

这个目标看起来简单,但当模型、数据和算力足够大时,它会学到语言、知识、代码、格式、推理模式和任务泛化能力。

读完先达到这个程度就够了:

  • 能解释 GPT 为什么使用 Decoder-Only 和因果 mask;
  • 能说清 GPT-1、GPT-2、GPT-3、InstructGPT/ChatGPT、GPT-4 的演进主线;
  • 能理解 next-token prediction 为什么能支持多任务能力;
  • 能解释 in-context learning 和 prompt 的关系;
  • 能知道 SFT、RLHF 在 GPT 产品化中的作用;
  • 能避免把 GPT 演进简单理解成“只靠参数变大”。

带着这 3 个问题读:

  1. GPT 为什么选择从左到右预测,而不是像 BERT 那样双向 Mask?
  2. 为什么 GPT-3 之后,prompt 和 in-context learning 变得如此重要?
  3. 为什么 ChatGPT 的关键不只是基础模型更大,而是指令微调和对齐?

一、GPT 路线的底层选择:Decoder-Only

GPT 类模型使用 Decoder-Only Transformer。

它的注意力是因果的:当前位置只能看自己和之前的 token,不能看未来。

因果 mask 如下:

1 0 0 0 0 1 1 0 0 0 1 1 1 0 0 1 1 1 1 0 1 1 1 1 1

这和训练目标一致:预测下一个 token。

importnumpyasnp seq_len=5# 与上面示意矩阵的 5×5 保持一致mask=np.tril(np.ones((seq_len,seq_len),dtype=int))print(mask)# 输出的下三角矩阵与前面的示意图对应

为什么不用 BERT 那样的双向 Encoder?

因为 GPT 的目标是生成。生成时模型只能看到已经生成的内容,不能看到未来答案。Decoder-Only 的训练方式和推理方式一致:训练时预测下一个 token,推理时也一步步生成下一个 token。

这种一致性非常适合做开放式生成、对话、代码和任务统一。


二、GPT-1:预训练 + 微调的生成式路线

GPT-1 的重要意义是把 Transformer Decoder 和“先预训练、再微调”的范式结合起来。

流程可以简化成:

大规模无标注文本上做语言模型预训练 再在下游任务标注数据上微调

这和 BERT 的思路有相似之处:都依赖预训练。但它们训练目标不同。

模型架构预训练目标强项
BERTEncoder-OnlyMasked Language Modeling双向理解
GPTDecoder-OnlyCausal Language Modeling自回归生成

GPT-1 时代的重点还不是“聊天助手”,而是证明:生成式 Transformer 预训练可以学到可迁移表示,再迁移到下游 NLP 任务。

这条路线后来变得极其重要,因为它把任务工程从“为每个任务设计模型”推向“用一个通用预训练模型适配很多任务”。


三、GPT-2:规模扩大和零样本能力的信号

GPT-2 延续了 GPT-1 的自回归语言建模路线,但扩大了模型和数据规模。

更重要的是,它让人们看到一个现象:当语言模型在足够大规模文本上训练后,即使没有针对某个任务做专门微调,也能通过自然语言提示完成一些任务。

例如:

Translate English to French: cat => chat dog => chien book =>

模型可能继续生成:

livre

这就是零样本或少样本能力的早期信号。

GPT-2 说明:语言模型学到的不只是词频和语法,还可能学到任务格式、知识模式和文本中的隐含映射。

当然,GPT-2 时代的能力还远不如后来的 GPT-3/ChatGPT,但方向已经很清楚:扩大预训练规模会带来更强的通用生成能力。


四、GPT-3:In-Context Learning 变成核心能力

GPT-3 最重要的影响之一是让 In-Context Learning 变得非常突出。

In-Context Learning 指的是:不更新模型参数,只在 prompt 里给任务说明或示例,模型就能按这个模式完成任务。

例如 few-shot prompt:

把中文翻译成英文: 中文:今天天气很好 英文:The weather is nice today. 中文:我喜欢机器学习 英文:I like machine learning. 中文:请打开窗户 英文:

模型根据上下文中的示例模式继续生成答案。

这和传统微调很不一样。

传统微调:

用任务数据更新模型参数

In-Context Learning:

不更新参数,把任务写进上下文

这让 prompt engineering 成为一种新的交互方式。开发者不一定要训练模型,而是可以通过任务描述、示例、格式约束和上下文信息引导模型。


五、为什么 next-token prediction 能产生多任务能力

很多人第一次听说大模型时会困惑:只是预测下一个 token,为什么能做翻译、代码、问答和推理?

关键在于训练数据里包含大量任务形式。

互联网文本中有:

  • 问题和答案;
  • 教程和解释;
  • 翻译对照;
  • 代码和注释;
  • 数学推导;
  • 对话记录;
  • 表格和列表;
  • 文档和规范。

模型做 next-token prediction 时,需要学会这些文本模式。

例如它看到:

问题:什么是 Transformer? 回答:

下一个 token 的合理分布会偏向解释文本。

看到:

def quicksort(arr):

下一个 token 的合理分布会偏向代码。

所以 next-token prediction 看似简单,实际上迫使模型学习很多隐含任务的条件分布。


六、Prompt:把任务写进上下文

GPT-3 之后,prompt 变得非常重要。因为模型可以从上下文中理解任务。

一个好 prompt 通常包含:

  • 角色或任务说明;
  • 输入数据;
  • 输出格式;
  • 示例;
  • 约束条件;
  • 必要背景信息。

例如信息抽取:

请从下面文本中抽取公司名、金额和日期,输出 JSON。 文本:A 公司于 2024 年 3 月获得 5000 万元融资。 输出:

模型如果足够强,就能继续生成结构化结果。

但 prompt 不是魔法。它受上下文长度、模型能力、示例质量、指令清晰度和输出约束影响。复杂任务仍然可能需要微调、工具调用、RAG 或程序化校验。


七、InstructGPT:从会续写到会听指令

基础 GPT 模型擅长续写文本,但不一定擅长做用户助手。

用户问:

请解释一下梯度下降。

基础语言模型可能会续写成不同风格:百科、论坛、代码片段、甚至跑题文本。它的目标是“像训练语料”,不一定是“对用户有帮助”。

InstructGPT 解决的是指令跟随和人类偏好问题。

典型流程:

1. SFT:用人工示范回答做监督微调 2. Reward Model:用人类偏好数据训练奖励模型 3. RLHF:用奖励模型优化语言模型,让回答更符合偏好

这一步很关键。它让模型从“文本续写器”更接近“助手”。

换句话说,ChatGPT 类产品的突破不只来自基础模型预训练,也来自指令微调和对齐流程。


八、SFT:监督微调让模型学回答格式

SFT 数据形式通常是:

输入:用户指令 + 上下文 标签:理想回答

训练目标仍然可以是交叉熵,只是通常只对 assistant 回答部分计算 loss。

示意:

User: 解释什么是 overfitting Assistant: 过拟合是指模型在训练集上表现很好...

SFT 让模型学会:

  • 按指令回答;
  • 使用合适语气;
  • 遵循格式;
  • 拒绝明显不合适请求;
  • 进行分步骤解释。

但 SFT 的问题是:它只模仿示范答案,不直接优化“哪个回答更好”。同一个问题可能有多个回答,SFT 不知道人类更偏好哪一个。

这就需要偏好对齐。


九、RLHF 和 DPO:从示范答案到偏好对齐

RLHF(Reinforcement Learning from Human Feedback,在 InstructGPT(2022)中成为大模型对齐的标准流程)使用人类偏好数据,例如:

对同一个问题,回答 A 比回答 B 更好

然后训练一个奖励模型(Reward Model),最后用 PPO 等强化学习方法让语言模型生成更高奖励的回答。

DPO(Direct Preference Optimization,Rafailov et al., 2023)是 RLHF 的一种更晚出现的简化替代方案:它不再训练独立的奖励模型,也不用 PPO,而是直接把偏好对(chosen / rejected)代入一个封闭形式的 loss,用普通 SFT 式的训练循环就能优化模型,让被偏好的回答概率相对提高。因此工程上 DPO 通常更稳定、更省算力,2024 年之后很多开源模型(LLaMA-3 系列、Qwen、Zephyr 等)都改用 DPO 或其变体(IPO、KTO、ORPO 等)替代 PPO-RLHF。可以把两者的时间线记成:先有 SFT,再有 RLHF(2022),再有 DPO(2023)作为 RLHF 的简化路线;三者共同解决"如何让模型对齐人类偏好"这个问题。

你可以先这样理解:

阶段数据目标
预训练大规模文本学语言和知识模式
SFT指令 + 示范回答学会按指令回答
RLHF/DPO回答偏好对学会更符合人类偏好

这些阶段叠加后,模型才更像今天的聊天助手。


十、ChatGPT:模型能力和交互产品的结合

ChatGPT 的影响不只是模型本身,也在于把大模型能力包装成普通用户可用的对话界面。

从技术角度看,它体现了几件事的组合:

  • 强大的基础模型;
  • 指令微调;
  • 偏好对齐;
  • 多轮对话格式;
  • 安全策略;
  • 系统 prompt;
  • 工具和产品工程;
  • 持续评估和迭代。

这说明 GPT 路线已经从“预训练语言模型”走向“可交互 AI 系统”。

对开发者来说,重要启发是:模型能力只是系统的一部分。真正的应用还需要 prompt、检索、工具、权限、安全、缓存、评估和成本控制。


十一、GPT-4:更强能力和更复杂系统化路线

GPT-4 通常被理解为更强的基础模型和对齐系统。公开信息中可以确定的是,它在复杂任务、推理、代码、多轮指令和多模态方向上表现更强,但具体训练数据、参数规模和架构细节并未完整公开。

因此讨论 GPT-4 时要谨慎,不要编造未公开细节。

更稳妥的理解是:GPT-4 代表了 GPT 路线的进一步系统化:

  • 更强的预训练基础能力;
  • 更好的指令跟随和对齐;
  • 更强的复杂任务泛化;
  • 更完善的安全评估;
  • 更接近产品级多模态和工具生态。

它说明大模型竞争不再只是“谁的参数更多”,而是数据、训练、对齐、推理系统、产品反馈和安全评估的综合竞争。


十二、GPT 演进主线总结

可以用一张表记住:

阶段核心变化关键词
GPT-1生成式 Transformer 预训练 + 微调CLM、迁移学习
GPT-2扩大模型和数据,展示零样本能力scaling、zero-shot
GPT-3In-Context Learning 成为亮点few-shot、prompt
InstructGPT让模型更会听指令SFT、RLHF
ChatGPT对话产品化多轮对话、助手体验
GPT-4更强综合能力和系统化对齐复杂任务、多模态、安全

这条线不是简单的参数表,而是能力形成机制的演进:

语言建模 -> 规模化 -> 上下文学习 -> 指令跟随 -> 偏好对齐 -> 产品系统

十三、GPT 路线的工程启发

GPT 系列对开发者有几条重要启发。

第一,统一生成接口很强。很多任务可以变成 prompt 到 completion,降低任务建模成本。

第二,数据和规模很关键。next-token prediction 的威力来自大量高质量文本和足够模型容量。

第三,基础模型不等于助手。没有 SFT 和对齐,模型可能会续写但不一定有帮助。

第四,prompt 是上下文编程。开发者通过自然语言、示例和格式约束配置模型行为。

第五,复杂应用需要系统工程。RAG、工具调用、函数调用、缓存、评估、安全和成本控制都很重要。

第六,公开信息有边界。不要把未公开参数、架构、训练细节当事实。


十四、常见误区

误区 1:GPT 的进步只是参数变大。
规模很重要,但数据、训练目标、指令微调、偏好对齐、系统工程同样关键。

误区 2:GPT 是为了聊天从零设计的。
GPT 最初是生成式预训练语言模型,聊天能力来自后续指令微调、对齐和产品化。

误区 3:Next-token prediction 太简单,学不到推理。
目标形式简单,但大规模文本中包含大量推理、代码、问答和任务模式。模型会从预测任务中学习复杂分布。

误区 4:Prompt 可以替代一切训练。
Prompt 很强,但复杂、稳定、高可靠任务仍可能需要微调、RAG、工具和评估。

误区 5:RLHF 让模型一定真实可靠。
RLHF 改善偏好和安全表现,但不能完全解决幻觉、事实错误和复杂推理问题。

误区 6:GPT-4 的所有细节都已公开。
没有。讨论未公开模型时,应区分公开事实、合理推断和猜测。


十五、你应该记住的最小心智模型

GPT 可以这样记:

Decoder-Only Transformer + Causal Mask + Next Token Prediction + 大规模预训练 + Prompt / In-Context Learning + SFT 指令微调 + RLHF/DPO 偏好对齐 = 现代通用助手能力基础

它的演进不是单线条,而是三条线一起推进:

模型规模和数据规模 训练目标和对齐方法 产品交互和系统工程

总结

GPT 系列从 GPT-1 到 GPT-4 的演进,核心不是简单参数增长,而是一条从生成式预训练到通用助手的技术路线。GPT-1 证明 Decoder-Only Transformer 预训练可以迁移到下游任务;GPT-2 展示规模扩大后的零样本信号;GPT-3 让 In-Context Learning 和 prompt 成为核心交互方式;InstructGPT 和 ChatGPT 通过 SFT、RLHF 和产品化对话界面,让模型更会按人类指令工作;GPT-4 则体现了更强基础能力、对齐和系统化评估的综合路线。

第一遍记住一句话:GPT 的主线是用自回归预训练学通用能力,再用上下文、指令微调和偏好对齐把能力变成可用助手。

大模型视角

理解 GPT 系列后,你再看 LLaMA、Qwen、Claude、Gemini 等模型,会更容易抓住共同框架:基础模型靠大规模预训练,对话能力靠指令微调和对齐,应用能力靠 RAG、工具和系统工程。现代大模型不是单个神秘网络,而是一整套训练和产品化流程。

下一篇

Tokenization 详解:BPE、WordPiece、SentencePiece—— GPT 的训练和推理都以 token 为单位。下一篇看文本如何被切成 token,以及 tokenizer 为什么会影响成本、上下文长度和多语言效果。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询