一、事件还原:一次"不加量、只提效"的结构性升级
2026年7月31日,DeepSeek-V4-Flash 正式版(版本号 V4-Flash-0731)API 悄然上线公测。这次更新最反直觉的地方在于:模型架构和参数规模完全未变,仅靠一轮深度后训练(Post-Training)优化,就让 Agent 能力实现了"脱胎换骨"式的跃升——在 9 项 Agent 基准测试中全面反超自家旗舰 V4-Pro 预览版,其中代码修复任务 DeepSWE 从 7.3 分暴涨至 54.4 分,增幅超过 640%。
这件事之所以值得深入拆解,是因为它直接挑战了当前行业的默认假设:"模型性能靠堆参数和算力。"Flash 正式版用同一个 284B 总参数、13B 激活参数的 MoE 架构,仅通过训练方法和数据质量的提升,就跑赢了三个月前发布的 V4-Pro 预览版(1.6 万亿总参数、49B 激活参数),并在多项 Agent 测试中逼近 Anthropic 的 Opus 4.8。这说明,大模型竞争的杠杆点正在从"预训练军备竞赛"向"后训练精细化工程"转移。
本文将从架构底座、后训练方法论、Agent 基准拆解、性价比分析、开发者实操五个维度,深度解构这次"不增参数、只提能力"的技术升级背后的工程逻辑。
先厘清基本事实。DeepSeek-V4 系列于 2026 年 4 月 24 日开源预览版,包含两款模型:
| 特性 | DeepSeek-V4-Pro | DeepSeek-V4-Flash |
|---|---|---|
| 总参数量 | 1.6 万亿 (1.6T) | 2840 亿 (284B) |
| 激活参数量 | 490 亿 (49B) | 130 亿 (13B) |
| 激活比例 | ~3.06% | ~4.58% |
| 上下文长度 | 100 万 Token | 100 万 Token |
| 精度 | FP4 + FP8 混合 | FP4 + FP8 混合 |
| 开源协议 | MIT | MIT |
7 月 31 日上线的 Flash 正式版(0731),完全沿用了预览版的 MoE 架构——总参数 284B、激活参数 13B、100 万 token 上下文、支持思考/非思考双模式切换。DeepSeek 官方明确表示:本次升级不涉及任何底层架构改动,所有性能提升均来自一轮深度后训练优化。
这意味着,同样的"骨架"(模型结构、参数规模、MoE 路由策略),被换上了一套全新的"脑子"(后训练数据与训练方法)。从工程视角看,这是一次纯粹的"软件层"升级——推理成本、延迟、显存占用均与预览版持平,但输出质量大幅提升。
二、后训练的杠杆效应:同样的骨架,换一套脑子
2.1 两阶段后训练范式
根据 DeepSeek-V4 技术报告,其后训练采用了一种两阶段范式:
第一阶段——领域专家独立培养:通过监督微调(SFT)和基于 GRPO(Group Relative Policy Optimization)的强化学习,分别在不同的能力维度上培养领域专家。例如,代码能力、工具调用能力、终端操作能力各自独立训练,确保每个维度都能达到深度优化。
第二阶段——在线策略蒸馏统一整合:通过在线策略蒸馏(on-policy distillation),将各领域的专业能力融合至单一模型中。这一步的关键在于"在线"——模型使用自身生成的输出来进行蒸馏,而非依赖外部教师模型的静态数据,从而避免了能力融合时的"遗忘"问题。
这套范式的精妙之处在于:它将"广度"(多领域专家)和"深度"(单一模型统一)解耦。第一阶段可以并行训练多个专家模型,每个都在自己的领域内做到极致;第二阶段再通过蒸馏将它们"编织"在一起。Flash 正式版的提升,很可能是在这两个阶段都做了更精细的打磨——更多高质量训练数据、更精准的 RL 奖励信号、更细致的能力融合策略。
2.2 为什么不动架构
从工程经济性角度看,后训练优化的投入产出比远高于架构重训:
- 预训练成本:V4 系列在 32 万亿 token 上预训练,耗费大量 GPU 集群时间。重训一次架构变更的成本可能以千万元计。
- 后训练成本:仅需在已有 checkpoint 上做 SFT+RL,计算量是预训练的极小比例。
- 迭代速度:架构变更需要数月验证,而后训练可以在数周内完成一轮迭代。
DeepSeek 选择在架构不变的前提下,通过后训练来释放 Flash 模型的潜力,本质上是在说:预训练决定了模型的"天花板",而后训练决定了模型能站到天花板的哪个位置。V4-Flash 的预训练已经提供了足够高的天花板,0731 版本的工作是让模型更接近这个上限。
2.3 数据质量权重的上升
这次升级传递了一个清晰信号:训练数据的质量和配比,正在成为比模型规模更重要的性能变量。有开发者实测反馈:此前用 V4-Pro 预览版反复修改仍无法解决的三维渲染问题,交给 Flash 正式版一次改对;还有用户接入 Codex 后,10 分钟解决了 GPT-5.6 折腾一小时未果的苹果小程序支付 bug,账单仅 8 元多。这些案例说明,后训练带来的不是"分数上的提升",而是"实际可用性的质变"。
三、Agent 能力全面跃升:9 项基准测试拆解
3.1 核心基准数据
下表为 Flash 预览版与 Flash 正式版(0731)在 Agent 相关基准测试中的对比:
| 基准测试 | Flash 预览版 | Flash 正式版 (0731) | 变化幅度 |
|---|---|---|---|
| Terminal Bench 2.1 | 61.8 | 82.7 | +33.5% |
| DeepSWE (代码修复) | 7.3 | 54.4 | +644% |
| DSBench-FullStack | 37.0 | 68.7 | +85.7% |
| DSBench-Hard | - | 59.6 | 新增 |
| Toolathlon-Verified | - | 70.3 | 新增 |
| Cybergym (网络安全) | - | 76.7 | 新增 |
| AgentLastExam | - | 25.2 | 新增 |
| AutomationBenchPublic | - | 25.1 | 新增 |
| NL2Repo | - | 54.2 | 新增 |
3.2 DeepSWE 暴增的解读
DeepSWE 测试的是模型在真实代码仓库中定位和修复 bug 的能力。从 7.3 分到 54.4 分,这不是渐进式改善,而是从"几乎无法完成"到"具备实用能力"的跨越。这个跃升的根源在于后训练阶段对代码修复任务的高质量 RL 训练——模型学会了如何在大型代码库中进行有效的搜索、定位、修改和验证的闭环操作。
3.3 与闭源模型的差距
在 AgentLastExam 测试中,Flash 正式版得分 25.2,接近 Anthropic Opus 4.8 的 25.7 分。AgentLastExam 是 2026 年新推出的"Agent 终极测试",考察模型独立规划、调用工具、反馈纠错的长链条自主执行能力。一个总参数仅 284B、激活参数 13B 的轻量模型,在这一维度上逼近顶级闭源旗舰,这在半年前是不可想象的。
第三方评测平台 Artificial Analysis 的智能指数显示,Flash 正式版获得 50 分,比 4 月版本高出 10 分,仅比 OpenAI 的 GPT-5.6 Luna 低 1 分。Arena.ai 报告称,Flash 正式版以 1586 分刷新了 FrontendCodeArena 跑分榜单。
3.4 与国产模型横向对比
Flash 正式版的 Agent 综合能力处于 GLM-5.2 和 Kimi K3 之间。值得注意的是,GLM-5.2 总参数为 7440 亿、激活参数 400 亿,均远高于 Flash 的 284B/13B——Flash 以不到 GLM-5.2 一半的参数规模跑赢了它。这进一步验证了后训练对能力提升的杠杆效应超过了单纯堆参数。
四、架构底座:V4 系列的四大核心技术
Flash 正式版的提升虽然全靠后训练,但它的"天花板"由 V4 系列的架构创新决定。以下四大核心技术构成了这个天花板:
4.1 MoE 混合专家架构
V4 采用 Mega MoE 架构,将稠密模型拆分为数千个专家子网络,通过门控网络动态路由。Flash 每次推理仅激活 13B 参数(约 4.58% 的总量),在保持知识容量的同时将计算量压到极低。工程上,DeepSeek 通过负载均衡损失函数、专家并置策略和软硬路由切换解决了 MoE 的三大经典难题。
4.2 CSA+HCA 混合注意力
这是 V4 效率的核心引擎。传统 Transformer 注意力复杂度为 O(n²),处理百万 Token 序列在计算和显存上都是灾难性的。V4 设计了两层注意力机制交替叠加:
- CSA(压缩稀疏注意力):将每 4 个连续 Token 压缩成一个信息块,序列长度缩短至 1/4,适用于中长文本精细处理。
- HCA(重度压缩注意力):利用"闪电索引器"动态识别最相关的信息块,将复杂度降至接近 O(L),适用于超长上下文。
效果是:在 1M token 场景下,V4 相比 V3.2 仅需 27% 的单 token 推理 FLOPs 和 10% 的 KV 缓存。
4.3 mHC 流形约束超连接
训练万亿参数 MoE 模型最大的挑战是训练不稳定。V4 引入 mHC(Manifold-Constrained Hyper-Connections),将残差映射矩阵约束在"双随机矩阵"流形上——每行每列元素之和等于 1,保证信号能量在层间传递时不发生剧烈变化。配合自研 Muon 优化器(替代传统 Adam),V4-Pro 的训练成功率达到 100%。
4.4 FP4+FP8 混合精度
V4 的 MoE 专家参数使用 FP4 精度,其余参数使用 FP8。FP4 在 2026 年属于较激进的精度方案,理论显存占用比 FP8 低一倍,但需要精心的量化误差控制。这一设计使得 284B 参数的 Flash 模型可以在单节点 4×GB300 上高效部署。
五、极致性价比:Agent 落地的经济账
5.1 定价结构
| 计费项 | 价格 |
|---|---|
| 输入 | 1 元/百万 token ($0.14/MToken) |
| 输出 | 2 元/百万 token ($0.28/MToken) |
| 缓存命中 | 更低 |
5.2 横向成本对比
Artificial Analysis 评测显示,同等任务下 DeepSeek V4 Flash 的完成成本仅为 GPT-5.6 Luna 的约三分之一甚至更低——即使 GPT-5.6 Luna 已经降价 80%。有 AI 产品负责人反馈:同样的长任务此前用 Kimi K3 花了 200 多元,用 V4 Flash 只花了 3.67 元。
5.3 "智能平权"的工程意义
这种"中上性能+白菜价"的模式被业界称为"智能平权"——让低预算团队也能大规模落地 AI 智能体。从工程角度看,这意味着 Agent 的试错成本降到了可忽略的水平:开发者可以让模型反复尝试、多轮调用、多 Agent 协作,而不用担心账单爆炸。这直接改变了 Agent 架构设计的经济约束——以前受限于成本只能做单次调用,现在可以设计更复杂的多步协作流程。
在更宏观的背景下,8 月 2 日央视报道 OpenRouter 全球大模型调用量榜单,前五名全部由中国企业研发:小米 MiMo-V2.5 以单周 10.5 万亿 Token 调用量登顶,DeepSeek 两款模型分列第二和第五,腾讯混元 3 排名第三且环比增幅超 999%。Hugging Face 数据显示中国开源模型累计下载量居全球首位。Flash 正式版的极致性价比,正是这一趋势的技术底座之一。
六、开发者实操:接入与部署
6.1 API 接入
Flash 正式版原生兼容 OpenAI Responses API 格式,开发者无需改造现有 Agent 框架即可直接接入:
from openai import OpenAI client = OpenAI( api_key="your-deepseek-api-key", base_url="https://api.deepseek.com" ) response = client.chat.completions.create( model="deepseek-v4-flash", messages=[ {"role": "system", "content": "你是一个Agent助手,需要自主规划并执行任务。"}, {"role": "user", "content": "帮我分析这个GitHub仓库的架构并给出优化建议"} ], # 支持思考/非思考双模式 extra_body={"thinking": {"type": "enabled", "budget_tokens": 32768}} )官方还提供了 Mac/Windows 一键配置脚本,支持 Codex CLI、VS Code 插件等生态,不改 Base URL 即可一键接入。
6.2 vLLM 本地部署
对于需要私有化部署的场景,可通过 vLLM 加载 Flash 模型权重:
VLLM_USE_MODELSCOPE=true vllm serve deepseek-ai/DeepSeek-V4-Flash \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config '{"use_fp4_indexer_cache": true}'6.3 DSpark 推测解码加速
DeepSeek 还开源了 DeepSpec 推测解码模块(DSpark),只需在 vLLM 启动命令中添加一个标志即可启用:
vllm serve deepseek-ai/DeepSeek-V4-Flash-DSpark \ --trust-remote-code --kv-cache-dtype fp8 --block-size 256 \ --data-parallel-size 4 --enable-expert-parallel \ --moe-backend deep_gemm_mega_moe \ --attention-config '{"use_fp4_indexer_cache": true}' \ --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'DSpark 与原模型使用相同的检查点,仅额外附加了一个推测解码模块,通过预测多个候选 token 并并行验证来加速推理,在几乎不增加显存的情况下显著提升吞吐量。
6.4 三种推理模式
| 模式 | 特点 | 典型场景 | 响应格式 |
|---|---|---|---|
| Non-think | 快速直觉响应 | 日常例行任务 | 直接输出 |
| Think High | 逻辑分析,较慢但更准确 | 复杂问题求解 | <think>思考过程 + 输出 |
| Think Max | 推理能力发挥到极致 | 探索能力边界 | 特殊提示 + <think> + 输出 |
对于 Think Max 模式,官方建议将上下文窗口至少设置为 384K token。采样参数建议设置为 temperature=1.0, top_p=1.0。
七、局限性分析
1. 仅 API 可用,终端未同步。当前阶段 Flash 正式版仅限 API 调用,DeepSeek 的 App 端、网页端以及 V4-Pro 的 API 均未同步更新。普通用户暂时无法直接体验,这限制了模型在 C 端场景的验证。
2. 纯知识任务仍逊于 Pro。技术报告显示,在纯知识任务(如 SimpleQA、HLE)和最复杂的智能体工作流上,Flash-Max 仍略逊于 Pro-Max。Flash 的优势集中在 Agent 执行和代码工程,而非百科问答。这与其 13B 的激活参数规模直接相关——知识容量受限于总参数池的大小。
3. 后训练方法的可复制性存疑。Flash 正式版的后训练方法目前未完全开源。两阶段范式的具体实现(SFT 数据配比、GRPO 奖励函数设计、on-policy 蒸馏的温度策略等)尚未公布技术细节。其他团队能否复制同样的"后训练奇迹",还需要更多实验验证。
4. 评测基准的生态偏差。AgentLastExam、DSBench 等测试虽为 2026 年新基准,但仍可能存在数据泄露或任务设计偏差。特别是 DeepSWE 从 7.3 到 54.4 的暴增,需要更多独立第三方复现来排除过拟合可能。
5. 硬件门槛。尽管 API 价格极低,但本地部署 Flash 模型仍需 4×GB300 级别的硬件,对中小团队而言自建推理服务的门槛依然不低。
结论:后训练范式转移的信号
DeepSeek-V4-Flash 正式版的发布,与其说是一次模型迭代,不如说是一次范式信号:大模型的竞争焦点正在从"预训练参数竞赛"转向"后训练精细化工程"。
当 284B/13B 的轻量模型通过后训练就能在 Agent 能力上逼近甚至超越 1.6T/49B 的旗舰模型时,行业需要重新评估"投入产出比"——继续堆参数的边际收益是否还值得?同样的算力预算投入后训练优化,能否获得更高的回报?
这个信号对整个开源社区尤为重要:它意味着中小团队不需要从头训练万亿参数模型,通过高质量的后训练也能在特定能力维度上达到接近前沿水平。Flash 正式版在 AgentLastExam 上仅落后 Opus 4.8 的 0.5 分,而单任务成本不到后者的三分之一——这是"智能平权"最有力的技术证明。
模型权重与技术报告已开源,MIT 协议可商用:
- HuggingFace: huggingface.co/deepseek-ai/DeepSeek-V4-Flash
- ModelScope: modelscope.cn/models/deepseek-ai/DeepSeek-V4-Flash
- 技术报告: arxiv.org/abs/2606.19348
- DSpark 推测解码: github.com/deepseek-ai/DeepSpec
更多 AI 与大模型领域的可视化项目与技术解析,欢迎访问我的开源仓库:https://github.com/wangzifan396-wzf/TW
本文由作者基于 DeepSeek 官方技术报告、ModelScope 模型页面及多个权威媒体报道交叉验证撰写。所有数据均来自公开来源,如发现数据错误欢迎指正。文章遵循 CC BY 4.0 协议,转载请注明出处。