阿里 Qwen3.8 正式发布:2.4 万亿参数的国产旗舰,Arena 榜单仅次于 Claude
2026/8/5 7:38:02 网站建设 项目流程

8月3日,阿里巴巴正式发布新一代基座大模型Qwen3.8,总参数量2.4万亿,在编程(Coding)和专业办公(Cowork)方面能力大幅提升。发布当天放榜的权威三方榜单Arena中,阿里Qwen模型仅次于Anthropic的Claude系列,整体性能处于全球大模型第一梯队。

这是继Kimi K3之后,国产大模型"两万亿俱乐部"迎来的又一位成员。

港股阿里巴巴早盘股价持续拉升,截至发稿涨近6%。

资本市场的反应,比任何评测榜单都来得更诚实。

这篇文章按时间线拆解这场发布,看看2.4万亿参数背后,阿里到底在下一盘什么棋。

7月19日的预告:半个月前就埋下的伏笔

这场发布并不是突然发生的。

7月19日下午,阿里千问大模型官方账号发文预告:Qwen3.8-Max预览版模型首发上线阿里Token Plan、Qoder及QoderWork三个产品。

预告里写得很直白:Qwen3.8很快将发布并开源,新模型参数达到2.4T。

"可能是除了Fable 5外最强大的模型。"

这句话在开源社区里被反复引用,因为它直接给新模型定了位:瞄准的是全球最强闭源模型的席位。

半个月后的8月3日,正式版如约而至。

从预览版到正式版的节奏,掐得比很多人的预期更紧。

预览版先给三个产品线用,等于提前在真实流量里做了压测。

Token Plan是阿里面向API重度用户的订阅计划,Qoder是编程助手,QoderWork是面向工作场景的智能体产品。

三个产品覆盖了消费侧、开发侧、办公侧三种完全不同的负载形态。

用真实产品验证模型,再用正式版承接全部流量,这套打法在商业上相当稳健。

2.4T参数与95B激活:稀疏MoE的又一次跃迁

Qwen3.8-Max是千问系列中尺寸最大、性能最强的旗舰模型。

在模型架构上,Qwen3.8通过稀疏MoE架构与混合注意力机制的联合优化,首次将千问大模型的总参数量拓展到2.4T。

总参数2.4T,激活参数只有95B。

这个数字组合意味着什么?

参数总量决定了模型的知识容量上限,激活参数决定了单次推理的实际计算量。

把2.4T参数塞进95B的激活预算里,靠的是MoE把模型拆成无数个专家子网络,每次推理只唤醒最相关的那一小部分。

稀疏激活的本质,是用更少的计算量换取更大的知识容量。

混合注意力机制的加入,则让模型在处理长上下文时不再被全量注意力计算拖垮。

这两个设计的直接结果是:更高的推理效率,更快的推理速度,以及整体性能的新突破。

Qwen3.8支持视觉理解,上下文长度达到1M Tokens。

一百万Token的上下文,意味着模型可以一次性吞下整本技术手册、整份代码仓库的说明文档,再开始工作。

长上下文与视觉理解的组合,是Agent类应用最需要的底座能力。

从架构选择上可以清楚看到,Qwen3.8不是为聊天设计的,是为执行设计的。

MoE与混合注意力的组合,在业界并不新鲜,但把总参数推到2.4T同时保持95B的激活量,需要的工程积累远超一般团队的能力范围。

专家路由的负载均衡、长上下文下的注意力稀疏化、多模态输入与文本输入的共享专家分配,每一环都是硬骨头。

千问团队敢把这三个难题一起做进旗舰模型,说明这套架构已经在内部验证了足够长的时间。

Arena榜单:仅次于Claude的国产旗舰

发布当天放榜的权威第三方榜单Arena中,阿里Qwen模型仅次于Anthropic的Claude系列。

整体性能处于全球大模型第一梯队,这个表述第一次和国产开源模型放在一起显得如此顺理成章。

在权威Vision Arena榜单中,Qwen3.8-Max排名全球第二。

视觉榜单的含金量不亚于文本榜单,因为多模态能力正在成为旗舰模型的标配战场。

文本与视觉双线并进,说明这次发布不是单项补强,而是整体换代。

Arena榜单的排名来自全球用户的匿名盲测投票,不是实验室自报分数。

这意味着Qwen3.8在真实使用体验层面,已经追上了过去两年被认为不可逾越的差距。

盲测投票的样本来自全球开发者、研究人员和普通用户,他们在不知道模型身份的情况下对比回答质量。

这种评测方式最贴近真实使用感受,也最难被刷分操纵。

仅次于Claude系列这个结果,等于全球用户用脚投票投出来的结论。

一串可以核对的分数

Qwen3.8在指令遵循IF Bench评测中斩获82.8分。

科学推理GPQA Diamond取得92.6分。

在视觉推理BabyVision评测中,Qwen3.8-Max在无工具条件下取得82.0分,超出部分主流模型近两倍。

在评估智能体电脑操作能力的OSWorld-Verified评测中,Qwen3.8-Max以86.1分位居主流模型首位。

把这几组数字放在一起看,会更清楚Qwen3.8的侧重在哪里:

评测项分数位置
IF Bench 指令遵循82.8全球前列
GPQA Diamond 科学推理92.6全球前列
BabyVision 视觉推理(无工具)82.0超出部分主流模型近两倍
OSWorld-Verified 电脑操作86.1主流模型首位
Vision Arena 视觉榜单全球第二
CodeArena 编程榜单全球第四

指令遵循、科学推理、视觉推理、电脑操作、编程,五个维度全部进入全球前列。

这不是单项冠军,而是六边形战士。

尤其值得注意的是OSWorld-Verified的86.1分。

这个基准模拟的是模型像人一样操作电脑的完整流程:看屏幕、点按钮、填表单、读反馈。

它是Agent能力最直接的度量衡之一,也是从"会聊天"到"会干活"的分界线。

模型在OSWorld上的分数,直接决定了它能不能胜任自动化办公、自动化运维这类高价值任务。

86.1分位居首位,意味着至少在电脑操作这个维度上,Qwen3.8已经是最能干的模型。

如果说两年前的大模型比赛比的是"谁更会说话",那么现在比的是"谁更会办事"。

OSWorld这类基准的出现,本身就是行业风向转变的标志:评测标准在从对话能力向执行能力迁移。

Coding:从"写好函数"到"交付项目"

编程能力是前沿大模型的核心能力之一,Qwen3.8实现了自主编程的新突破。

在权威CodeArena榜中,Qwen3.8位居全球第四。

两年前的前沿模型能写好函数、补全代码,成为程序员的有力帮手。

而如今的Qwen3.8,可以从一个空文件夹出发,自主完成一个十数天的真实项目交付,全程无需人干预。

注意这句话的每一个限定词:空文件夹,真实项目,十数天,全程无需人干预。

这不是demo级的代码生成,而是把软件工程里的需求拆解、架构设计、编码实现、测试修复、文档编写全部打包进了一次自主执行。

编程能力的评价标准已经变了:从"能不能生成代码"变成"能不能把项目跑起来"。

对开发者来说,这意味着人机协作的粒度可以进一步下探:人类负责定义目标,模型负责执行过程。

十数天的项目周期,对应的是真实业务系统的开发量级,不是玩具项目。

从函数补全到项目交付,中间跨越的是工程能力的整条链路。

这条链路里最难的环节不是写代码,而是保持目标一致:十几天的时间里,模型需要记得最初的需求,抵抗中途的各种干扰,持续向最终目标推进。

这也是为什么自主编程比代码生成难出一个量级:生成只需要局部正确,交付要求全局一致。

RecreationBench:从零复刻一个应用

千问团队构建了一个名为RecreationBench的"应用复刻"基准,用来测试长程任务能力。

在这个基准里,模型没有源代码,也无法联网,只通过交互与反馈去理解一个应用。

结果,Qwen3.8从零复刻出了整个应用。

这意味着模型已经展现出前沿水准的混合多模态智能体能力。

它通过"迭代编程—交互反馈"的反复循环,把视觉编程(Visual Coding)推向新的高度。

模型先看界面,再猜逻辑,再动手写,再看反馈,再改。

这已经不是一个"生成器",而是一个"工程师"。

从零复刻应用与普通代码补全之间,隔着整个软件工程方法论的距离。

这类长程任务考验的是模型的记忆保持、错误修正和目标管理能力,任何一环断裂都会导致任务失败。

Qwen3.8能完成从零复刻,说明它的Agent能力已经通过了最严格的压力测试。

这个能力放到真实世界里,就是"你给我描述一个系统,我还你一个能跑的实现"。

对企业来说,这意味着很多重复性的开发需求可以完全交给模型,人力只负责验收和迭代。

Cowork:真实环境与算力联合强化学习

除了Coding,Qwen3.8的另一条主线是Cowork,专业办公能力。

面对完全不同的专业任务、评判标准和计算需求,Qwen3.8通过真实环境和算力的联合强化学习(RL)扩展,实现了数百种高价值、高频专业任务的真实表现提升。

普通模型的RL训练是在模拟环境里打游戏,Qwen3.8的RL是在真实的工作流里干活。

在主流的智能体框架中,Qwen3.8都可以稳定可靠地交付生产级成果。

这背后的训练成本极高,但效果也极其直接:模型不是在考试卷上刷分,而是在工位上干活。

数百种专业任务的覆盖面,意味着它不再是某一个垂直场景的专用模型,而是可以横跨多种工作类型的通用执行体。

联合RL的关键词是"联合":环境是真实的,算力是真实的,反馈也是真实的。

这样的训练信号密度,远高于任何人工标注的合成数据。

从效果上看,Cowork能力决定了模型在Agent产品里能不能真正顶上去干活,而不是只当个问答机器人。

RL扩展的真正价值在于把"知道怎么做"变成"真的会做"。

这也是为什么阿里要把训练放到真实环境和算力里:合成的训练数据可以教模型回答问题,但教不会模型处理真实世界的噪声和不确定性。

千问办公:Agent产品与模型同步落地

阿里今日同步推出了Agent产品"千问办公",Qwen3.8已经接入其中。

模型发布当天就有配套的Agent产品落地,这个节奏值得注意。

过去的一年里,各家厂商的路径分化得很明显:有的先发模型再找场景,有的先做产品再等模型。

阿里选择了第三条路:模型和Agent产品同一天发布,从第一天起就让模型在真实办公场景里跑。

这符合Agent时代的竞争逻辑:模型能力只是起点,谁能更快地把能力封装进可用的产品,谁就掌握了分发入口。

千问办公的定位,是把专业办公任务从"人操作软件"变成"模型操作软件,人审核结果"。

办公场景是最适合Agent落地的战场:流程标准、反馈明确、价值可量化。

模型接进办公产品,意味着从第一天就有真实用户在真实任务上打磨它。

这种"发布即使用"的节奏,和传统大模型"发布后等生态"的模式形成了鲜明对比。

阿里云生态里沉淀了海量的企业级应用场景:财务、人力、法务、供应链、客服,每个场景都是一座金矿。

千问办公把这些场景串起来,等于把Qwen3.8直接送到了最能产生价值的地方。

这也是大模型竞争从"模型军备竞赛"走向"场景落地竞赛"的缩影。

价格:每百万Token输入12元、输出36元

今日起,全球开发者都可以通过千问AI平台获得Qwen3.8的API服务。

国内定价:每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元。

国际定价同样激进:输入与输出的国际价格仅为Opus5的40%与24%。

把价格换算成百分比,看起来会更直观:

计费项国内价格(每百万Token)相对Opus5
输入12元40%
输出36元24%
隐式缓存命中1.5元

相近的智能,更低的成本,这是开源生态最熟悉的进攻方式。

对开发者来说,这意味着用Opus5一个零头的成本,就能跑起一个同档次的模型。

隐式缓存命中1.5元的价格,更是为Agent循环这类高重复度的调用场景量身定做。

Agent任务里,系统提示词、工具定义、上下文窗口往往反复命中缓存,缓存价格直接决定单次任务的总成本。

把缓存打到1.5元,等于给Agent开发者发了一张长期折扣券。

价格战的本质是成本结构战,谁的单位算力成本更低,谁就能把价格压得更久。

阿里敢定这个价,说明它在推理侧的规模效应已经跑通了。

对独立开发者来说,这个价格直接改变了Agent应用的商业模式:以前跑一个复杂的Agent任务,token成本可能吃掉全部利润,现在可以放心地让模型多思考、多调用工具。

成本下降解放的是使用习惯,而使用习惯决定生态的繁荣程度。

真武M890超节点:1.5倍的Agentic推理提升

阿里真武M890超节点也已成功适配Qwen3.8。

通过芯片、云平台与千问大模型的全链路优化,显著提升推理效率、降低推理成本。

在Agentic推理场景中,最多可实现1.5倍性能提升。

注意这个数字背后的含义:Agent推理和普通对话推理的负载特征完全不同。

Agent需要频繁的工具调用、长上下文维持、多轮状态管理,对推理系统的要求苛刻得多。

真武M890针对这类场景做全链路优化,说明阿里已经预见到Agent将是旗舰模型的主战场。

软硬件协同优化,正在成为大模型竞争的下一个分水岭。

同样的模型,在不同推理系统上的成本和延迟可以相差一倍以上。

把芯片、云平台和模型放在一起调优,正是阿里云相对独立芯片厂商的独特优势。

芯片厂商只能优化通用的推理路径,而阿里云可以针对Qwen3.8的MoE路由、注意力机制和工具调用模式做定制优化。

这种"模型定义芯片优化方向"的做法,正在成为大厂的新壁垒。

对使用云服务的开发者来说,1.5倍的性能提升意味着同样的预算可以支撑更多的并发请求,或者把响应时间压到更短。

下周开源:Max与27B的双重布局

Qwen3.8-Max预计下周开源,同时还将开源Qwen3.8-27B。

一个2.4T参数的旗舰模型选择开源,这在全球范围内都是极具冲击力的决定。

开源意味着任何人都可以下载权重、本地部署、微调定制。

27B的小尺寸版本则覆盖了另一类需求:资源受限的边缘场景、私有化部署、以及希望深度定制的中小团队。

大模型开源这条路,从Qwen系列的第一代走到今天,一直是阿里最坚定的战略。

每一次发布,都在把开源模型的性能上限往上推一截。

而这次,上限被推到了仅次于Claude的位置。

开源与闭源的双轨竞争,正在进入白热化阶段。

2.4T旗舰开源还有一层生态意义:给整个开源社区提供了一等公民级别的底座。

社区可以在它上面做微调、做蒸馏、做垂直模型,整个开源生态的起点都会被抬高。

这也是为什么开源圈把这次发布称为"分水岭时刻"。

不过也要提醒一句:2.4T的权重下载和部署门槛不低,需要多卡集群才能跑起来,普通开发者更现实的路径是用API,或者等27B版本。

阿里同时开源两个尺寸,正是为了让不同资源条件的开发者都能上车。

开发者的第一行代码

对开发者来说,Qwen3.8接入应用的方式和OpenAI兼容接口保持一致。

如果你已经在用OpenAI的SDK,那么切换到Qwen3.8只需要改两个参数。

下面是调用Qwen3.8 API的真实示例,可以直接运行:

from openai import OpenAI client = OpenAI( api_key="你的千问API密钥", base_url="https://dashscope.aliyuncs.com/compatible-mode/v1", ) response = client.chat.completions.create( model="qwen3.8-max", messages=[ {"role": "system", "content": "你是一名资深后端工程师。"}, {"role": "user", "content": "设计一个订单系统的幂等接口,说明关键设计点。"}, ], max_tokens=2048, temperature=0.7, ) print(response.choices[0].message.content)

这段代码里,base_url指向阿里云DashScope的OpenAI兼容模式,model参数填qwen3.8-max。

其余的部分,和调用任何OpenAI兼容接口没有任何区别。

Agent场景下的调用方式也很直接,工具调用(function calling)沿用OpenAI的格式。

模型返回tool_calls字段,你的Agent循环解析后执行工具,再把结果传回给模型。

从对话到工具调用,从单轮到多轮,迁移成本被压到了最低。

这正是开源旗舰模型生态的威力:接口标准统一,切换成本趋近于零。

对于已经在生产环境跑着Agent服务的团队,这意味着一次改配置就能完成模型升级。

唯一需要评估的是数据合规和网络链路,其余全部无缝衔接。

对于已经有OpenAI迁移经验的团队,这个过程可能只需要一个下午。

迁移成本越低,新模型被采用的速度就越快,这是大模型市场最朴素的规律。

两万亿俱乐部的攻守转换

Qwen3.8的发布,把国产大模型的竞争带进了新阶段。

Kimi K3的2.8万亿参数、Qwen3.8的2.4万亿参数,两万亿俱乐部里已经站着两家。

更重要的是,这两家的路线形成了有趣的对照:一家在闭源与开源的边界上游走,一家把旗舰模型彻底开源。

开源模型的性能天花板每被抬高一寸,闭源厂商的定价权就被削弱一分。

阿里选择在这个时间点把2.4T参数的旗舰开源,等于在告诉市场:最强的模型,不一定要藏起来卖。

从行业格局看,这次发布有三个层面的影响。

第一层是价格锚点:12元输入、36元输出、1.5元缓存的定价,会把同档模型的全球定价再往下拉一截。

第二层是开源天花板:2.4T旗舰开源后,闭源模型的差异化空间被进一步压缩,竞争焦点被迫转向产品、服务和生态。

第三层是Agent赛道:千问办公同步落地,OSWorld 86.1分,意味着Agent应用有了更便宜的国产底座。

对开发者来说,这是最好的时代:全球第二梯队的性能,开源权重,1.5元的缓存命中价格,下周就能拿到手。

剩下的问题只有一个:你打算拿它做什么。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询