Hunyuan-A13B Technical Report
作者:Tencent Hunyuan Team, Ao Liu, Botong Zhou, Can Xu, Chayse Zhou, ChenChen Zhang, Chengcheng Xu, Chenhao Wang, Decheng Wu, Dengpeng Wu, Dian Jiao, Dong Du, Dong Wang, Feng Zhang, Fengzong Lian, Guanghui Xu, Guanwei Zhang, Hai Wang, Haipeng Luo, Han Hu, Huilin Xu, Jiajia Wu, Jianchen Zhu, Jianfeng Yan, Jiaqi Zhu, Jihong Zhang, Jinbao Xue, Jun Xia, Junqiang Zheng, Kai Liu, Kai Zhang, Kai Zheng, Kejiao Li, Keyao Wang, Lan Jiang, Lixin Liu, Lulu Wu, Mengyuan Huang, Peijie Yu, Peiqi Wang, Qian Wang, Qianbiao Xiang, Qibin Liu, Qingfeng Sun, Richard Guo, Ruobing Xie, Saiyong Yang, Shaohua Chen, Shihui Hu, Shuai Li, Shuaipeng Li, Shuang Chen, Suncong Zheng, Tao Yang, Tian Zhang, Tinghao Yu, Weidong Han, Weijie Liu, Weijin Zhou, Weikang Wang, Wesleye Chen, Xiao Feng, Xiaoqin Ren, Xingwu Sun, Xiong Kuang, Xuemeng Huang, Xun Cao, Yanfeng Chen, Yang Du, Zhen Yang, Yangyu Tao, Yaping Deng, Yi Shen, Yigeng Hong, Yiqi Chen
核心发表机构:Tencent
论文链接:arXiv:2609.27284v1
发布于:arXiv 预印本(cs.AI)
一、核心贡献 / Core Contributions
- 高参数效率的细粒度稀疏 MoE 架构:Hunyuan-A13B 总参数 80B,推理时仅激活 13B,采用 1 个 shared expert 加 64 个 fine-grained non-shared experts 的结构,每次仅激活 8 个 non-shared expert。该设计使模型在推理吞吐和部署成本上明显优于同等能力的 dense 模型,同时保持了对齐更大规模 MoE 模型的能力上限。
- 严格过滤的 20T-token 预训练语料与 STEM 增强:通过复用并针对 Hunyuan-A13B 优化的数据整理管线(含预处理、模型抽取与后处理三阶段),论文额外成功提取了 250B 高质量 STEM token,并设计 refined knowledge labeling system 与 multi-dimensional difficulty grading framework,用于提高标签准确性和多维语料筛选效率。
- 四步式后训练流程与大规模强化学习:后训练分为 reasoning-oriented SFT、targeted RL、general-purpose SFT、generalized RL 四个阶段;其中推理导向 RL 基于 GRPO,引入 outcome reward model(二元奖励r ∈ { 0 , 1 } r \in \{0,1\}r∈{0,1})与覆盖 36 种语言、支持超过 1000 并发执行的代码沙盒反馈;全场景 RL 则统一了灵活 GRM 与领域专用奖励管线,覆盖 16 个子主题与超过 30 个评分服务。
- 统一训练的双模式 Chain-of-Thought:通过统一的训练结构同时支持 fast-thinking 与 slow-thinking 两种推理模式,以
<think>块是否为空作为区分,并通过/no_think与/think控制标签在推理时切换,未提供控制标签时默认为 slow-thinking。 - 面向延迟敏感场景的高推理吞吐:论文报告了在 A16W16C16 精度下的吞吐测试结果,batch=1 时达到190.84 190.84190.84tokens/s,batch=32 时达到1981.99 1981.991981.99tokens/s,并支持与 vLLM、SGLang、TensorRT-LLM 等主流推理框架以及多种量化格式集成。
二、研究背景与动机 / Background & Motivation
当前大语言模型的能力提升在很大程度上依赖于模型参数规模的扩张,但参数规模的扩张同时带来了推理延迟上升、硬件成本增加以及部署门槛提高等问题。论文在 Introduction 中明确将 GPT-4o、o1、o3、Gemini 2.5、DeepSeek-R1、Qwen3 等列为先进系统,并指出这些系统的部署通常伴随着很高的计算资源需求与推理延迟。对于需要实时响应、资源受限或要求快速可靠预测的应用场景而言,这种能力—成本之间的矛盾构成了核心挑战。
Mixture-of-Experts(MoE)架构被广泛视为缓解该矛盾的有效途径:通过稀疏激活,模型可以在保有较大参数容量的同时,将单次推理的实际计算量控制在远低于总参数量的水平。Hunyuan-A13B 正是基于这一思路设计,总参数 80B,但单次推理仅激活 13B,目标是在模型能力、计算效率与部署成本之间取得平衡。与论文中列出的 Hunyuan-Large-1116(MoE,激活 52B、总参 389B)、Qwen2.5-72B(Dense,72B)、Qwen3-A22B(MoE,激活 22B、总参 235B)相比,Hunyuan-A13B 的激活参数只是其中最小的一档。
论文的第二个动机来自预训练数据质量。摘要指出,模型在严格过滤的 20T-token 语料上预训练,并特别增强了 STEM 数据的整理,以提升 factual reliability 与 reasoning ability。源代码笔记显示,除了复用 Hunyuan-TurboS 的数据管线之外,团队针对 STEM 数据做了额外的获取与清洗优化,最终获得 250B 高质量 STEM token,并通过 refined knowledge labeling system 与 multi-dimensional difficulty grading framework 支撑多维语料的筛选。
第三个动机来自推理范式的效率问题。复杂多步问题往往需要长链推理,而常规查询并不需要。若所有请求都走长链推理路径,会造成不必要的 token 消耗和延迟。Hunyuan-A13B 因此引入 dual-mode Chain-of-Thought:fast-thinking 模式用于常规查询、追求低延迟;slow-thinking 模式用于复杂、多步问题、追求更深的推理步骤(如 reflection 与 backtracking)。用户可根据应用复杂度与资源约束灵活选择,从而在效率与任务特定准确性之间取得平衡。
三、方法 / Methodology
3.1 总体框架 / Overall Architecture
Hunyuan-A13B 的方法体系可以分为预训练与后训练两大部分,并辅以一个贯穿推理阶段的 dual-mode CoT 机制。
预训练采用三阶段顺序流程。第一阶段是 Foundation Training Stage,处理总量为 20T token,上下文窗口固定为 4096。学习率调度分为三段:先做线性 warmup,将学习率升至最大值3 × 10 − 4 3 \times 10^{-4}3×10−4;然后在 13.5 trillion tokens 内做 cosine decay,降至最小值3 × 10 − 5 3 \times 10^{-5}3×10−5;剩余训练步骤保持该最小值。第二阶段是 Fast Annealing Stage,起始学习率3 × 10 − 5 3 \times 10^{-5}3×10−5,在 300B tokens 上快速 cosine decay 至8 × 10 − 6 8 \times 10^{-6}8×10−6,上下文窗口增加到 8192。第三阶段是 Long-Context Training Stage,分两步扩展上下文:先扩到 32K,再扩到 256K;位置编码采用与 Hunyuan-TurboS 相同的 NTK-aware 方案,32K 阶段 alpha 取 50,256K 阶段 alpha 取 1000。
后训练采用结构化、多阶段的方法,包含两类互补的微调:reasoning-oriented fine-tuning 与 general-purpose(all-scenarios)fine-tuning。Introduction 给出的四步顺序为:先做 reasoning-oriented SFT,再做 targeted RL 以增强推理能力;随后做 general SFT 覆盖多领域任务,最后做 generalized RL 以增强更广泛的 instruction-following 能力。
推理阶段的 dual-CoT 机制与上述后训练流程配套:训练时两种模式采用共同的结构化格式,区别仅在于<think>内容块中是否包含详细的逐步推理;推理时用户通过控制标签选择模式。
3.2 关键模块 / Key Modules
MoE 架构与专家配置。Hunyuan-A13B 采用 fine-grained MoE,具体构成是 1 个 shared expert 与 64 个 fine-grained non-shared/specialized experts,所有专家具有相同的 intermediate dimension。训练时 shared expert 始终激活,只有 8 个 non-shared experts 同时激活,由此得到 80B 总参数与 13B 激活参数的组合。该配置的确定基于作者对 MoE 架构 scaling laws 所做的大量实验:没有 shared expert 的模型通常差于至少有 1 个 shared expert 的模型;而 shared expert 数量超过 1 之后收益递减,仅有边际改善甚至出现性能波动,因此最终选择 1 个 shared expert。
其他架构组件。激活函数采用 SWiGLU,与 Hunyuan-Large、Hunyuan-TurboS 保持一致;注意力机制采用 Grouped-Query Attention(GQA)以提升 KV Cache 的内存效率;Tokenizer 与 Hunyuan-Large 相同,词表大小为 128K。表 1 给出的关键超参数包括:层数 32、Attention heads 32、Key/Value heads 8、Shared Experts 1、Specialized Experts 64、Activated Specialized Experts 8、Hidden Size 4096、FFN Hidden Size 3072。
预训练数据管线。复用 Hunyuan-TurboS 的数据整理管线,包含三个模块:Data preprocessing module 负责去重、低质量过滤、数据去噪与主题标注;Model-based extraction module 从前一模块输出的数据中提取纯文本;Post-processing module 对提取语料做低质量过滤与语义级去重。针对 Hunyuan-A13B 的优化集中在 STEM 数据的获取与清洗流程,最终并入 250B 高质量 STEM token。
推理导向 SFT 数据构建。该阶段目标是加强数学推理、逻辑推断、代码生成与科学分析等复杂推理任务,使用精心策划的 instruction-response 数据集,并要求包含显式推理过程与详细 CoT 解。数学数据来自教材、标准化考试与数学竞赛,难度覆盖基础算术到高级奥林匹克级;构建时使用 SOTA 生成奖励模型与自动解题验证机制迭代评估和精炼 CoT 示例,只保留严格验证过的推理解答对。代码数据来自精心选择的开源仓库(例如 GitHub),采用引用 Magicoder 的成熟 pipeline 将代码片段系统转化为结构化指令推理对,覆盖多种任务、编程语言与问题类型,并通过涉及 critic models 与 sandbox execution tests 的多阶段验证确保正确性、逻辑连贯性与可执行性。逻辑数据来自版权和公开可用的谜题集合,并采用受 ZebraLogic 启发的自动数据合成方法进行扩展,按问题类型和难度系统分类,质量保证分两层:标准场景由自动 CoT 评估模型处理,复杂案例由人工标注者验证。科学数据覆盖物理、化学、生物等学科,难度从中学到研究生水平,使用 LLM 评估问题难度与质量,高级大学考试题与科学奥林匹克题经 advanced LLM-based verifier 严格审查,验证重点是识别并纠正单位换算、数值近似、化学符号等细微科学差异,最终只纳入通过 rejection sampling 的样本。
推理导向 RL。在 SFT 模型基础上,针对四个领域进一步 RL,算法采用 Group Relative Policy Optimization(GRPO)。奖励分两类:一是 Outcome Reward Model,即轻量语言模型 verifier,评估生成答案与参考解之间的一致性,奖励为二元值r ∈ { 0 , 1 } r \in \{0,1\}r∈{0,1},1 表示对齐、0 表示不对齐,设计上刻意规范化格式、单位换算、同义词等表面差异以减少 false negatives,应用于数学、逻辑与科学评估;二是 Sandbox Feedback,即多语言代码沙盒,支持 36 种编程语言(如 Python、C++、Go、Java),部署在分布式 CPU 集群上,支持超过 1000 次并发执行,并采取严格安全措施(包括文件隔离与网络隔离)防止恶意代码执行。RL 的 prompt 从 SFT 模型表现不稳定的案例中采样,数据集规模为 150K samples,领域比例为 Mathematics : Coding : Logic : Science= 2 : 2 : 1 : 1 = 2:2:1:1=2:2:1:1;与 SFT 训练数据的关系是 10% 重叠、90% 为新案例。题型方面排除了 multiple-choice、true/false 与 proof-based problems,以避免奖励猜测、确保结果可验证。
RL 训练分为两个上下文长度阶段,灵感来自 deepscaler2025:Phase 1 使用 24K 长度上下文,Phase 2 扩展到 32K,目的是系统性增强推理深度。训练配置上,参考 yu2503dapo 移除了 KL divergence constraint,使策略更新更灵活;同时采用 on-policy learning strategy、大 batch、增加的 rollout 数量以及相对较低的采样温度(0.6 0.60.6–0.8 0.80.8)。论文的结论是这些措施 collectively benefit the RL training process。
全场景 SFT。在模型已具备复杂推理能力的基础上,该阶段从专门推理数据集中采样一部分,并与通用领域样本混合进行 SFT。补充数据集覆盖八类能力:Language Understanding Tasks 强调理解、准确翻译与流畅文本生成,严格排除不清晰或歧义指令,通过先进 response scoring models 验证响应且明确阻止 reward manipulation,并对语言指令数据进行迭代专家重写;Creative Writing 按 genre、style、tone、narrative structure 标注以保证多样性,通过 discriminative reward modeling 过滤低质量或不稳定样本,再用迭代自改进加专家辅助重写;Multilingual Tasks 通过 advanced augmentation、instruction-evolution 与 back-translation 合成覆盖英语及其他多种语言的代表性指令数据集,并由专门语言专家监督标注与验证;Complex Instruction Scenarios 合成包含不同约束、需要广泛上下文整合与 agent-driven requirements 的数据集,用基于规则的方法保证响应遵守约束,长上下文任务要求跨不同文本片段综合信息,复杂交互要求工具使用、战略规划、反思与多阶段推理;Role-based Interaction 基于不同人格特质构建多样角色档案,用复杂 prompt-engineering 生成符合人设的对话样本,并以 trait accuracy、instruction adherence、emotional empathy 作为评估指标;Knowledge-Based QA 采用多层验证策略,由专门 critic models 系统过滤不准确与无根据的信息,以缓解幻觉;Multi-Turn Dialogues 整合开源数据、vendor-sourced materials、controlled data synthesis 与 advanced pseudo-dialogue techniques,覆盖 task-oriented conversations、social dialogues 与 QA exchanges;Agent 类数据的构建目标是增强 planning、tool invocation、reflection 等对话交互技能,其中正文提到开发了一个包含 user、planner、tool、agent、checker 五个角色的多角色合成数据引擎以模拟真实多方对话,并整合 sandbox tools、model context protocols (MCPs)、synthetic tools 三个数据源获取工具响应,同时针对 fast/slow thinking 数据不平衡优化 prompt 策略并训练一个特殊模型生成思考过程,设计超过 30 种 agent system instructions,结合工具、动作、响应的格式变化创建20,000 20{,}00020,000种格式组合,并重点增强 Excel 处理、deep search 等高频率任务。
需要说明的是,源代码笔记指出 Agent 的详细小节在源码中位于\iffalse ... \fi注释块内,未作为正式排版内容,且该注释版本的五角色命名为 User、Planner、Responser、Agent、Checker,与正文版本(user、planner、tool、agent、checker)存在命名差异,属于源码内部版本差异,不代表同一套描述。注释版本的补充细节还包括:环境反馈生成区分 sandbox tools(通过受控环境收集真实信息)、MCPs(从开源工具包获得结构化反馈)与 synthetic tools(先生成多样工具再由 LLM 模拟响应),前两者提供真实数据但成本高、工具多样性受限;在思考过程生成上,由于 fast-thinking 数据远多于 slow-thinking 数据,团队将 fast-thinking 数据多样性转移到 slow-thinking、挖掘更高难度样本并附加思考过程,并把 agent 执行过程抽象为 Markov 过程,针对访问外部信息带来的低效思考生成与执行流扰乱两个问题,先优化思考链生成 prompts,再选择高质量 action-thinking chain 对训练专门模型;模板泛化方面随机选择 20% 的训练数据为每个样本生成格式泛化版本;特定能力增强上优化 Excel 处理、AI 搜索、基于代码的数学问题求解与 MCP 调用。注释版 RL 还给出了更细的奖励规则:通过所有测试用例得+ 1 +1+1;错误或测试失败时为 0 或按错误类型为负(例如语法错误− 0.5 -0.5−0.5、逻辑错误− 0.3 -0.3−0.3),且奖励分配仅在固定代码通过单元测试后触发。
全场景 RL。该阶段将优化扩展到通用任务,重点是集成多样奖励机制与任务特定框架以确保鲁棒泛化。核心组件是 Generative Reward Model(GRM),遵循 zhang2024generative、mahan2024generative、xu2025unifiedpairwiseframeworkrlhf 一类工作:GRM 将候选答案与 reference answer 比较;对创意写作等开放式任务,reference answer 作为语义锚点;对闭卷 QA 等确定性任务,使用 ground-truth;GRM 可选摄入 CoT reasoning traces 以提高多步推理任务的判断准确性,并能调用外部工具、报告长度统计、检查输出是否符合任务约束,从而通过精心构造的 prompts 评估正确性。每个 track 由 dedicated reward service、对应的 preference datasets and rules 与专门设计的数据构建管道支持:Text Understanding 使用一致性模型(客观 Q&A)与比较 GRM(主观或开放式任务);Translation 由领域专家标注平行语料并据此训练 GRM 提供忠实奖励;Long Context 增加 hallucination-focused reward model 与 online RL 以增强稳定性;Creative Writing 使用基于相对偏好判断的成对 GRM 缓解 reward hacking,并将创意奖励与自动化指令遵循检查混合;Agents 使用 sandbox tools 与 MCPs 提供信息反馈并构建基于规则的奖励,奖励函数含 format reward(正确特殊标记与顺序为 1、否则为 0)与 correctness reward(评估预测与参考之间工具、参数、值的一致性)两个组件;Multi-Turn Dialogue 使用对话特定 critic models 与通用奖励;Complex Instructions 使用约束提取与满足工具,辅以通用 critic 与奖励模型;Role-Playing 评估指令理解、角色一致性与共情;Safety 使用分类器与拒绝启发式识别安全响应对并将安全对齐直接集成到偏好数据集;Knowledge QA 使用有/无参考访问的幻觉检测模型与以用户体验为中心的模型联合优化;Multilingual 使用 GRM 采样并评分 SFT 答案,保留高多样性、答案方差和质量的 prompts;Finance、Legal、Medical 领域则基于一致性的奖励从专业考试中识别不稳定项目提供偏好数据。整体上,All-Scenarios RL 统一了灵活 GRM 与领域特定管道,覆盖 16 个子主题与超过 30 个评分服务,并通过对抗性 prompt 过滤与动态采样确保跨域泛化。
Dual-Mode Chain-of-Thought。Fast-thinking 模式输出简洁高效、适合较简单任务,需要速度与最小计算开销;slow-thinking 模式包含更深、更全面的推理步骤(如 reflection 与 backtracking),导致更长 CoT 与更多 token 使用,但显著提高复杂推理任务的准确性与鲁棒性。后训练采用统一训练结构同时优化两种模式,两种训练示例采用共同结构化格式,区别在于 dedicated<think>内容块中是否有详细推理步骤:fast-thinking 的<think>块故意为空(源码写作"<think>\n\n</think>"),slow-thinking 的<think>块显式包含逐步推理。推理时用户通过/no_think选择 fast-thinking、通过/think选择 slow-thinking,未提供控制标签时系统默认 slow-thinking。
四、实验 / Experiments
4.1 数据集与评估指标 / Datasets & Metrics
预训练模型评测从四个核心能力维度展开:general tasks、coding、mathematics、multilingual capabilities。具体基准设置为:General Tasks 包括 MMLU(5-shot)、MMLU-Pro(5-shot)、MMLU-Redux(5-shot)、BBH(3-shot)、SuperGPQA(5-shot,CoT);Coding Tasks 包括 EvalPlus(0-shot)、MultiPL-E(0-shot,语言含 Python、C++、JAVA、PHP、TypeScript、C#、Bash、JavaScript)、MBPP-3shot、CRUXEval(1-shot);Math & STEM Tasks 包括 MATH(4-shot,CoT)、CMATH、GSM8K(4-shot,CoT)、GPQA(5-shot,CoT)。对比模型为 Hunyuan-Large-1116(MoE,激活 52B,总参 389B,上下文 256K)、Qwen2.5-72B(Dense,72B,128K)、Qwen3-A22B(MoE,激活 22B,总参 235B,128K)与 Hunyuan-A13B(MoE,激活 13B,总参 80B,256K)。
后训练模型评测覆盖数学、科学、编码、推理、指令遵循、文本生成、NLU、Agent 等能力。具体设置为:Mathematics 使用 MATH、AIME 等高级竞赛数据集;Science 使用 GPQA-Diamond、OlympiadBench;Coding 使用 LiveCodeBench、FullstackBench、McEval,并引入用于评测 LLM 前端代码生成能力的 ArtifactsBench(论文称即将公开);Reasoning 使用 BBH、ZebraLogic、DROP(F1 指标);Instruction Following 使用 IFEval、SysBench;Text Generation 使用两个内部基准 LengthCtrl(衡量模型精确遵守预定义输出长度约束的能力)与 InsCtrl(评估模型准确理解和执行复杂文本指令的熟练度);NLU 使用两个内部基准 ComplexNLU(高级和长尾推理任务)与 Word-Task(词级细粒度词汇和语义理解);Agents 使用 BFCL v3、τ-Bench、ComplexFuncBench、C³-Bench,模拟多轮任务、长上下文、复杂工具交互与多样调用策略。
长上下文评测使用四个基准:PenguinScrolls 是高质量人工标注数据集,面向真实用户体验场景,覆盖 Information Extraction、Information Localization、Qualitative Analysis、Numerical Reasoning 四类长文本任务,文本类型包括书籍、财务报告、法律文件与学术论文;LongBench-v2 评估通用长上下文理解,覆盖 single-document QA、multi-document QA、long in-context learning、long-dialogue history understanding、code repository understanding、long structured data understanding 六类任务,强调深度理解与推理而非简单检索;FRAMES 面向 Retrieval-Augmented Generation(RAG)场景,同时评估 factuality、retrieval accuracy 与 reasoning,使用需要整合多来源信息的 multi-hop questions;RULER 用于理解模型性能如何随上下文长度增加而扩展,可配置序列长度和任务复杂度,论文选择 QA 子任务,因为其更接近真实场景且任务捷径少。对比模型为 Gemini 2.5 Pro、DeepSeek R1、Qwen3-A22B 与 Hunyuan-A13B。
效率评测使用表tab:performance_comparison(标题为 Model Throughput of Hunyuan-A13B),在 A16W16C16 精度设置下测试不同 batch size 与输出长度下的吞吐。
需要说明的是,源代码笔记明确表示片段中未给出 SFT 与 RL 的显式损失函数公式,因此本节不涉及损失函数的描述。
4.2 主实验结果 / Main Results
预训练模型评测结果。论文称与 Hunyuan 团队早期开源 MoE 模型 Hunyuan-Large 相比,Hunyuan-A13B 在 14 个评测基准中 12 个更好,且仅使用约 1/4 激活参数与约 1/5 总参数;与总参数规模相似的 Qwen2.5-72B 相比,Hunyuan-A13B 在几乎所有评测基准上得分更高;与总参数约 3 倍、激活参数约 2 倍的 Qwen3-A22B 相比,Hunyuan-A13B 在 12 个评测基准中的 7 个超越。
具体数值方面,General Tasks 上 Hunyuan-A13B 的表现为 MMLU 88.17、MMLU-Pro 67.23、MMLU-Redux 87.67、BBH 87.56、SuperGPQA 41.32。其中 MMLU-Redux 为该组最高分,MMLU 接近该组最高的 Hunyuan-Large-1116(88.40)。Coding Tasks 上为 EvalPlus 78.64、MultiPL-E 69.33、MBPP 83.86、CRUX-I 70.13、CRUX-O 77.00,其中 EvalPlus、MultiPL-E、MBPP、CRUX-I 均为该组最高分。Math & STEM Tasks 上为 MATH 72.35、CMATH 91.17、GSM8k 91.83、GPQA 49.12,其中 MATH 与 GPQA 为该组最高分。
后训练模型评测结果——慢思考模式。对比模型为 OpenAI-o1-1217、Deepseek-R1-0120、Qwen3-A22B 与 Hunyuan-A13B。Hunyuan-A13B 在 AIME2024(87.3)、BBH(89.1)、ZebraLogic(84.7)、BFCL v3(78.3)、ComplexFuncBench(61.2)、C³-Bench(63.5)等基准上取得最高分,在 DROP(91.1)、IF-Eval(84.7)、τ-Bench(54.7)等为第二好。在 MATH(94.3)、GPQA-Diamond(71.2)、OlympiadBench(82.7)、LiveCodeBench(63.9)、AIME2025(76.8)、ArtifactsBench(43.0)、InsCtrl(71.9)、ComplexNLU(61.2)、Word-Task(62.9)等基准上则低于部分对比模型。论文给出的定性结论是慢思考模式下在多个数学、推理和 Agent 基准上取得领先或接近领先结果。
后训练模型评测结果——快思考模式。对比模型为 Hunyuan-Large-1116、Qwen2.5-72B-instruct、Qwen3-A22B 与 Hunyuan-A13B。Hunyuan-A13B 在 FullstackBench(58.3)、BBH(87.0)、DROP(86.5,第二好)、IF-Eval(84.4,第二好)等基准上具有竞争力或领先,但在多项基准上低于 Qwen3-A22B,例如 AIME2024(30.6 对 40.1)、AIME2025(19.2 对 24.7)、MATH(85.4 对 87.2)、GPQA-Diamond(61.8 对 62.9)、OlympiadBench(64.1 对 69.9)、LiveCodeBench(27.4 对 35.3)、McEval(59.6 对 63.5)、ZebraLogic(36.5 对 37.7)、SysBench(70.2 对 72.1)、LengthCtrl(53.9 对 54.7)、InsCtrl(68.9 对 71.2)、ComplexNLU(54.5 对 56.7)、Word-Task(53.4 对 56.4)、BFCL v3(65.9 对 68.0)。源码片段中快思考表在 BFCL v3 之后被截断,可能还有其他 Agent 指标未显示,因此不能对该模式的全部表现下完整结论。
快思考模式下的工具调用与 Agent 任务。表tab:model_comparison2报告了 fast-thinking 模式下三个工具调用/Agent 基准的结果,Hunyuan-A13B 均为最高分:τ-Bench 为 42.6(第二好 41.8,片段中另两列数值为 17.3、36.4),ComplexFuncBench 为 74.0(第二好 40.1,另两列 25.2、38.1),C³-Bench 为 65.4(第二好 52.1,另两列 45.4、48.4)。由于片段中未出现完整表头,除加粗最高列外,其余数值不能映射到具体模型。论文据此说明 Hunyuan-A13B 在 BFCL-v3、τ-Bench、ComplexFuncBench、C³-Bench 上领先,具备强工具调用能力,且 C³-Bench 模拟任务组合变化时仍保持高准确率,证明其处理现实开放问题的能力。论文还指出,在 AIME2024 上获得最高分,在 ZebraLogic 与 BBH 上领先,科学知识与指令跟随常排名第二并显著优于更大模型,编程总体略低但在 FullstackBench 与 ArtifactsBench 上与显著更大的 LLM 结果可比,体现了相对模型规模的高效率与能力。需要说明的是,AIME2024、ZebraLogic、BBH、FullstackBench、ArtifactsBench、BFCL-v3 在 fast-thinking 表格中的具体分数并未在源代码片段 3 中给出。
长上下文评测结果。在 PenguinScrolls 上,Hunyuan-A13B 得分 87.7,与 Gemini 2.5 Pro 的 88.3 表现相当,并略优于 DeepSeek R1 的 87.5 与 Qwen3-A22B 的 87.1。在 LongBench-v2 上得分 55.0,为表中第二高,仅次于 Gemini 2.5 Pro 的 60.9,优于 DeepSeek R1 的 53.8 与 Qwen3-A22B 的 48.4。在 FRAMES 上得分 81.1,超过 Gemini 2.5 Pro 的 80.1,但低于 DeepSeek R1 的 85.7 与 Qwen3-A22B 的 84.0,论文明确指出其 RAG 专用长上下文处理能力仍有提升空间。RULER QA 子任务上,Hunyuan-A13B 平均 76.7,低于 Gemini 2.5 Pro 的 81.7,高于 DeepSeek R1 的 72.0 与 Qwen3-A22B 的 73.0;按长度分段为 0-8K 78.7、8K-32K 75.3、32K-64K 78.0、64K-128K 73.9,其中 64K-128K 分段显著优于 DeepSeek R1 的 65.6 与 Qwen3-A22B 的 66.6,说明其长程稳定性突出,性能衰减仅次于 Gemini 2.5 Pro。
推理效率结果。Hunyuan-A13B 使用 GQA + MoE 架构提升推理效率,与 vLLM、SGLang、TensorRT-LLM 等主流开源推理框架无缝集成,支持 W16A16 精度推理的一键部署,使用 Auto Prefix Caching 与 Chunk Prefill 等服务层特性,支持 Weight Only INT8、W8A8、KV Cache FP8 等多种无损量化格式,并可配合 Tensor Parallel(TP)、Expert Parallel(EP)、FusedMoE 等框架原生加速机制。吞吐测试结果(A16W16C16)为:batch=1、input length 2048、output length 14336 时为190.84 190.84190.84tokens/s;batch=16 时为1246.54 1246.541246.54tokens/s;batch=32、output length 14336 时为1981.99 1981.991981.99tokens/s;batch=32、output length 22528 时为1725.95 1725.951725.95tokens/s。可见 batch 增大显著提升吞吐,而当 batch=32 时输出长度从 14336 增加到 22528,吞吐从 1981.99 降至 1725.95 tokens/s。需要说明的是,正文写 W16A16,表题写 A16W16C16,源代码笔记指出片段未解释二者是否为同一配置。
4.3 消融实验 / Ablation Study
源代码笔记明确指出,所给片段没有正式的消融实验章节,也没有给出消融表或逐项贡献数值。片段中可以确认的设计有效性结论主要有以下几项。
Shared expert 数量。基于 MoE 架构 scaling laws 的大量实验,论文观察到没有 shared expert 的模型通常差于至少有 1 个 shared expert 的模型;当 shared expert 数量超过 1 后收益递减,只有边际改善甚至性能波动。因此最终确定 1 个 shared expert + 64 个 non-shared experts 的配置,训练时 shared 始终激活,仅 8 个 non-shared 激活。这是源代码笔记中唯一明确给出的架构消融结论。
RL 训练配置。论文陈述 on-policy learning、大 batch、增加 rollout 数量、较低采样温度(0.6 0.60.6–0.8 0.80.8)等措施 collectively benefit the RL training process;两阶段上下文长度(24K 然后 32K)受 deepscaler2025 启发,用于系统增强推理深度;移除 KL 约束参考 yu2503dapo。但这些均为定性陈述,片段中没有给出对应的逐项消融数值,因此不能归纳出具体消融表。
长上下文训练阶段。上下文从 4096 依次扩展到 8192、32K、256K,且 32K 与 256K 阶段分别采用 NTK-aware 的 alpha=50 与 alpha=1000。这是训练流程的设计,但片段未给出各阶段对最终结果的单独贡献,因此不构成可量化的消融证据。
评估集污染控制。论文称评估同时覆盖广泛认可的公共 benchmarks 与新开发的内部测试集,目的是严格评估并减少数据污染带来的潜在偏差。这属于评估设计说明,不是消融实验。综合而言,本节只能呈现 shared expert 数量这一项明确的消融结论,其余配置描述不能被推断为带有数值结果的消融实验。
五、相关工作 / Related Work
与 Hunyuan 系列模型的关系。Hunyuan-A13B 与团队既有的 Hunyuan 系列共享多项设计:数据整理管线复用 Hunyuan-TurboS;Tokenizer 与 Hunyuan-Large 相同,词表大小 128K;激活函数 SWiGLU 与 Hunyuan-Large、Hunyuan-TurboS 一致;NTK-aware 位置编码与 Hunyuan-TurboS 相同。在预训练评测对比中,论文称 Hunyuan-A13B 在 14 个基准中 12 个优于 Hunyuan-Large-1116,而激活参数约为其 1/4、总参数约为其 1/5,体现出代际效率的提升。
与 sparse / dense 架构路线的关系。与 dense 架构 LLM 相比,Hunyuan-A13B 采用稀疏 MoE,总参数 80B 但每次输入仅激活 13B,相比同规模 dense 模型降低推理延迟与计算开销。在 MoE 内部设计上,模型采用 fine-grained MoE,引用 DeepSeek-MoE 一类工作,将专家拆分为多个细粒度单元。评测对比中的 Qwen2.5-72B 属于 dense 路线,Qwen3-A22B 与 Hunyuan-Large-1116 属于 MoE 路线。
与领先闭源/开源系统的关系。Introduction 引用 GPT-4o、o1、o3、Gemini 2.5、DeepSeek-R1、Qwen3 作为先进系统,并指出这些系统部署通常计算资源需求大、推理延迟高、硬件成本高,而 Hunyuan-A13B 定位为开源、高效、可扩展、低部署成本。后训练慢思考模式评测中,直接对比对象为 OpenAI-o1-1217 与 Deepseek-R1-0120;长上下文评测中直接对比对象为 Gemini 2.5 Pro 与 DeepSeek R1。
与训练方法与数据构建相关工作的关系。代码数据生成 pipeline 引用 Magicoder;逻辑数据自动合成受 ZebraLogic 启发;RL 算法采用 GRPO;RL 的两阶段上下文长度受 deepscaler2025 启发;移除 KL 散度约束参考 yu2503dapo;Generative Reward Model 的采用遵循 zhang2024generative、mahan2024generative、xu2025unifiedpairwiseframeworkrlhf 等工作。
Dual-Mode CoT 的独特点。与常规单一推理模式的做法不同,Hunyuan-A13B 用统一训练结构同时优化 fast 与 slow 两种模式,以<think>块是否为空作为区分,并通过/no_think、/think控制标签在推理时切换,无标签时默认 slow-thinking。这一设计使同一模型可在效率与推理深度之间按任务复杂度灵活取舍。
六、局限性与展望 / Limitations & Future Work
编码能力总体略低。源代码笔记 3 明确指出,Hunyuan-A13B 的编程整体性能略低于对比模型;在 FullstackBench 与 ArtifactsBench 等代码评估任务上虽与显著更大的 LLM 结果可比,但总体 coding 仍略低。在后训练慢思考模式表中,LiveCodeBench 的 63.9 也低于 Deepseek-R1-0120 的 65.9 与 Qwen3-A22B 的 70.7;快思考模式下 LiveCodeBench 的 27.4 亦低于 Qwen3-A22B 的 35.3。
RAG 专用长上下文处理仍有提升空间。在 FRAMES 上,Hunyuan-A13B 得分 81.1,虽超过 Gemini 2.5 Pro 的 80.1,但低于 DeepSeek R1 的 85.7 与 Qwen3-A22B 的 84.0,论文明确指出其 RAG 专用长上下文处理能力仍有提升空间。
长上下文整体仍未超过 Gemini 2.5 Pro。RULER 全长度平均 76.7,低于 Gemini 2.5 Pro 的 81.7;在 0-8K、8K-32K、32K-64K、64K-128K 四个分段上也均低于 Gemini 2.5 Pro。虽然其在 64K-128K 分段显著优于 DeepSeek R1 与 Qwen3-A22B,长上下文整体能力仍未达到 Gemini 的水平。
源代码片段暴露的信息缺失。综合三份源代码笔记,论文片段中未包含若干关键细节,因而无法据此判断模型在这些方面的表现:未给出 SFT 与 RL 的显式损失函数公式,仅说明 RL 使用 GRPO、奖励为 outcome reward 与 sandbox feedback;未给出 GRM 的具体训练细节、偏好数据规模与评分服务的实现细节;未给出 general-purpose SFT 与 generalized RL 的完整数据、奖励与训练流程细节(部分由源代码笔记 2 补充,但部分内容在源码中位于\iffalse ... \fi注释块内,未作为正式排版内容);未给出 dual-CoT 的具体实现、切换机制与训练目标细节;未给出推理优化与吞吐量在更广泛配置下的具体数字(仅有 A16W16C16 下的四条吞吐记录);未给出长上下文训练的数据配比、训练 token 数与更完整的长上下文评估结果;未给出模型失败案例、安全对齐、偏差与部署限制等专门讨论;后训练快思考表格在源代码片段中被截断,BFCL v3 之后可能还有其他 Agent 指标未显示,因此该模式的完整表现无法从片段判断。
Dual-CoT 收益的量化证据缺失。源代码笔记 3 指出,本片段未给出慢思考模式评估结果之外的详细对比,无法判断双模式 CoT 中 slow thinking 的实际收益;片段也未给出两种模式在计算成本、延迟、token 消耗上的详细对比。因此,尽管 dual-CoT 是论文的核心设计之一,其在效率与准确性之间的量化权衡仍需依赖完整论文中的其他部分才能判断。
W16A16 与 A16W16C16 的一致性未说明。论文正文写支持 W16A16 精度推理的一键部署,而吞吐表题写 A16W16C16,源代码笔记指出片段未解释二者是否为同一配置,这一点在解读吞吐结果时需注意。
消融覆盖有限。如 4.3 节所述,源代码片段中唯一明确的架构消融结论是 shared expert 数量;RL 配置相关陈述为定性描述,未配套逐项消融数值。因此,论文各设计选择之间的相对贡献在片段范围内无法被完整评估。
七、总结 / Conclusion
Hunyuan-A13B 是腾讯混元团队开源的一个基于 Mixture-of-Experts 架构的大语言模型,总参数 80B、推理时仅激活 13B,目标是在模型能力、计算效率与部署成本之间取得平衡。模型在严格过滤的 20T-token 语料上预训练,并针对 STEM 数据整理了 250B 高质量 token;预训练分 Foundation Training、Fast Annealing 与 Long-Context Training 三个阶段,上下文从 4096 逐步扩展至 8192、32K 与 256K,位置编码使用 NTK-aware 方案。
后训练采用结构化、多阶段方案,包含推理导向 SFT 与 RL、全场景 SFT 与 RL 共四个步骤。推理导向阶段覆盖数学、代码、逻辑与科学,RL 使用 GRPO、二元 outcome reward 与覆盖 36 种语言、支持超过 1000 并发执行的代码沙盒。全场景阶段覆盖语言理解、创意写作、多语言、复杂指令、角色交互、知识 QA、多轮对话与 Agent 八类能力,RL 侧统一了灵活 GRM 与领域专用奖励管线,覆盖 16 个子主题与超过 30 个评分服务。模型还通过统一训练结构支持 fast-thinking 与 slow-thinking 双模式 CoT,以<think>块是否为空作为区分,并在推理时通过/no_think与/think控制切换。
实验层面,预训练模型在 14 个评测基准中的 12 个优于 Hunyuan-Large-1116,且仅使用约 1/4 激活参数与约 1/5 总参数;在 General、Coding、Math & STEM 多个基准上取得该组最高分或接近最高分。后训练慢思考模式下在 AIME2024、BBH、ZebraLogic、BFCL v3、ComplexFuncBench、C³-Bench 等取得最高分;快思考模式下在 FullstackBench、BBH、DROP、IF-Eval 等具有竞争力或领先,且在三项工具调用/Agent 基准上均为最高分。长上下文方面,PenguinScrolls 与 Gemini 2.5 Pro 相当,LongBench-v2 为第二高,FRAMES 超过 Gemini 2.5 Pro,RULER 长程稳定性仅次于 Gemini 2.5 Pro。效率方面,在 A16W16C16 下 batch=32、output length 14336 时吞吐达1981.99 1981.991981.99tokens/s。与此同时,论文片段也暴露出编码整体略低、RAG 长上下文在 FRAMES 上仍有提升空间、RULER 平均低于 Gemini 2.5 Pro 等局限,且 SFT/RL 损失函数、dual-CoT 量化收益、安全与部署限制等细节在所给片段中并未给出。总体而言,Hunyuan-A13B 的核心价值在于以高参数效率的稀疏 MoE 架构、严格过滤并强化 STEM 的预训练语料、四步式大规模后训练与统一训练的双模式 CoT,在开源模型中提供了一个兼顾能力、吞吐与部署成本的方案。
原文摘要:We present Hunyuan-A13B, an open-source large language model based on a Mixture-of-Experts architecture. It contains 80 billion total parameters but activates only 13 billion during inference, balancing model capability, computational efficiency, and deployment cost. The model is pretrained on a rigorously filtered 20T-token corpus with enhanced STEM data curation, improving factual reliability and reasoning ability. High-quality supervised fine-tuning and large-scale reinforcement learning further enhance its overall performance. Hunyuan-A13B also introduces a dual-mode Chain-of-Thought framework that adapts reasoning depth to task complexity: fast thinking for routine queries and slow thinking for complex, multi-step problems. Evaluations show competitive performance across mathematics, science, programming, general language understanding, and agent tasks, often approaching that of much larger models. Its high inference throughput makes it suitable for latency-sensitive applications. We release Hunyuan-A13B to support open research and practical LLM deployment.
PDF链接:https://arxiv.org/pdf/2609.27284v1