Qwen3 MoE:30B 总参、A3B 激活,稀疏专家路由怎么省算力
【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5
Qwen3 仓库收录了 Qwen 系列大模型的技术报告、部署与评测资料。MoE 模型是其中算力性价比最高的形态:总参上百 B,每个 token 只激活几 B,靠专家路由把大模型装进单卡显存。
类比拆解:MoE 路由像医院分诊台
把 Transformer 的 FFN 层想成医院后厨。Dense 模型像每个病人(token)都要让所有诊室(专家)会诊一遍,人全到齐,但多数是陪跑;MoE 像分诊台:每个 token 先被路由网络分诊,只去得分最高的少数专家号,诊完把处方(专家输出)加权合在一起。
类比失效的边界:分诊台按病种把病人固定分给科室,而 Qwen MoE 的路由是按 token 动态打分的,同一句话里不同 token 可以走完全不同的专家组合;而且专家不是"科室",是同一结构里并行的多组权重。
关键参数速查:30B-A3B 与 235B-A22B
| 参数 | Qwen3-30B-A3B | Qwen3-235B-A22B |
|---|---|---|
| 总参 / 激活参 | 30B / 3B | 235B / 22B |
| 上下文 | 256K,2507 版可扩展 1M (README.md) | 256K,2507 版可扩展 1M (README.md) |
| 框架 | transformers ≥4.51.0;vLLM ≥0.9.0;llama.cpp ≥b5401;mlx-lm ≥0.24.0 (README.md) | 同左 |
总参决定显存、A 后面的数字决定每个 token 的算力成本,这两个数字就是选型依据。30B-A3B 在 H20 单卡 BF16 下占 58462MB 显存、吞吐 137.18 tokens/s,而同级 32B Dense 只有 20.72 tokens/s (speed_benchmark.md)。具体 K 值与专家数量仓库未公布,以官方 benchmark 为准。
最小可跑示例:30B-A3B 一条命令验证
python -c "from transformers import AutoModelForCausalLM, AutoTokenizer; \ t=AutoTokenizer.from_pretrained('Qwen/Qwen3-30B-A3B-Instruct-2507'); \ m=AutoModelForCausalLM.from_pretrained('Qwen/Qwen3-30B-A3B-Instruct-2507', torch_dtype='auto', device_map='auto'); \ print(t.decode(m.generate(**t([t.apply_chat_template([{'role':'user','content':'hi'}], tokenize=False, add_generation_prompt=True)], return_tensors='pt').to('cuda'))[0].input_ids[0], skip_special_tokens=True))"预期输出:模型返回一段流畅的英文回复(如 "Hello! How can I help you today?"),即说明 MoE 路由与专家权重加载均正常。BF16 需约 58GB 显存,参考 speed_benchmark.md 的 H20 96GB 环境。
选型判断:你的场景适不适合 MoE
- 如果你的目标是用更少激活参数换更大模型容量(单卡显存紧张但想要接近旗舰的效果),30B-A3B 的 BF16/FP8 是仓库 benchmark 里覆盖最全的档位;
- 如果你需要高并发服务,直接上 vLLM/SGLang 起 OpenAI 兼容 API,235B-A22B 用 8 卡 TP=8 可跑 BF16 (README.md);
- 不建议:想用 Transformers 直接加载 30B-A3B 的 GPTQ-INT4 量化版——仓库明确标注 "MoE Kernel Unsupported" (speed_benchmark.md),应改用 BF16/FP8 或走 vLLM/SGLang 部署。
跑通之后看这里
- vLLM 部署指南
- 量化实践(AWQ / GPTQ)
- ARC-AGI-1 评测代码(235B-A22B-Instruct-2507 实测)
【免费下载链接】Qwen1.5Qwen3 is the large language model series developed by Qwen team, Alibaba Cloud.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen1.5
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考