☰
AuK 已进 SGLang-Omni:开箱即用的语音模型,正在悄悄长成新的开源生态
2026/10/10 21:21:18 网站建设 项目流程

AuK 已进 SGLang-Omni:开箱即用的语音模型,正在悄悄长成新的开源生态

【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK

2026 年 9 月 9 日,腾讯混元开源了 1.5B 参数的语音基础模型 AuK,代码与权重以 MIT 协议一次性放出。如果只是"又多了一个 TTS 模型",这件事在当下并不稀奇;真正值得关注的是它开源当天的姿态——SGLang-Omni 团队在同一时间完成了对 AuK 的 Day 0 适配,官方仓库直接用一行命令把它接入了完整的服务化推理栈。开箱即用,不只是说模型权重公开,而是说它第一时间拥有了生产级的推理基础设施。这篇文章从源码、官方文档与社区实测出发,拆解这次适配的含金量,梳理 Gradio、ComfyUI、SGLang 三路部署正在形成的生态格局,并回答一个问题:开源语音模型接下来会怎么长。

一条命令背后的 "Day 0 适配"

打开仓库根目录的 README.md,News 一节只有一条消息:2026/09/09 开源,代码与权重公开。而紧随其后的 "Inference with SGLang-Omni" 一节写得格外简短,却信息量十足:

python -m sglang_omni.cli serve --model-path tencent/AuK

这一行命令背后,是 SGLang-Omni 为 AuK 实现的完整服务化流水线。官方 Cookbook 给出了清晰的四阶段结构:preprocessing(音频预处理与时长估计)→ conditioning(条件编码)→ DiT sampling(扩散采样)→ VAE decoding(波形解码)。四个阶段在独立的 CUDA 流上重叠执行,Qwen 编码器、VAE 与 DiT 可以按需分批加载,这在语音模型服务化里已经接近主流大语言模型的工程标准。

适配之所以能如此顺畅,根源在于 AuK 的架构是可拆分的模块化组合。对照仓库根目录的 config.yaml 可以看得非常清楚:主干是 Flux 风格的混合流 Transformer(backbone: Flux2Edit),文本编码器外挂 Qwen2.5-Omni-3B,声码器是独立权重文件vae.safetensors(BigVGANFlowVAE,24kHz 输出、64 维 latent、480 倍下采样率)。配置里甚至预埋了工程细节注释:注意力后端可在flash_attn与torch之间切换(推理时避免 flash_attn 依赖)、梯度检查点将峰值显存从约 91G 压到约 75G。SGLang-Omni 的服务端实现与这套配置一一对应:冻结的 Qwen2.5-Omni-3B Thinker 提供语义条件,共享参考编码器与音频解码器的 VAE 提供声学条件,10 层双流 MMDiT + 20 层单流 DiT 构成生成主干。三个组件各司其职、边界清晰,第三方推理栈才能在一周内完成"对齐实现",而不是被塞进一个无法拆卸的整体。

更难得的是适配还配了验证手段。SGLang-Omni 的 AuK 章节里专门保留了"Upstream Parity"测试:安装上游依赖后,用 pytest 跑test_auk_parity.py,在 RNG 对齐的前提下逐一比对参考 latent、融合后的 Qwen 条件、生成 latent 与最终波形,与上游实现逐位一致。这不是"能跑通就行"的适配,而是把复现责任写进了测试套件——对一个开源模型来说,这几乎是最高规格的信任背书。

从"能跑"到"能服务":API 与推理栈

进入 SGLang-Omni 之后,AuK 获得的是一整套与 LLM 同级的服务化能力。首先是 API 形态:生成任务走 OpenAI 风格的/v1/audio/speech,传input文本与instructions音色描述即可做指令式 TTS,传ref_audio加参考文本即可做零样本克隆;编辑任务走/generate,把"去掉背景噪声""换成耳语"这类原生指令放进prompt字段,配合metadata.tts_params.ref_audio指定源音频。一个模型、两种端点,覆盖了生成与编辑两大能力面。

其次是采样策略的可配置性。基础版 AuK 使用 Euler 求解器,默认 32 次函数评估、CFG 强度 2.0、sway 系数 -1.0;而蒸馏版 AuK-Flash 锁定官方发布的 4 步时间网格、关闭 CFG——这正是技术报告里描述的"4 步无 CFG 推理、墙钟时间提速 4.5 倍"的服务端落地。模型权重与推理配置解耦,服务端可以通过启动参数覆盖采样细节,而不必改动模型本身。

然后是实打实的性能工程。SGLang-Omni 为 AuK 专门写了 Triton 内核,把逐头 RMSNorm 与交错式 RoPE 融合成单个 kernel;默认开启torch.compile逐块编译 Transformer,并用 CUDA Graph 捕获整条 Euler 采样轨迹——由于每一步之间只有加噪 latent 和时间步在变化,一次捕获即可复用于整条轨迹乃至后续所有形状匹配的请求。在 config.yaml 中还能看到这类工程取舍的影子:推理默认把注意力后端切到torch,以消除 flash_attn 的安装负担,把"开箱即用"贯彻到底。

社区实测数据印证了这套栈的真实水平。SGLang-Omni 的 AuK 优化路线图(issue #2064)披露:单张 H200 上并发 8 时吞吐约 1.2 请求/秒,RTF p99 在并发 8/16/32 下分别为 5.3/9.2/19.3;在并发 16 的事件分解中,DiT 采样占总耗时 80.8%,Qwen 条件编码占 10.1%,VAE 解码仅占 8.9%——瓶颈在哪、优化该打哪里,数据说得明明白白。首轮合并的 Q/K RMSNorm+RoPE 融合内核在并发 1 到 64 的扫描中带来约 32%~42% 的吞吐提升,且 WER 与上游完全一致。这些数字意味着语音模型第一次享受到"可观测、可调优、可压测"的服务化待遇。

Gradio、ComfyUI、SGLang:三路部署,一个模型

社区对 AuK 的工程化反馈,可以浓缩成三个关键词:Gradio、ComfyUI、SGLang-Omni。这三条路径恰好构成了开源语音模型生态里清晰的分层——体验层、创意层、生产层。

Gradio 解决的是"最快跑起来"。官方同时上线了 Hugging Face 与 ModelScope 的在线 Demo Space,社区也涌现出本地一键整合包:拉权重、起 WebUI、上传参考音频、输入自然语言指令,几分钟内就能复刻音色、改情绪、去口音甚至做 ASMR 式的音频编辑。它的价值在于把模型的边界快速暴露给普通用户,也把显存门槛、时长限制这些真实约束第一时间反馈给开发者。

ComfyUI 解决的是"可视化编排"。把 AuK 接入节点化工作流后,零样本 TTS、内容编辑、人声分离可以被拖拽成可复用的流水线:一段人声进去,并行输出增强版、去口音版、目标说话人提取版,再把结果级联给后续处理节点。对于创作者和后期人员,这比手写 Python 调用友好得多,也让语音能力第一次像图像工作流一样具备"可组合性"。

SGLang-Omni 解决的是"规模化服务"。它是三者中唯一面向并发的路径:动态批处理、长度分桶、CUDA Graph 复用、SeedTTS 基准的一键评测脚本,乃至后续计划中的编辑任务评估基准(MMAE-Speech、SpeechEditBench、Ming-Freeform-Audio-Edit 已在路线图中登记)。三层定位彼此不冲突——Gradio 做传播,ComfyUI 做创作,SGLang 做承载,而底层是同一个模型、同一套权重、同一个自然语言指令接口。配合 AuK / AuK-Flash 双变体(高质 32 步与高速 4 步),一个生态骨架已经相当完整。

当然,生态的真实度不在于宣传,而在于坦诚的边界。目前已知的限制包括:单次生成默认有 30 秒音频长度上限(服务端可通过参数放宽);推理需要同时常驻 Qwen2.5-Omni-3B 编码器、1.5B DiT 与 VAE,显存门槛不低;README.md 的权重要求一节也写明 MLLM 编码器与 VAE 需运行时单独加载,text_encoder.*权重缺失属预期行为。最诚实的一笔来自技术报告:SpeechEditBench 上情绪编辑的联合成功率只有 9.94%——统一指令接口覆盖了任务,但覆盖不等于每个任务都已炉火纯青。这些短板没有影响生态的成型,反而指明了社区接下来该补的位置。

开源语音生态的下一站

把视野拉远一点,AuK 进入 SGLang-Omni 更像是一个信号:语音模型的生态竞争,正在从"模型能力"转向"模型 + 推理栈 + 工具链"的整体。

先看能力盘子。技术报告披露的训练语料是 30.3 亿条指令-音频样本、195 万小时有效监督,横跨生成、内容编辑、声学编辑、副语言编辑与增强分离五大任务族;后训练阶段用人类反馈偏好优化对齐开放编辑,用 Flow-GRPO 强化生成质量,再用任务路由的 Decoupled DMD 蒸馏出 4 步推理的 AuK-Flash。基准成绩也拿得出手:Seed-TTS-Eval 三语平均 WER 2.65%、说话人相似度 0.795,双双压过此前的最强基线;MMAE-Speech 的指令遵循率 48.23%、属性保持率 88.11%;DNS 挑战赛 dWER 降到 2.66%;AuK-VAE 在语音、通用音频、音乐三域的重建指标全面领先。SGLang-Omni 官方复现的编辑评估(英语 Full 集 WER 3.96%、准确率 84.58%)也基本对齐了论文数据——这说明成绩是可以被第三方复现的,而不是自说自话。

再看生态结构。SGLang-Omni 的 Cookbook 里已经躺着一长串语音模型:Qwen3-TTS、Fish Audio、MiniMax Music 3、dots.tts、ZONOS2、MOSS-TTS……AuK 是其中任务覆盖最全的成员之一,也是少数把"编辑"作为一等公民接进服务化的模型。它的适配模式——冻结 MLLM 编码器 + 扩散主干 + VAE 三段式、上游一致性测试、逐层优化与吞吐数据公开——正在成为第三方推理栈接入新语音模型的参考模板。而 SGLang-Omni 路线图中"把语音编辑评估纳入基准体系"的计划,则预示着下一个阶段的主题:当生成质量趋于同质化,编辑能力、时长可控性、流式延迟与评估标准化将成为差异化战场。

最后回到那个问题:开源语音模型接下来会怎么长。AuK 给出的答案有三层。第一,统一指令接口是方向——"自然语言指令 + 参考音频"正在成为语音界的通用 prompt,任务碎片化被接口统一替代。第二,蒸馏加速是标配——4 步无 CFG 推理、4.5 倍提速不再是论文里的表演,而是直接落进服务端默认配置的工程事实。第三,生态分层的价值大于单点能力——Gradio 触达用户、ComfyUI 服务创作者、SGLang-Omni 承载生产,叠加 MIT 协议赋予的商用自由度,一个可组合、可演进、可商业化的语音开源生态正在成型。模型会迭代,基准会刷新,但"统一任务、开放协议、多端部署"这套组合拳,已经让 AuK 从"又一个开源模型"变成了开源语音生态里一个真正的节点。

【免费下载链接】AuK项目地址: https://ai.gitcode.com/tencent_hunyuan/AuK

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询