☰
语音模型集体降价,实时对话门槛塌了
2026/9/27 22:51:14 网站建设 项目流程

给客服机器人加上语音,最怕两件事:用户一插话它就懵在原地,账单还按分钟往上跳。这个卡了很久的老问题,在千问一口气放出五款语音模型的时候,被当面拆开了。

这次 Qwen-Audio-3.1 不是常规小升级,而是把语音这条线按三层补齐:语音识别(ASR)、语音合成(TTS)、实时语音交互(Realtime),再加一个音频理解模型 ASR-Next 和一个音频创作模型 TTS-Next,凑成“理解—生成—交互—创作”的完整能力栈。

价格:ASR 最高降 95%,按 token 算账

最该看的其实不是模型数量,是价格。全线一起下调:TTS 降约 70%,Realtime 降约 85%,ASR 最高降 95%。

落到具体数字上,据阿里云百炼官方页面,TTS-Flash 输入 1.5 元、输出 12 元每百万 token;Realtime 的输入音频从调整前的 30 元/百万 token 降到 6 元。ASR-Flash 输入 0.8 元、输出 2.7 元每百万 token。有开发者按官方给出的换算规则算过:一秒音频对应 25 个 token,一小时的音频是 9 万 token,输入加输出撑不过 0.4 元。

但有个细节要留意:上一代走的是“时长计费”,3.1 系列切换为 Token 计费。账面降幅很大,实际成本取决于音频结构——静音、环境杂音换算成密集的 Token 消耗时,最终账单未必线性缩水。先跑通小流量测试真实成本,再做规模化迁移。

真正改体验的是“实时”两个字

升级后的模型支持边说边听,用户可以随时插话、打断,节奏接近真人通话;识别到情绪低落时,它会放慢语速、换更贴合的措辞。TTS-Next 更狠一点,能照一段脚本同时演绎旁白和不同角色的音色,顺手把风声、易拉罐碰撞这类环境音效也一并生成。

千问还开源了面向实时语音 Agent 的框架 Qwen-Audio-Agent,把实时语音交互层部署在用户与后台智能体之间,负责连续对话、任务委派、上下文衔接和结果播报。用户可在智能体执行过程中继续说话,追加约束、修改目标或取消当前任务,无需等待上一轮完全结束。

动手的不止一家

同一天,科大讯飞发布 Spark-ASR-2.0,明天进讯飞输入法。谷歌的 Gemini 3.8 TTS 这两天上线,号称能生成和复刻角色声音,在 Hume AI 语音设计基准中排名第一。语音这条线,正从“能转写的辅助功能”被推成产品的主入口。

别急着迁移

先拿一段真实录音跑一遍:ASR-Next 的 API 还没上线;Realtime 低档和高档价差能到八倍,档位选错照样烧钱;全双工的实际延迟、方言识别的准确率,都得用自己的场景复测。官方那个 4.55% 的字错率,只是特定测试集上的结果。

当语音模型也进入价格战,调用层需要能跟上

文本模型的降价已经让开发者习惯了“单价周更”,现在语音模型也加入了这个节奏。Qwen-Audio-3.1 只是这一轮的开始,其他厂商大概率会跟进。

当你在多个模型之间做调度时,调用层的管理成本会悄悄吃掉一部分省下来的钱。EasyAPI这类聚合入口的价值就在这里:一个 Key 接入所有主流模型,统一记录调用和成本,按任务类型分配模型,切换只改配置不碰业务代码。语音模型的计价方式正在从时长转向 Token,从单一模型转向能力栈组合——你的调用层需要能跟得上这个变化。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询