
给客服机器人加上语音最怕两件事用户一插话它就懵在原地账单还按分钟往上跳。这个卡了很久的老问题在千问一口气放出五款语音模型的时候被当面拆开了。这次 Qwen-Audio-3.1 不是常规小升级而是把语音这条线按三层补齐语音识别ASR、语音合成TTS、实时语音交互Realtime再加一个音频理解模型 ASR-Next 和一个音频创作模型 TTS-Next凑成“理解—生成—交互—创作”的完整能力栈。价格ASR 最高降 95%按 token 算账最该看的其实不是模型数量是价格。全线一起下调TTS 降约 70%Realtime 降约 85%ASR 最高降 95%。落到具体数字上据阿里云百炼官方页面TTS-Flash 输入 1.5 元、输出 12 元每百万 tokenRealtime 的输入音频从调整前的 30 元/百万 token 降到 6 元。ASR-Flash 输入 0.8 元、输出 2.7 元每百万 token。有开发者按官方给出的换算规则算过一秒音频对应 25 个 token一小时的音频是 9 万 token输入加输出撑不过 0.4 元。但有个细节要留意上一代走的是“时长计费”3.1 系列切换为 Token 计费。账面降幅很大实际成本取决于音频结构——静音、环境杂音换算成密集的 Token 消耗时最终账单未必线性缩水。先跑通小流量测试真实成本再做规模化迁移。真正改体验的是“实时”两个字升级后的模型支持边说边听用户可以随时插话、打断节奏接近真人通话识别到情绪低落时它会放慢语速、换更贴合的措辞。TTS-Next 更狠一点能照一段脚本同时演绎旁白和不同角色的音色顺手把风声、易拉罐碰撞这类环境音效也一并生成。千问还开源了面向实时语音 Agent 的框架 Qwen-Audio-Agent把实时语音交互层部署在用户与后台智能体之间负责连续对话、任务委派、上下文衔接和结果播报。用户可在智能体执行过程中继续说话追加约束、修改目标或取消当前任务无需等待上一轮完全结束。动手的不止一家同一天科大讯飞发布 Spark-ASR-2.0明天进讯飞输入法。谷歌的 Gemini 3.8 TTS 这两天上线号称能生成和复刻角色声音在 Hume AI 语音设计基准中排名第一。语音这条线正从“能转写的辅助功能”被推成产品的主入口。别急着迁移先拿一段真实录音跑一遍ASR-Next 的 API 还没上线Realtime 低档和高档价差能到八倍档位选错照样烧钱全双工的实际延迟、方言识别的准确率都得用自己的场景复测。官方那个 4.55% 的字错率只是特定测试集上的结果。当语音模型也进入价格战调用层需要能跟上文本模型的降价已经让开发者习惯了“单价周更”现在语音模型也加入了这个节奏。Qwen-Audio-3.1 只是这一轮的开始其他厂商大概率会跟进。当你在多个模型之间做调度时调用层的管理成本会悄悄吃掉一部分省下来的钱。EasyAPI这类聚合入口的价值就在这里一个 Key 接入所有主流模型统一记录调用和成本按任务类型分配模型切换只改配置不碰业务代码。语音模型的计价方式正在从时长转向 Token从单一模型转向能力栈组合——你的调用层需要能跟得上这个变化。