2026 年 9 月 23 日下午,阿里通义千问通过官方 X 账号发布了 Qwen-Audio-3.1 系列语音模型。这一代一次放出 5 个模型:原有的 ASR(语音识别)、TTS(语音合成)、Realtime(实时语音交互)三个方向全面升级,同时新增了面向音频创作的 TTS-Next 和面向音频理解的 ASR-Next。更引人注目的是价格:全线降价,TTS 约降 70%,Realtime 约降 85%,ASR 最高降 95%。
这次把"听、说、实时对话、创作"四个环节一次性补齐,意图很明显:用一条完整的语音链路、配上更便宜的价格,去抢语音 API 的市场份额。
听和说:三个老方向都升级了
ASR 负责把语音转成文字,是会议转写、字幕、语音助手的第一环;TTS 负责把文字读出来,是配音、有声内容、语音播报的基础;Realtime 则是低延迟的实时语音对话,支撑"打断式"自然交流。这次三个方向同步升级,意味着一条完整的语音链路可以全部跑在 3.1 系列上,不用再拼凑不同代际的模型。
这次公告把重点放在了模型矩阵和价格上。至于中文方言、嘈杂环境下的识别率这些硬指标,还要等官方文档和第三方评测补齐数据。
新增的两个 Next 模型是什么
TTS-Next 被定位为音频创作模型,主打更自然的语音生成能力;ASR-Next 则是音频理解模型,负责对音频内容的深度理解。加上原有的三个方向,整个系列覆盖了理解、生成、交互与创作四个场景。
这种拆分方式其实是在回应真实需求:简单的"转写"和"朗读"已经不够用了。播客剪辑、视频配音、客服质检这些场景,需要的是能理解语气、情绪和上下文的模型,而不是只会逐字转写的工具。
实时对话开始讲"情商"
新版 Realtime 支持边说边听、随时打断,这是实时语音交互的基本功。更有意思的是一个细节:当检测到用户情绪低落时,模型会放慢语速并给出共情回应。
这说明语音模型的竞争已经从"识别准不准、延迟低不低"进入到"对话像不像人"的阶段。对做 AI 陪伴、心理疏导、客服安抚类产品的团队来说,这个能力值得重点测试。
降价幅度最大的一次,谁最受益
TTS 降价约 70%,Realtime 降价约 85%,ASR 最高降 95%。语音 API 的调用量通常很大,降价会直接改变成本结构:以前因为成本不敢开的长时转写、全量客服录音质检、批量配音,现在可能都划得来了。
最直接受益的是三类人:做会议纪要和字幕的 SaaS 团队、跑大量语音客服的企业、以及做有声内容和短视频配音的创作者。建议已经在用 Qwen 语音 API 的团队直接对比新旧价格,按自己的调用量重新算一笔账。
下一步值得关注什么
第一,实际效果需要第三方评测验证,尤其是中文方言、嘈杂环境下的识别率,以及 TTS-Next 的自然度到底提升了多少。第二,价格战会不会引发其他厂商跟进——语音 API 的毛利空间本来就不厚,Qwen 这次降价幅度不小,ElevenLabs、Minimax 等厂商的反应值得看。第三,Realtime 的情绪感知能力在真实场景中的稳定性和边界,比如误判情绪时会不会反而让用户反感。
Q:Qwen-Audio-3.1 的 5 个模型分别适合什么场景?
A:ASR 适合会议转写、字幕和语音输入;TTS 适合配音、有声书和语音播报;Realtime 适合需要打断和低延迟的语音助手、AI 陪伴;TTS-Next 面向对自然度要求高的音频创作;ASR-Next 面向需要理解语气和内容的音频分析场景。
Q:已经在用旧版 Qwen 语音 API,需要做什么迁移吗?
A:官方公告没有说明旧版下线时间表,建议先在测试环境接入 3.1 验证效果,同时按新价格重算成本,再决定切换节奏。模型 ID 和参数可能有变化,升级前先看官方文档。