AI导航

微软发布首款流式转录模型:100 多毫秒出字,语音合成 MAI-Voice-2.1 同步上线

AI资讯
2 min read
1 次阅读

2026 年 10 月 1 日,微软 AI 在官方博客发布了首款流式转录模型 MAI-Transcribe-2-Streaming,并同步推出语音合成模型 MAI-Voice-2.1 和它的快速版 MAI-Voice-2.1-Flash。三款模型即日起可通过 Microsoft Foundry 构建语音智能体,微软还在 MAI Playground 上线了把三者串起来的实时演示 Chatter。对做语音产品的团队来说,微软这次补上的是对话里最卡时间的两头:听清用户说什么,和立刻开口回应。

流式转录不再等整句说完

MAI-Transcribe-2-Streaming 的工作方式和批量转录不同:音频还在流入,它就开始给出初步结果,收到音频后 100 多毫秒便产出第一版转写,随后随上下文不断修正,话音落下时立即定稿。微软称它在 Artificial Analysis 的最终转写与中间转写两项准确率上都排第一,在准确率与延迟的权衡曲线上也处在前沿位置。模型支持 60 种语言并能连续自动检测语种,实时听写和字幕场景下,微软内部评测显示单词出现在转写里的速度约为最接近竞品的 2 倍。价格是年底前每小时音频 0.54 美元的优惠定价。

两款语音模型,一款管像人,一款管快

MAI-Voice-2.1 主攻多语言同声线:支持 23 种语言、26 个地区变体,同一个声音切换语种时保留母语级口音,而不是把一种口音硬套到所有语言上,定价每百万字符 22 美元。Flash 版面向高并发和低延迟:能生成 45 秒音频,端到端延迟约 150 毫秒,推理速度比上一代快 55%,价格降到每百万字符 15 美元。两款模型都能用几秒钟的参考音频克隆声音,覆盖全部支持的语言,微软同时强调内置了知情同意类的防护机制,防止声音被滥用克隆。

语音智能体的瓶颈被往前推了一格

微软把语音智能体描述为一个循环:听、理解、决策、开口,四步都必须塞进用户还能感到“在对话”的时间窗里。转录先出中间结果,智能体可以在用户说完之前就开始推理和调用工具;回复端再用 Flash 压延迟,两头省下的时间留给中间的模型思考。这对客服坐席、多语言助手、互动教学这类场景是实打实的体验差别。接下来值得看的是两点:0.54 美元的转录价格在年底优惠结束后会定在多少,以及声音克隆的防护机制在真实滥用面前是否够用——这两点会直接决定团队敢不敢把这套模型放进面向公众的产品。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。