Suno 把语音和音乐做进了一次生成。2026 年 10 月 1 日,Suno 在官方博客宣布推出 Speech 测试版:用户输入一段文字,再描述想要的声音和音乐风格,就能得到一条“语音 + 原创背景音乐”的完整音频。Suno 称,这是第一个能把语音和配乐作为一条完整曲目一次生成的音频模型。测试版已向所有用户开放,手机 App 和网页端都能用。
一次生成,两个轨道
Speech 的用法很直接:在 Suno 里输入一个想法、一首诗或一段写好的文案,描述声音特质和音乐风格,模型会同时生成人声朗读和与之匹配的原创背景音乐,一次成型,不用再把配音和 BGM 分开做、后期合成。
官方举的例子很说明问题:配着柔和钢琴的睡前故事、配着体育场鼓点的动员演讲、甚至配着音乐的 ASMR 购物清单——都是“说话 + 氛围”一体成型的场景。如果你只需要干净的人声,也可以把背景音乐关掉,只生成纯语音。
和纯语音合成有什么不一样
市面上的语音合成工具解决的是“把文字读出来”,重心在音色逼真度和情感控制;Suno 的 Speech 则把“配乐”做进了生成本身:语音的节奏、停顿会和音乐的情绪走向一起被模型安排,而不是后期硬贴上去。
这对播客主、短视频创作者和需要配音的人来说,省掉的是最磨人的那一步:找 BGM、调音量、卡节奏。代价是可控性——纯语音合成可以逐句微调语气,Speech 目前更像“一次成型”,不满意就重新生成。
Suno 自己也承认,测试版还有明显毛病:口音漂移、停顿过重,并表示会持续改进。经过一个月小范围测试后才全量开放,说明团队对质量问题心里有数。
适合谁,先别急着商用
适合先试试的三类人:做播客和有声内容、需要快速出配音的短视频创作者、想给孩子做睡前故事或给活动做暖场音频的普通用户。
但商用之前先看清两件事:第一,Speech 还在测试版,生成质量不稳定,不适合直接用在对品质要求高的商业项目;第二,Suno 的商用授权按套餐区分,免费版仅限个人使用,商用一般需要 Pro 及以上,而且 Suno 与部分唱片公司的版权争议尚未完全了结,企业商用前建议先做法务评估——这一点在此前的 AI 音乐工具选型文章里有过详细拆解。
Suno 把这次发布放在“创意娱乐”的叙事下:继 9 月发布 v6 系列之后,Speech 是它从“做音乐”走向“做声音”的第一步。语音和音乐能不能真的在一次生成里互相成就,而不是互相拖累,就看接下来几个版本能不能修掉口音漂移和停顿问题了。