2026 年 9 月 23 日,Google 在官方博客发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,由 Gemini Audio 团队署名。新模型支持 100 多种语言和方言、2000 多个生产级预设声音,即日起通过 Gemini API 与 Google AI Studio 上线,直接对标 ElevenLabs、Cartesia 等语音厂商。
分工很明确:Flash TTS 面向深度创意与角色设计,可用自然语言提示从零生成全新声音,支持逐行"导演"表演——表演提示、节奏控制、方言切换;Flash-Lite TTS 面向大批量规模化场景,如配音、音频内容生产和语音助手,对音调、节奏、表现力做精细控制。
价格可能是最大的杀器
据 The Decoder 引用的 Google 定价页面,2026 年底前 Flash TTS 音频输出每百万 token 9 美元,Flash-Lite 6 美元(文本输入均为 0.5 美元)。按 1 秒音频折合 25 个 token,一小时音频 Flash TTS 只要 0.81 美元,Flash-Lite 0.54 美元。但 2027 年 1 月 1 日起价格翻倍,这个窗口期值得开发者留意。
官方基准成绩不错:Hume AI 语音设计基准总分第一(71.4)、口音建模第一(60.8);Voice Arena 盲测在日语、巴西葡语、越南语、现代标准阿拉伯语、墨西哥西班牙语、印地语领先竞品。但 The Decoder 独立实测发现,两段测试音频都有背景高频啸叫,一段末尾出现声音漂移,和官方"极小漂移"的表述有温差。
安全与接入
声音复制设了双重门槛:须提交声音所有者的口头同意录音,且声纹要与样本匹配;生成音频强制嵌入 SynthID 水印并附带 C2PA 凭证。接入上,Flash TTS 同步进入 Gemini Notebook,Flash-Lite 进入 Google Vids,Gemini Enterprise API 标注"即将推出"。生态首批集成包括 Agora、LiveKit、Pipecat、Vercel,以及 Figma、HeyGen、Linguana、Wondercraft。注意:"Voice Remixing"已宣布但尚未上线,区域端点(尤其欧盟数据处理)也还没补齐。
Q:已有 TTS 方案的团队有必要切换吗?
A:看场景。游戏、播客、有声书这类创意配音,可试用 Flash TTS 的角色设计能力;语音助手、批量配音这类成本敏感场景,Flash-Lite 每小时 0.54 美元有吸引力。但先实测口音和长音频稳定性,独立评测暴露的啸叫和漂移要亲自验证。
Q:30 秒就能复制声音,会不会被滥用?
A:Google 的门槛是口头同意录音加声纹匹配,生成音频强制水印和 C2PA 凭证。这不能杜绝滥用,但抬高了门槛。