AI导航

Google 发布 Gemini 3.8 Flash TTS:语音生成更快更便宜,支持 100+ 语言

AI资讯
3 min read
1 次阅读

2026 年 9 月 23 日,Google 在官方博客发布 Gemini 3.8 Flash TTS 与 Gemini 3.8 Flash-Lite TTS,由 Gemini Audio 团队署名。新模型支持 100 多种语言和方言、2000 多个生产级预设声音,即日起通过 Gemini API 与 Google AI Studio 上线,直接对标 ElevenLabs、Cartesia 等语音厂商。

分工很明确:Flash TTS 面向深度创意与角色设计,可用自然语言提示从零生成全新声音,支持逐行"导演"表演——表演提示、节奏控制、方言切换;Flash-Lite TTS 面向大批量规模化场景,如配音、音频内容生产和语音助手,对音调、节奏、表现力做精细控制。

价格可能是最大的杀器

据 The Decoder 引用的 Google 定价页面,2026 年底前 Flash TTS 音频输出每百万 token 9 美元,Flash-Lite 6 美元(文本输入均为 0.5 美元)。按 1 秒音频折合 25 个 token,一小时音频 Flash TTS 只要 0.81 美元,Flash-Lite 0.54 美元。但 2027 年 1 月 1 日起价格翻倍,这个窗口期值得开发者留意。

官方基准成绩不错:Hume AI 语音设计基准总分第一(71.4)、口音建模第一(60.8);Voice Arena 盲测在日语、巴西葡语、越南语、现代标准阿拉伯语、墨西哥西班牙语、印地语领先竞品。但 The Decoder 独立实测发现,两段测试音频都有背景高频啸叫,一段末尾出现声音漂移,和官方"极小漂移"的表述有温差。

安全与接入

声音复制设了双重门槛:须提交声音所有者的口头同意录音,且声纹要与样本匹配;生成音频强制嵌入 SynthID 水印并附带 C2PA 凭证。接入上,Flash TTS 同步进入 Gemini Notebook,Flash-Lite 进入 Google Vids,Gemini Enterprise API 标注"即将推出"。生态首批集成包括 Agora、LiveKit、Pipecat、Vercel,以及 Figma、HeyGen、Linguana、Wondercraft。注意:"Voice Remixing"已宣布但尚未上线,区域端点(尤其欧盟数据处理)也还没补齐。

Q:已有 TTS 方案的团队有必要切换吗?

A:看场景。游戏、播客、有声书这类创意配音,可试用 Flash TTS 的角色设计能力;语音助手、批量配音这类成本敏感场景,Flash-Lite 每小时 0.54 美元有吸引力。但先实测口音和长音频稳定性,独立评测暴露的啸叫和漂移要亲自验证。

Q:30 秒就能复制声音,会不会被滥用?

A:Google 的门槛是口头同意录音加声纹匹配,生成音频强制水印和 C2PA 凭证。这不能杜绝滥用,但抬高了门槛。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。