Google 宣布升级 Gemini 音频能力,并把“实时语音到语音翻译”以 Beta 形式推送到 Google Translate。该功能面向耳机使用场景,可在对话中进行实时翻译,并尽量保留说话者的语气、节奏与音高,让译文听感更接近原声表达。
目前该 Beta 先在 Android 端于美国、墨西哥、印度等地区分批开放,支持任意耳机,并覆盖70多种语言;iOS 版本预计在 2026 年扩展推出。官方同时提示,Beta 阶段仍可能受口音、噪声与网络波动影响,出现误译或延迟,涉及隐私的对话也需谨慎使用。
同日,Gemini 2.5 Flash 与 2.5 Pro 的 Text-to-Speech 预览版也获得更新,强调对“风格提示词”更贴合、语速可按语境更细致地调节,并提升多说话人场景下的角色声音一致性;Gemini 2.5 Flash Native Audio 亦更新,用于更可靠地执行复杂指令、触发外部工具与维持多轮自然对话,并在 Vertex AI 的 Gemini Live API 等入口提供支持。
常见问题
Q:Google Translate 的耳机实时翻译主要解决什么问题?
A:它把语音翻译变成可持续“边听边译”的体验,并尽量保留语气与节奏,适合面对面交流。
Q:耳机实时翻译在哪些平台和地区先开放?
A:先在 Android 端于美国、墨西哥、印度等地区分批开放,iOS 预计在 2026 年扩展。
Q:耳机实时翻译对耳机型号有要求吗?
A:官方信息显示支持任意耳机,重点取决于手机与 Google Translate 应用的可用性。
Q:Gemini 2.5 的文本转语音更新对创作者有什么影响?
A:更容易用提示词控制风格与停顿,且多角色对话时声音更一致,适合配音、播客与客服。
Q:Gemini 2.5 Flash Native Audio 更新适合哪些应用?
A:更适合实时语音代理与工作流场景,例如需要多轮对话、调用工具、按指令完成任务的语音助手。