2026年9月10日,OpenAI 发布 GPT-Live-1 API,面向需要实时对话的语音智能体。它采用全双工交互方式,系统在说话的同时仍可继续监听用户,因此能处理自然插话和打断,不必等一段固定录音结束后再开始回应。对客服、陪练、预约和电话助手来说,这种节奏变化比单纯提升语音清晰度更重要。
前台负责自然交流,后台负责复杂思考
GPT-Live-1 的定位不是让一个语音模型独自完成所有工作。官方给出的架构允许它把复杂推理或工具调用委托给后端模型:实时语音层维持低延迟听说,后端模型负责查资料、计算、调用业务系统或生成更严谨的答案。这样可以兼顾对话流畅度与任务能力,也让开发者根据场景选择不同的后台模型。
打断能力决定对话是否像真人
常见语音机器人会在用户插话时继续朗读,或因为环境噪声错误停顿。全双工系统需要持续判断当前声音是有效打断、简短附和还是背景干扰,并及时调整输出。GPT-Live-1 把这一过程放在实时会话中处理,同时支持更长会话和电话场景。官方还扩大了可选声音范围,并提供自动语音识别转录与回复文本,方便业务系统留存记录和做质量检查。
成本更容易单独核算
OpenAI 公布的前端语音层价格为每分钟0.05美元;如果任务还调用后端推理模型或其他工具,相关费用需要另行计算。对企业而言,这种拆分有利于把“维持自然通话”的成本与“完成复杂任务”的成本分别测算,但实际预算仍取决于平均通话时长、后台调用次数、并发量和失败重试。
上线前不能忽略的细节
- 在方言、口音、弱网和嘈杂环境下测试打断准确率;
- 明确何时转人工,并让用户知道正在与 AI 交流;
- 对录音、转录和电话号码设置保存期限与访问权限;
- 限制后台工具可执行的操作,付款或改资料等步骤需二次确认。
GPT-Live-1 把实时语音从“把文字读出来”推进到持续协作的交互层。真正决定体验的,将是它在复杂现场中能否听懂打断、快速接续上下文,并在后台任务尚未完成时给出自然且诚实的反馈。