OpenAI 已把 GPT-Live-1 作为 API 开放给开发者。这是一款支持「全双工」的语音模型,能够一边听一边说,目前已在 ChatGPT 内部运行。开发者可以根据任务需要,把它与不同的后端模型搭配使用,从而在推理深度、响应速度与成本之间做取舍。

定价方面,该 API 为每分钟 0.05 美元,按语音模型的常规标准并不便宜。OpenAI 表示,完整细节将公布在 API 文档中。

性能上,OpenAI 公布的基准显示 GPT-Live-1 明显领先前代。在全双工交互性测试中,它拿到 80.1%,而前代 GPT-Realtime-2.145.4%;轮次切换延迟从 1.4 秒降到 0.8 秒;工具调用准确率从 60% 提升到 87%。在一项银行语音支持基准中,GPT-Live-1 的通过率为 32%,前代模型为 12.4%

功能层面,GPT-Live-1 附带 12 种新语音,覆盖不同口音、方言和语言,并开箱提供 ASR 转写与回复文本。

应用侧已有落地案例。据 Yelp 首席技术官 Alex Levy 介绍,Yelp 正把该模型用于电话预订,并反馈通话处理效果有所改善。

从产业视角看,全双工语音的关键意义在于交互范式的改变。传统语音助手采用「轮流说话」模式:用户说完,系统才处理并回应,中间存在明显停顿。全双工让模型在用户说话的同时持续接收与生成,更接近真人对话的节奏。延迟从 1.4 秒降到 0.8 秒,看似只是零点几秒的差别,但在电话客服、预订、预约这类场景中,停顿长短直接决定用户是否愿意继续用下去。

工具调用准确率从 60% 升到 87%,则关系到语音 Agent 能否真正完成任务,而不只是聊天。语音场景下,模型需要调用订位、查询、改签等外部系统,调用出错就意味着任务失败。银行语音支持通过率从 12.4% 升到 32% 虽仍不算高,但已是前代的两倍多,说明在合规要求高、流程复杂的场景中,语音模型开始具备可用性。

定价每分钟 0.05 美元,对高频通话业务是一笔需要计算的成本。这也解释了 OpenAI 为何强调开发者可以搭配不同后端模型:简单任务用轻量模型压低成本,复杂任务再调用更强推理能力,形成分层架构。

对产业链而言,这类模型的成熟会同时影响两端。上游是实时推理算力与语音基础设施的需求,下游则是客服、本地服务、预订平台等应用层的产品形态。Yelp 的电话预订案例表明,语音 Agent 正从演示走向实际业务。后续值得关注的是,其他平台是否会跟进类似集成,以及 0.05 美元每分钟的定价能否随竞争下降。