应用与产品 · 深度报道

OpenAI 将 GPT-Live-1 推向 API:全双工语音代理开始从“会对话”走向“能执行”

OpenAI 已将 GPT-Live-1 接入 API,向开发者开放全双工语音能力,能在同一模型内同时处理输入与输出音频并将复杂推理与工具调用交给后台文本模型。前端语音层定价为每分钟 0.05 美元,但完整部署成本和企业集成仍取决于后台模型、工具调用、权限与审计等因素。

AIFluxNews AIFlux 编辑2026 年 9 月 10 日阅读约 5 分钟
OpenAI 将 GPT-Live-1 推向 API:全双工语音代理开始从“会对话”走向“能执行”

OpenAI 已将 GPT-Live-1 接入 API,向开发者开放全双工语音能力,能在同一模型内同时处理输入与输出音频并将复杂推理与工具调用交给后台文本模型。前端语音层定价为每分钟 0.05 美元,但完整部署成本和企业集成仍取决于后台模型、工具调用、权限与审计等因素。

OpenAI 9月10日宣布,将 GPT-Live-1 正式接入 API,向开发者开放一种能够同时听和说的全双工语音模型。与传统的“语音转文字—大语言模型—文字转语音”串联架构不同,GPT-Live-1 在同一个模型中处理输入与输出音频,并可以把更深层的推理和工具调用交给后台文本模型完成。

OpenAI 表示,GPT-Live-1 已可在 API 中使用,前端语音层的价格为每分钟0.05美元。这个价格只对应语音交互层;开发者仍需根据应用需求配置后台模型、工具和代理运行框架。对于企业客服、电话服务和教育类应用而言,这意味着语音代理的成本结构不再只是一个模型调用价格,而是由实时语音、推理、工具调用以及业务系统接入共同决定。

OpenAI:在 API 中构建更自然的语音体验

全双工架构试图解决语音代理的“抢话”问题

现有语音助手往往依赖轮次检测:系统先判断用户是否说完,再开始生成回答。短暂的停顿、背景噪声或用户思考,都可能被识别为发言结束,导致模型过早插话。串联式架构还会在语音识别、文本推理和语音合成之间产生额外延迟,开发者必须自行协调上下文、时间和中断状态。

GPT-Live-1 的核心变化,是让模型持续处理输入,同时生成输出。它可以在用户说话时继续聆听,在需要时暂停、继续回答或被打断,也可以对“嗯”“好的”这类简短回应作出更自然的处理。OpenAI称,这种设计能够减少不同模型之间交接时出现的上下文丢失和时序错误。

这并不意味着开发者失去了对轮次的控制。OpenAI表示,GPT-Live-1虽然不是传统的轮次模型,但仍原生支持轮次检测,开发者可以继续围绕明确的发言边界设计应用逻辑。

OpenAI在早期评估中引用了语言学习平台 Speak 的结果:与此前的轮次式系统相比,GPT-Live-1让学习者拥有更多思考时间,并将打断次数减少了近80%。这一数字属于 OpenAI 引述的早期评估结果,并非对所有语音场景的独立验证。

语音负责保持交流,后台模型负责完成工作

GPT-Live-1并不试图独自承担所有复杂任务。开发者可以让它把搜索、深度推理和工具调用转交给后台文本模型,例如 GPT-6 Astra,或第三方模型;语音层则继续维持对话,使用户不必在等待后台任务时面对沉默或僵硬的交互。

OpenAI给出的设计思路是,开发者可以让更快、更低成本的模型处理预约、订单更新等高频任务,再把复杂的客户问题交给推理能力更强的模型。语音模型、后台模型和工具之间因此形成分工,而不是由一个模型包办所有环节。

这种模式也把“语音代理”与传统语音机器人区分开来。它不只是将用户的语音转成文字,再朗读一段答案,而是可以在通话过程中处理背景噪声、静默和中断,并在后台调用企业系统或其他工具。OpenAI称,GPT-Live-1支持电话部署,适用场景包括餐厅预订和客户支持。

开发者还可以通过系统提示词控制代理的语气、语速和对话风格。模型原生提供语音识别转写和回答文本,并支持字母数字内容理解及关键词偏置。对于长时间对话,OpenAI则强调了上下文保留和持续交互质量的改善。

从 ChatGPT Voice 到企业电话工作流

GPT-Live最初于2026年7月随 ChatGPT Voice 推出。OpenAI在GPT-Live的首次介绍中,将其描述为能够持续聆听、适时回应、处理打断,并把搜索和复杂任务交给后台模型的新一代语音架构。此次 API 发布,意味着这套交互方式从 ChatGPT 的产品体验延伸到了开发者可以自行设计的应用和业务流程。

OpenAI还把 GPT-Live-1 与企业产品 Presence 联系起来,称 Presence可以用该模型支持实时语音交互,让企业代理回答问题、解决请求、调用公司系统、执行获批准的动作,并在必要时转交人工。此前,OpenAI对 Presence的定位已经从单纯的聊天产品转向包含权限、审批、审计和测试在内的企业部署流程;OpenAI推出 Presence 的相关报道记录了这条企业化路线。

这条路线也与电信运营商的尝试相呼应。德国电信已把 ChatGPT、API和实时语音能力放入客服与网络运营等更大的工作流中,其 AI 原生转型案例显示,企业对语音 AI的关注已不止于客服问答,也包括实时翻译、通话助手和通话后摘要等环节。

竞争焦点从声音自然度扩展到系统可靠性

OpenAI称,GPT-Live-1在其 Full Duplex Bench上的表现比 GPT-Realtime-2.1高出30个百分点,在轮次延迟和交互行为方面也有明显改善;当它与 GPT-6 Astra以中等推理强度配合时,在 Tau3测试中排名第一。OpenAI没有在这次发布中完整披露这些评估的全部测试条件,因此这些结果应被视为公司公布的模型评估数据。

语音模型的实际表现也很难由单一分数概括。Hume此前发布的 Real World VoiceEQ 语音评测就指出,语音系统需要同时应对噪声、停顿、情绪、身份保持、长对话稳定性和内容准确性;没有一个系统能在所有维度都占据优势。

因此,GPT-Live-1的价值不只在于它听起来更像人,也在于它试图把中断处理、背景噪声、静默、推理委派和电话部署放进同一套开发路径。对于应用开发者来说,真正的问题将从“如何让模型开口”转向“如何让它在复杂业务中可靠地知道何时说话、何时等待、何时调用工具,以及何时交给人工”。

定价开放,但完整部署成本仍取决于后台系统

OpenAI目前公布的是每分钟0.05美元的前端语音层价格,并称会继续扩大声音、口音、方言和语言的选择。对于定制声音,开发者需要联系销售团队确认资格和申请流程。

API开发者还需要结合后台推理模型、工具和代理框架来计算总成本。OpenAI的API定价文档列出了文本、实时音频、转写以及工具等不同类别的收费方式,但GPT-Live-1的实际业务成本仍会取决于一次通话调用了哪些后台模型、持续了多长时间,以及是否需要连接电话系统和企业软件。

这也是此次发布留下的主要问题之一:GPT-Live-1降低了开发者构建自然语音交互的架构门槛,却没有消除企业部署中的权限、隐私、审计、人工接管和成本控制问题。随着语音代理开始进入电话和客服等高风险工作流,模型能否自然地对话只是起点;能否在正确的边界内持续工作,才会决定它是否真正适合生产环境。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。