深夜,openai 意外发布全新语音模型——gpt-live。
作为 ChatGPT Voice 的重大升级,GPT-Live 将人机语音交互推向更贴近真实对话的新阶段。
该模型基于全双工架构打造,具备“边听边说”的能力。在交谈中,它能以 mhmm、yeah 等自然语气词即时反馈,表明正在专注倾听;也能实现毫秒级响应,支持快速问答;当你稍作停顿思考时,它会安静等待,不打断、不抢话。整体体验由此变得极为松弛、拟人化。
OpenAI 官方称,GPT-Live 是其目前最先进、最智能的语音模型。面对需网页检索、深度推理或复杂任务处理的问题,它会在后台自动调用最新前沿大模型完成运算,并将结果无缝融入当前对话流——整个过程无需中断语音交流,对话节奏始终如一。
首发阶段,GPT-Live 后台依赖的是 GPT-5.5。未来随着 OpenAI 推出更强模型,GPT-Live 所调用的底层引擎也将同步迭代升级。
即日起,GPT-Live 将面向全球 ChatGPT 用户分批上线两个版本:GPT-Live-1 与 GPT-Live-1 mini。
过往语音 AI 的演进路径
在 GPT-Live 面世前,主流语音 AI 已经逐步提升对话感,但不同技术路线仍面临明显权衡。
级联式语音系统
早期语音交互多采用级联架构:先由 ASR(语音转文本)模型识别用户语音,再交由大语言模型生成文字回复,最后通过 TTS(文本转语音)合成声音输出。初代 ChatGPT Voice 即属此类。
这种方式首次打通了语音输入与前沿大模型之间的通路,但多模块串联也带来延迟高、信息衰减、响应僵硬等问题,对话缺乏连贯性与临场感。
轮次式语音模型
后续推出的轮次式模型(如 ChatGPT Advanced Voice Mode),将音频理解与生成整合于单一模型内,显著降低了延迟,提升了语音流的顺滑度。
然而,其本质仍是“你说完→我再说”的单向轮次机制。模型必须等待用户完全静音后才启动回应逻辑,导致交互被动、节奏刻板。更关键的是,系统常依赖静音阈值判断发言结束——用户短暂沉思、环境杂音,都可能被误判为“已说完”,从而造成不合时宜的插话。
GPT-Live 的突破性设计
GPT-Live 通过两大核心架构革新,直击上述痛点。
持续性交互能力
GPT-Live 专为连续对话而生,依托全双工架构,不再按“消息轮次”处理交互,而是实时并行地接收语音输入、生成语音输出,并在每秒内多次做出动态决策:是否发声、继续聆听、暂时沉默、适时介入,或触发工具调用。
这种细粒度控制使它能精准把握语义节奏,实现类人打断、自然承接,甚至支持低延迟实时翻译。
面向深度任务的协同委派机制
OpenAI 将“实时对话能力”与“高阶任务处理能力”解耦。当遇到需搜索、推理或调用智能体功能的复杂问题时,GPT-Live 可将任务交由 GPT-5.5 等专用模型执行,自身则持续维持语音对话线程。
这一设计不仅保障了对话不中断,也让 GPT-Live 能灵活接入各类前沿模型与智能体能力,真正实现“自然交互 + 强大智能”的融合。
实测表现
OpenAI 构建了一套全新人类评估框架,聚焦对话愉悦感与流畅度。在一对一、5–10 分钟的真实对话对比测试中,GPT-Live-1 和 GPT-Live-1 mini 均显著优于 Advanced Voice Mode。评估维度涵盖整体偏好度、轮次衔接质量、插话合理性、对话连贯性,以及每次交互的自然程度。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

GPQA:GPT-Live-1 在 GPQA 测试中大幅领先 Advanced Voice Mode。GPQA 用于衡量模型在生物、化学、物理等专业领域的专家级科学推理水平。
BrowseComp:GPT-Live-1 在 BrowseComp 上取得显著进步。该基准测试评估智能体在网页搜索中的表现,尤其考验其定位隐匿、分散信息的能力。
τ³-Voice Telecom(内部定制版):GPT-Live-1 在 τ³-Voice Telecom 评测中超越 Advanced Voice Mode。该任务模拟真实多轮电信客服场景,检验语音智能体的任务理解、上下文保持与服务闭环能力。


焕然一新的 ChatGPT Voice 体验
每周有超 1.5 亿用户借助 Voice 和 Dictation 功能与 ChatGPT 进行语音互动。他们用它获取免动手的日常协助、练习外语发音、听睡前故事,或只是在通勤途中轻松闲聊。
从今天起,点击 ChatGPT 中的 Voice 按钮,你将立即启用由 GPT-Live 驱动的全新语音体验——更自然的对话节奏、更强大的回答能力、更专注的倾听表现,以及直观可视化的语音回复。

更自然的对话节奏
如今与 ChatGPT 的语音交流,愈发接近真人交谈。你可以随时插入提问、临时停顿整理思路,或要求它放慢语速。它会用 mhmm、got it 等轻量回应确认接收,让你清晰感知它的专注与同步。团队还为 GPT-Live 全新录制了 ChatGPT 内全部九种语音风格。
更智能的回答能力
ChatGPT Voice 现已可按需调用 OpenAI 最新前沿模型,提供更高水准的回答。用户还可自主选择推理强度:Instant 模式响应迅捷,Medium 与 High 模式则赋予模型更充分的思考时间,适配不同复杂度需求。

更可靠的倾听表现
当你陷入短暂沉默时,ChatGPT Voice 不再急于接话,而是耐心守候;若你明确指令“别说话,继续听”,它也会严格遵循。即使身处嘈杂环境——如车辆驶过、旁人交谈——它也能更精准锁定你的声源,抗干扰能力显著增强。
一目了然的可视化回复
部分信息以图像呈现效果更佳。在语音对话过程中,ChatGPT 现可针对天气预报、股票行情、体育赛事等主题,即时推送结构清晰、信息丰富的可视化卡片。Voice 功能同时持续支持网页搜索、记忆调用、图片识别及文件上传。
最终,ChatGPT Voice 不仅更像一个“听得懂、接得住、想得深”的对话伙伴,也真正融入了日常生活的多元使用情境。
目前,GPT-Live 正在全球范围内向所有 ChatGPT 用户开放,覆盖 iOS、Android 及 ChatGPT.com 平台。其中,GPT-Live-1 将作为 Go、Plus 和 Pro 订阅用户的 ChatGPT Voice 默认模型;GPT-Live-1 mini 则面向免费用户默认启用。
参考链接:https://www.php.cn/link/d7e62bf7b966da27d8e09545a1165616
本文来自微信公众号“机器之心”,36氪经授权发布。


















