chatgpt 的语音功能,终于补上了这一关键拼图。
北京时间今晨(7 月 9 日),OpenAI 正式发布全新实时语音模型 GPT-Live,并开始逐步替代 ChatGPT 中原有的语音交互系统。目前,付费用户已可启用性能更强的 GPT-Live-1,而免费用户则默认使用简化版 GPT-Live-1 mini。
此次更新最核心的突破,在于全面转向「边听边说」的全双工语音架构。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

图片来源:雷科技
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
通俗来讲,以往 AI 的语音交互更像使用对讲机——用户说完一句,系统判定输入结束,再启动理解与回应流程。即便此前 ChatGPT 的“高级”语音模式已支持中途打断,本质上仍受限于传统轮次式交互逻辑。
而集成 GPT-Live 的新版 ChatGPT 语音模式,可在你持续讲话的同时实时接收并处理语音流。你可以随时插话、修正或补充,它也能依据语句停顿、语速变化及上下文语义,自主决定继续输出、暂停等待,或给予简短回应(如“嗯”“好的”),以表明正在专注倾听。
听起来颇为前沿。但若放眼整个行业,OpenAI 的步伐其实略显滞后。早在今年 3 月,谷歌推出的 Gemini 3.1 Flash Live 已应用于 Gemini Live;4 月,字节跳动发布的原生全双工模型 Seeduplex 也已落地豆包语音通话场景——二者均通过端到端建模实现了真正意义上的“边听边说”。
不过,GPT-Live 的登场,至少标志着 ChatGPT 在底层架构层面,正式与两大主要竞品站在了同一技术起跑线。而在实际体验中,三者亦呈现出鲜明差异:豆包更贴合中文用户的表达习惯与节奏,Gemini 更强调多模态环境感知能力,GPT-Live 则将重心聚焦于另一维度:如何让 AI 在自然对话过程中同步完成搜索、推理与任务执行。
这正是豆包早期就设下的目标。
边听边说、懂得等待、还能思考,GPT-Live 致力打造更拟人的语音交互
暂且搁置对 ChatGPT 的苛刻审视。
进入 ChatGPT 的语音界面后,你将在左上角看到标注为「Live」的新版入口,而原有“高级”与“标准”语音模式则被统一归入「旧版」分类。此外,在语音设置页中,“智能等级”调节滑块清晰可见,分别对应 GPT-5.5 的即时、中等、高三级推理强度。

图片来源:雷科技
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
没错,GPT-Live 不仅完成了全双工语音架构的跃迁,实现真正的“边听边说”,更关键的是——它将“交互”与“思考”进行了模块化解耦。
换言之,GPT-Live 本身具备基础响应能力,但一旦涉及联网检索、深度推理或 Agent 类复杂任务,它会自动将指令调度至后台更强大的 GPT-5.5 模型进行处理。
举个真实案例:在听完 GPT-Live 对自身能力的简要说明后,我随即提问:“它与豆包、Gemini 在语音实时交互上的核心差异是什么?”
GPT-Live 并未泛泛而谈,而是从豆包在抗噪性、低延迟等工程细节入手,延伸至其产品定位对语音交互体验的极致追求;又从 Gemini 多模态实时建模的设计逻辑出发,关联 Google 对音视频统一交互框架的战略构想。
内容详实具体,极少出现空泛套话;信息准确性也较高,能准确指出豆包与 Gemini 更早便已支持全双工语音。

左为豆包打电话,右为 Gemini Live,图片来源:雷科技
相较之下,豆包语音倾向于简洁作答。即便明确要求展开说明,回复长度也往往被有意控制。这未必全是模型能力限制,更可能是一种主动设计——豆包希望电话模式始终轻盈流畅,贴近真实人际通话的情绪价值与节奏感。
当然,GPT-Live 的“聪明”,很大程度源自背后的 GPT-5.5。在具体实现上,它不仅支持根据任务类型智能调用不同推理强度的 GPT-5.5,还允许用户手动设定默认推理级别:选择“即时”即默认启用 GPT-5.5 即时模式,“中等”与“高”则分别对应不同强度的 GPT-5.5 Thinking。

图片来源:OpenAI
这种分层协作机制,显著提升了实时语音对话中的 AI 智能上限。
毕竟没人愿意对着一个“木头人”倾诉。过去用户被语音助手激怒的案例屡见不鲜。如今大模型虽大幅强化了语言理解与逻辑能力,但实时语音交互常因性能妥协而牺牲智能水准——AI 回应依然生硬、迟钝甚至离题万里。
因此,如果说豆包 Seeduplex 实现了「边听边说」,GPT-Live 则正迈向「边听边说边思考」。事实上,豆包在 Seeduplex 发布时就已提出未来方向之一:
「推动感知、思考、输出一体化,深入探索『边听边想』、『边听边搜』等路径,增强模型深层推理与执行能力,进一步提升语音交互的自然流畅度。」
不止于搜索与思考,GPT-Live 还优化了对话本身的呼吸感。当我说到一半突然卡壳、犹豫下一句该如何组织时,它不会立刻抢断接话,而是先保持安静等待数秒;若仍未收到新输入,才会温和询问。这个微小细节,恰恰是语音交互是否“像人”的关键判据。
现实中,我们说话本就充满停顿、重复与自我修正。旧有语音模型却常将短暂沉默误判为发言终结,导致用户刚吸一口气,AI 已迫不及待开始输出。尽管豆包 Seeduplex 宣称改善了该问题,但实测中仍偶有抢话现象。
不过坦白讲,我短期内大概率仍不会成为 ChatGPT 语音模式的高频用户。
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
一方面,其中文发音相比豆包“桃子音”的自然度仍有差距,本次升级并未改善,整体仍偏向外国人说中文的腔调,略显违和。
另一方面,GPT-Live 在语音输出过程中偶尔会出现明显“卡顿”。结合文本生成观察,推测源于 GPT-5.5 实时调整输出内容——文字端仅表现为细微润色,转化为连续语音后,则呈现为突兀停顿或转折生硬。

图片来源:雷科技
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
OpenAI 并未说明此类现象是否源于 GPT-Live 与 GPT-5.5 的协同机制,但从体验反推,双模型分工虽带来更强能力,也可能增加语音合成链路的复杂度。至少现阶段,GPT-Live 偶尔仍会暴露些许技术痕迹。
各家都在做“边听边说”,但关注点各不相同
全双工语音架构,已是 AI 语音交互不可绕行的技术必经之路。
我们都曾忍受过“反人类”的语音交互:用户说完,AI 才开始思考;AI 开口,用户必须闭嘴静候。真实的人类对话远非如此规整——我们会迟疑、停顿、改口,也会在对方讲话时用“嗯”“啊”表示倾听。AI 若想成为长期陪伴的对话伙伴,首先得适应这种连续、动态甚至模糊的交流生态。
在此维度上,豆包、Gemini 与 GPT-Live 已达成共识:语音输出与语音接收可同步进行。用户无需等待 AI 讲完一整段话,也不必刻意用“好了”“结束”来终结每一轮对话。
但“边听边说”只是起点,具体如何听、怎样说、听到之后又能做什么,三家给出的解法差异显著。

图片来源:OpenAI
豆包 Seeduplex 发布时,字节重点阐释了抢话识别、误打断抑制、背景人声过滤及停顿意图判断等细节。这些看似琐碎的问题,恰恰决定了“打电话”模式是否真的像在与真人通话。
例如用户沉默两秒,可能是思考下文,也可能已表达完毕;同事在旁插话,或许是与你互动,也可能纯属环境噪音。因此豆包的优势极为直观:在中文语境下,对口语节奏、含混表达及复杂声学干扰的鲁棒性,仍是三者中最稳定的。
另一边,Google 很早就将 Gemini Live 置于统一的实时多模态框架内,支持语音、摄像头画面、屏幕内容与文本输入的无缝融合,并非临时拼凑的功能堆叠,而是同一连续上下文的不同感知通道。用户可边拍摄眼前物体边提问操作方法,也可共享手机屏幕,让 Gemini 解读应用界面或网页结构。
这套路线聚焦“统一感知”。Google 所追求的,是让 AI 真正理解用户正在注视什么、屏幕上发生了什么、周围声音是否值得响应——语音在此更多是多模态助手的一种交互接口。
值得一提的是,GPT-Live 目前尚未开放视频通话能力,需切换回旧版语音模型才能启用;而 Gemini 自诞生起,便将“听”与“看”整合于同一个 Live 模型之中。
当然,模型统一并不等于各项体验全面领先。至少在中文乃至多语言场景下,Gemini 表现尚显乏力:中文识别准确率偏低,有时甚至会误判为其他语种。

我的普通话不至于吧,图片来源:雷科技
GPT-Live 则锚定另一关键命题:AI 在边听边说时,能否同步进行深度思考。而这,恰是豆包 Seeduplex 发布时已预告的进阶方向。
GPT-Live 并未强求单模型通吃所有任务,而是采用更灵活的架构设计——让当前最强的通用模型之一 GPT-5.5,专门应对语音交互中那些更复杂的意图理解、需求解析与任务执行。
因此在实际对话中,GPT-Live 的回应更具完整性:既不破坏对话节奏,又能从多角度拆解问题,也更能承接长链条、高难度的追问。
不同的技术路径,也映射出迥异的产品哲学与交互逻辑。Gemini Live 的通话与屏幕共享并非附加功能,而是整个交互范式的基石。它适合用户手持手机边看边问,也契合 Google 对手机、AR眼镜、车载系统及智能家居入口的长期布局。
豆包的入口直接命名为“打电话”,界面设计、语气风格与回答长度均向真实通话靠拢。它极少长篇大论,即便用户要求展开,回复仍保持克制边界。
ChatGPT 的语音界面,则更接近一个完整 AI 工作台的语音延伸。用户可在同一对话中自由切换:从闲聊到搜索,从问答到文档分析,再到深度推理与任务执行。语音并未被限定于独立“电话模式”,而是深度融入 ChatGPT 全套能力体系。
三家都在奔赴“自然”,但抵达路径与节奏各不相同。
ChatGPT 架构追平豆包/Gemini,体验难分伯仲
那么,ChatGPT 是否已真正追上豆包与 Gemini?
从架构角度看,答案基本成立。GPT-Live 成功补足原生全双工语音能力,支持持续监听、精准中断识别,并显著提升对停顿语义的理解精度。过去 ChatGPT 高级语音模式与豆包 Seeduplex、Gemini Live 之间那道明显的架构鸿沟,如今已然弥合。
但从体验维度看,很难简单排出优劣序列。若追求最自然的中文发音、最稳健的复杂声学环境适应力,豆包仍具优势;若需要边看边聊、实时共享摄像头与屏幕,Gemini Live 的多模态整合能力最为突出;若希望通过语音深入探讨议题,甚至触发搜索、推理与自动化执行,GPT-Live 已展现出领先势头。
可以预见,三方最终将趋于能力互补。豆包会逐步增强推理深度与视觉理解,GPT-Live 将重新整合视频能力,Gemini 也将持续强化 Live 模型与通用 Agent 的协同效率。
我们有理由相信,AI 语音交互体验将持续进化,一个人机交互以“说话”而非“手指点击”为主导的未来,正加速到来。
本文来自“雷科技”,36氪经授权发布。


















