讲师中心 微信公众号
AI工具推荐 视频效率加速

OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话

浅宇吖_8758

浅宇吖_8758

发布时间:2026-07-10 22:27:36

|

876人浏览过

|

来源于php中文网

原创

深夜,openai 意外发布全新语音模型——gpt-live。

作为 ChatGPT Voice 的重大升级,GPT-Live 将人机语音交互推向更贴近真实对话的新阶段。

该模型基于全双工架构打造,具备“边听边说”的能力。在交谈中,它能以 mhmm、yeah 等自然语气词即时反馈,表明正在专注倾听;也能实现毫秒级响应,支持快速问答;当你稍作停顿思考时,它会安静等待,不打断、不抢话。整体体验由此变得极为松弛、拟人化。

OpenAI 官方称,GPT-Live 是其目前最先进、最智能的语音模型。面对需网页检索、深度推理或复杂任务处理的问题,它会在后台自动调用最新前沿大模型完成运算,并将结果无缝融入当前对话流——整个过程无需中断语音交流,对话节奏始终如一。

首发阶段,GPT-Live 后台依赖的是 GPT-5.5。未来随着 OpenAI 推出更强模型,GPT-Live 所调用的底层引擎也将同步迭代升级。

即日起,GPT-Live 将面向全球 ChatGPT 用户分批上线两个版本:GPT-Live-1 与 GPT-Live-1 mini。

过往语音 AI 的演进路径

在 GPT-Live 面世前,主流语音 AI 已经逐步提升对话感,但不同技术路线仍面临明显权衡。

级联式语音系统

早期语音交互多采用级联架构:先由 ASR(语音转文本)模型识别用户语音,再交由大语言模型生成文字回复,最后通过 TTS(文本转语音)合成声音输出。初代 ChatGPT Voice 即属此类。

这种方式首次打通了语音输入与前沿大模型之间的通路,但多模块串联也带来延迟高、信息衰减、响应僵硬等问题,对话缺乏连贯性与临场感。

轮次式语音模型

后续推出的轮次式模型(如 ChatGPT Advanced Voice Mode),将音频理解与生成整合于单一模型内,显著降低了延迟,提升了语音流的顺滑度。

然而,其本质仍是“你说完→我再说”的单向轮次机制。模型必须等待用户完全静音后才启动回应逻辑,导致交互被动、节奏刻板。更关键的是,系统常依赖静音阈值判断发言结束——用户短暂沉思、环境杂音,都可能被误判为“已说完”,从而造成不合时宜的插话。

GPT-Live 的突破性设计

GPT-Live 通过两大核心架构革新,直击上述痛点。

持续性交互能力

GPT-Live 专为连续对话而生,依托全双工架构,不再按“消息轮次”处理交互,而是实时并行地接收语音输入、生成语音输出,并在每秒内多次做出动态决策:是否发声、继续聆听、暂时沉默、适时介入,或触发工具调用。

这种细粒度控制使它能精准把握语义节奏,实现类人打断、自然承接,甚至支持低延迟实时翻译。

面向深度任务的协同委派机制

OpenAI 将“实时对话能力”与“高阶任务处理能力”解耦。当遇到需搜索、推理或调用智能体功能的复杂问题时,GPT-Live 可将任务交由 GPT-5.5 等专用模型执行,自身则持续维持语音对话线程。

这一设计不仅保障了对话不中断,也让 GPT-Live 能灵活接入各类前沿模型与智能体能力,真正实现“自然交互 + 强大智能”的融合。

实测表现

OpenAI 构建了一套全新人类评估框架,聚焦对话愉悦感与流畅度。在一对一、5–10 分钟的真实对话对比测试中,GPT-Live-1 和 GPT-Live-1 mini 均显著优于 Advanced Voice Mode。评估维度涵盖整体偏好度、轮次衔接质量、插话合理性、对话连贯性,以及每次交互的自然程度。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话

OpenAI Codex Operator
OpenAI Codex Operator

在目标项目目录中运行 OpenAI Codex CLI,完成实现、调试等编码任务。当用户请求 OpenClaw 使用 Codex 时触发。

下载

GPQA:GPT-Live-1 在 GPQA 测试中大幅领先 Advanced Voice Mode。GPQA 用于衡量模型在生物、化学、物理等专业领域的专家级科学推理水平。

BrowseComp:GPT-Live-1 在 BrowseComp 上取得显著进步。该基准测试评估智能体在网页搜索中的表现,尤其考验其定位隐匿、分散信息的能力。

τ³-Voice Telecom(内部定制版):GPT-Live-1 在 τ³-Voice Telecom 评测中超越 Advanced Voice Mode。该任务模拟真实多轮电信客服场景,检验语音智能体的任务理解、上下文保持与服务闭环能力。

OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话

OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话

焕然一新的 ChatGPT Voice 体验

每周有超 1.5 亿用户借助 Voice 和 Dictation 功能与 ChatGPT 进行语音互动。他们用它获取免动手的日常协助、练习外语发音、听睡前故事,或只是在通勤途中轻松闲聊。

从今天起,点击 ChatGPT 中的 Voice 按钮,你将立即启用由 GPT-Live 驱动的全新语音体验——更自然的对话节奏、更强大的回答能力、更专注的倾听表现,以及直观可视化的语音回复。

OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话

更自然的对话节奏

如今与 ChatGPT 的语音交流,愈发接近真人交谈。你可以随时插入提问、临时停顿整理思路,或要求它放慢语速。它会用 mhmm、got it 等轻量回应确认接收,让你清晰感知它的专注与同步。团队还为 GPT-Live 全新录制了 ChatGPT 内全部九种语音风格。

更智能的回答能力

ChatGPT Voice 现已可按需调用 OpenAI 最新前沿模型,提供更高水准的回答。用户还可自主选择推理强度:Instant 模式响应迅捷,Medium 与 High 模式则赋予模型更充分的思考时间,适配不同复杂度需求。

OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话

更可靠的倾听表现

当你陷入短暂沉默时,ChatGPT Voice 不再急于接话,而是耐心守候;若你明确指令“别说话,继续听”,它也会严格遵循。即使身处嘈杂环境——如车辆驶过、旁人交谈——它也能更精准锁定你的声源,抗干扰能力显著增强。

一目了然的可视化回复

部分信息以图像呈现效果更佳。在语音对话过程中,ChatGPT 现可针对天气预报、股票行情、体育赛事等主题,即时推送结构清晰、信息丰富的可视化卡片。Voice 功能同时持续支持网页搜索、记忆调用、图片识别及文件上传。

最终,ChatGPT Voice 不仅更像一个“听得懂、接得住、想得深”的对话伙伴,也真正融入了日常生活的多元使用情境。

目前,GPT-Live 正在全球范围内向所有 ChatGPT 用户开放,覆盖 iOS、Android 及 ChatGPT.com 平台。其中,GPT-Live-1 将作为 Go、Plus 和 Pro 订阅用户的 ChatGPT Voice 默认模型;GPT-Live-1 mini 则面向免费用户默认启用。

参考链接:https://www.php.cn/link/d7e62bf7b966da27d8e09545a1165616

本文来自微信公众号“机器之心”,36氪经授权发布。

热门AI工具

更多
UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

SkildArt
SkildArt Hot

SkildArt是一款AI文本写作工具,一站式 AI 视觉创作平台。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

80

2026.09.30

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

80

2026.09.30

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

40

2026.09.30

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

60

2026.09.29

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

280

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

160

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

140

2026.09.23

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

80

2026.09.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
ChatGPT入门手册
ChatGPT入门手册

共0课时 | 0人学习

ChatGPT使用教学
ChatGPT使用教学

共2课时 | 195人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn