7月29日,据explainx.ai消息,openai近期正式推出全新语音转录模型系列,致力于为开发者打造更贴合真实业务场景的语音识别工具。本次升级将语音转录明确区分为实时流式处理与异步批量处理两大方向,并分别推出针对性优化的推荐模型。
该系列包含两个主力模型:gpt-live-transcribe专为麦克风输入、在线通话等持续音频流场景构建,具备毫秒级响应能力,确保低延迟实时转录;而gpt-transcribe则面向已完成录制的音频文件或大规模离线转录任务进行深度优化。OpenAI官方建议,新项目开发应优先选用这两款模型,逐步替代原有的Whisper及gpt-4o-transcribe接口。
两模型均支持通过prompt(自然语言提示)、keywords(关键术语)和languages(目标语种列表)等多种方式注入上下文信息,从而有效提升在强口音、垂直领域术语以及高噪声环境下的识别鲁棒性与准确率。根据OpenAI内部基准测试,加入上下文引导后,gpt-transcribe在语义层面的理解精度实现明显跃升。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜



















