豆包语音功能分三类:语音转文字(主界面麦克风)、实时语音对话(绿色电话图标,需支持该功能的智能体)、Mac端输入法语音输入;需分别确认入口、权限及智能体配置。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想用豆包直接说话提问、免打字,或和AI像打电话一样实时语音对话,得先确认入口在哪、权限开没开、智能体配没配好。不同场景要用不同路径,不是点一下就能通——比如主界面麦克风只能转文字,而绿色电话图标才真正开启双工语音通道。
手机端长按输入框麦克风实现语音转文字
这是最基础的语音输入方式,适合所有日常提问,不依赖特定智能体,但输出仍是文字回复。
1、打开豆包App,进入任意AI聊天窗口,确保底部输入框处于可编辑状态。
2、点击输入框唤出键盘,重点看键盘左下角或右下角是否出现【蓝色脉动麦克风图标】——没有它,说明语音模块根本没加载出来。
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
3、长按该图标不松手,听到“滴”一声提示音后,清晰说出问题,例如“北京今天PM2.5多少”,说完立刻松手。
4、等待2–3秒,语音自动转为文字填入输入框,点击发送即可。这一步操作起来很简单,直接把话说完松手就行。
5、若图标始终不显示,必须去手机【设置】→【应用管理】→【豆包】→【权限】,同时开启麦克风、存储和后台运行权限;iOS用户还需在【Siri与搜索】里启用豆包建议。
用支持语音通话的智能体发起实时语音对话
只有带“支持语音通话”标签的智能体才能走这条路径,它跳过文字中转,实现你一停、AI就接话的自然交互。
方法一:从现有智能体切入
① 点击底部导航栏“我的”→“智能体”,浏览列表,只找顶部明确标有“支持语音通话”的条目。
Doubao-Seedream-5.0-lite是字节跳动发布的最新图像创作模型。该模型首次搭载联网检索功能,能融合实时网络信息,提升生图时效性。同时,模型的聪明度进一步升级,能够精准解析复杂指令和视觉内容。此外,模型在世界知识广度、参考一致性及专业场景生成质量上均有增强,可更好地满足企业级视觉创作需求。
② 进入该智能体详情页,确认标签仍为绿色可用状态;若已灰显,说明语音能力被关闭,需重新编辑配置。
③ 进入其独立聊天窗口,右上角会出现【绿色电话图标】(注意:不是输入框旁的麦克风)。
④ 点击电话图标→弹出确认框→点“确定”→等待约1.5秒,屏幕中央出现动态绿色声波条,此时开口即被实时识别并语音回应。
方法二:自建支持语音的智能体
第一步:在“智能体”页点击右上角“+”,选择“创建新智能体”。
第二步:填写名称和描述后,务必勾选“语音交互”开关,并在语言设置中指定目标语种(如English、Español)。【这一步漏选,后续永远无法触发电话图标】
第三步:保存后返回列表,找到刚创建的智能体,再次点击进入,验证顶部标签和右上角电话图标是否同步出现。
电脑端用豆包输入法macOS版语音输入
如果你常在Mac上写文档、做会议纪要,这个方案比手机更高效——不用切App、不限时长、支持中英混说和方言识别。
1、确认已安装豆包输入法macOS版(版本号≥0.9.0),系统为macOS 10.15及以上。
2、在任意文本框中,按下Fn键(或你自定义的快捷键)呼出语音输入界面。
3、选择“按住说话”模式,或双击右Option键启用免按持续输入——后者适合大段口述,但需保持环境安静。
4、开始讲话,语音实时转为文字插入光标位置,过程中自动过滤“呃”“啊”等冗余词。


















