讯飞听见区分多人发言依赖声纹识别、说话人管理与智能上下文建模协同;需提前或会后录入声纹,录音时启用“区分说话人”并优选“双人会谈”模式,支持最多10人精准归属与结构化分析。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

讯飞听见区分多人发言,核心靠的是声纹识别 + 说话人管理 + 智能上下文建模三者协同,不是单纯靠音量或停顿切分。只要设置得当、声纹录入规范,即使三人以上轮流发言、语速较快、有短暂重叠,也能稳定标注归属。
提前录入声纹,让系统“记住声音”
这是精准区分的前提。系统不是靠猜,而是比对声纹特征。建议在会议前用PC客户端完成录入:
- 打开讯飞听见最新版客户端 → 点击左上角账号 → 选择「说话人管理」→ 「新增说话人」
- 输入真实姓名或易识别代号(如“张总监”“李工”),按提示朗读10秒引导文本
- 环境务必安静,发音清晰匀速,避免背景人声或键盘敲击声混入
- 每人一条声纹,最多支持10人,覆盖常规会议规模
录音时开启「区分说话人」并选对模式
实时录音中必须主动启用该功能,否则默认合并为“发言人1”:
- 网页端或客户端进入「实时录音」→ 点击【开始录音】前,先点设置按钮
- 勾选「区分说话人」,语言选“普通话”或对应方言模型(如粤语会议选粤语)
- 更推荐直接选择「双人会谈」模式——此模式下该功能默认开启,且适配多人场景(不限于2人)
- 麦克风选内置或外接指向性设备,确保各发言者声音分离度高
录音后快速补录声纹,应对临时参会者
没提前录入也不影响结果,会后可快速关联:
- 转写完成后,在文本页面选中一段明确属于某人的发言(建议选30秒以上、无干扰的片段)
- 点击该段上方的「保存说话人」按钮 → 输入姓名 → 确认
- 系统自动提取该段语音的声纹特征,后续相同声纹内容将自动归类
- 同一人不同片段多次操作,可增强模型对该声纹的识别鲁棒性
结合说话人筛选与总结,提升信息提取效率
区分只是第一步,真正发挥价值在于结构化使用:
- 点击左侧说话人列表,可单独查看某人全部发言,方便责任追溯或内容汇总
- 使用「高精转写」服务后,系统会为每位说话人生成独立摘要(含观点、承诺、待办)
- 点击说话人名称可修改备注,比如把“发言人3”改为“市场部王磊”,便于团队协作查阅
- 搭配「打点」功能,在录音中实时标记关键结论,会后可按人+重点交叉定位


















