讯飞听见通过多维度声学特征与时序建模实现情绪识别:提取韵律、频谱及非语言线索,结合TCN/LSTM动态追踪情绪变化,并融合语义校验,准确率达90%。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

讯飞听见能识别发言人的情绪,靠的不是单点判断,而是把语音信号拆解成多个维度,再用模型综合打分。它不只听“说了什么”,更关注“怎么说”——语速快慢、音调起伏、停顿节奏、能量强弱,甚至细微的颤抖或气息变化,都会被捕捉并转化为情绪线索。
声学特征是基础:从波形里提取情绪指纹
系统先对原始语音做预处理,比如统一采样率、分帧加窗,然后提取三类关键声学特征:
- 韵律特征:包括基频(音高)、语速、短时能量、过零率等。例如愤怒常伴随语速加快、音调升高、能量增强;而疲惫或沮丧则表现为语速变慢、音调偏低、能量衰减。
- 频谱特征:主要用梅尔频率倒谱系数(MFCC),共13维以上,反映声道共振特性。不同情绪下发音器官紧张度不同,MFCC分布也会随之偏移。
- 非语言线索:如笑声、叹息、咳嗽、抽气声等。这些副语言信息由专用分类器识别,比如用CNN区分笑声与哽咽,用RNN建模叹息的时长和衰减趋势。
情绪识别不止于分类:支持动态追踪与风险提示
讯飞听见的情绪分析不是静态打标签,而是逐帧建模、连续推断:
- 采用时序卷积网络(TCN)或双向LSTM,理解语调起伏的节奏和转折点,比如一句话中前半句平静、后半句突然拔高,会被识别为情绪升级。
- 在会议场景中,系统会标记“情绪波动剧烈”“语气冲突”“长时间沉默后急促发言”等风险片段,并在转写文本旁标红提示。
- 结合上下文语义(如ASR转写结果),做跨模态校验。例如听到“我没事”但语音颤抖、语速迟缓,系统会抑制“中性”判断,上调压抑或焦虑概率。
实际应用中,情绪识别服务于具体目标
它不是为了炫技,而是解决真实问题:
- 在商务谈判中,自动识别某方多次打断、语气加重、语速加快等信号,提示“潜在对抗升级”,并建议缓和话术或调整发言顺序。
- 在客服回溯中,定位用户表达不满的关键节点,比如“第三次重复同一问题+语速骤降”,辅助质检与服务改进。
- 在医疗问诊录音中,发现患者描述症状时语调平直、停顿增多、音量减弱,可能提示抑郁倾向,供医生参考。
讯飞听见的情绪能力已嵌入其核心工作流,无需额外开关——只要开启高精转写,情绪分析就同步运行。准确率在实测中达90%,对愤怒、焦虑、喜悦等主流情绪识别稳定,对细微转折(如从犹豫到坚定)也有较好响应。不复杂,但容易忽略细节。


















