海螺AI当前不支持多说话人自动识别,需通过四种替代路径实现:一、内置ASR转文字(无说话人区分);二、Otter.ai中转标注后导入;三、Whisper.cpp本地部署输出带标签稿;四、万兴喵影波形人工标记整理。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已有一段音频文件,希望海螺AI为其生成逐字稿并区分说话人,则可能是由于当前版本未开放多说话人自动识别接口或音频格式不被语音引擎支持。以下是实现该目标的多种操作路径:
一、使用海螺AI内置音频转文字功能(基础识别)
该方法适用于单人语音、普通话清晰、无明显背景噪音的音频,依赖海螺AI自研ASR模型进行端到端语音解码,输出纯文本结果,但不支持说话人分离。
1、登录海螺AI网页端(https://hailuoai.com/audio),进入“Audio to Text”模块。
2、点击【上传音频】,支持格式为MP3、WAV、M4A,文件大小不超过200MB,采样率需为16kHz或48kHz。
3、上传后系统自动开始转录,进度条显示实时处理状态;完成时页面弹出文本框,内容为连续段落式逐字稿。
4、点击【导出TXT】可保存原始文本,注意:此模式下所有语音均归为同一说话人,无角色标签。
二、通过Otter.ai中转实现说话人自动标注
该方案利用Otter.ai专业级说话人分离能力(基于深度聚类与声纹嵌入),将海螺AI无法识别的多人对话音频交由其处理,再将结构化SRT或VTT文件导入海螺AI做二次校对与导出。
1、访问otter.ai官网,注册账号并登录,点击【Upload Audio】上传同一段音频文件。
2、在上传设置中勾选【Enable speaker identification】,语言选择“Chinese (Mandarin)”。
3、等待转录完成,Otter.ai界面自动以不同颜色区块标注Speaker 1、Speaker 2等,并支持手动合并/拆分说话人片段。
4、点击右上角【Export】→【SRT】,下载带时间戳与说话人前缀的字幕文件;例如:“[Speaker 1] 你好,请问今天需要办理什么业务?”。
三、使用Whisper.cpp本地部署实现高精度分角色转录
该路径绕过海螺AI平台限制,直接调用OpenAI Whisper-large-v3量化模型,在本地设备运行,支持中文多说话人场景下的细粒度语音切分与角色聚类,输出含说话人标签的JSON与TXT。
1、从GitHub下载whisper.cpp最新release包,解压至本地文件夹,确保系统已安装CUDA驱动(Windows/Linux)或Metal(macOS)。
2、打开终端,执行命令:./main -m models/ggml-large-v3.bin -f input.mp3 --output-txt --output-json --print-speakers。
3、等待处理完成,生成input.txt与input.json,其中TXT文件每段开头含[SPEAKER_00]、[SPEAKER_01]等标识。
4、将TXT内容复制粘贴至海螺AI“Text Editor”中,可用于后续配音、字幕嵌入或脚本再编辑。
四、在万兴喵影中结合波形+人工标注完成说话人映射
该方法适用于音频中说话人切换规律明显、语义边界清晰的访谈类内容,借助剪辑软件可视化波形与时间轴,人工划分说话人区间并打标,形成结构化逐字稿。
1、将音频拖入万兴喵影时间轴轨道,启用【音频波形显示】,观察振幅峰值簇分布。
2、按Ctrl+K在每个说话人起始波形峰前打标记点,右键标记→【重命名】,输入“张三”“李四”等角色名。
3、播放音频,暂停于每段语音结尾处,再次打标记并命名,确保相邻标记间无重叠且覆盖全程。
4、导出标记列表为CSV,用Excel按“起始时间、结束时间、角色名、文本”四列整理,人工听写对应区间台词,最终生成带说话人字段的标准逐字稿。


















