ClearerVoice-Studio支持精准提取干声:有画面时用AV_MossFormer2_TSE_16K音画协同锁定主唱,无画面时用FRCRN_48K处理WAV预处理文件,输出16-bit 48kHz单声道WAV干声,保留气声、齿音等细节。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想把一段带伴奏的原唱音频,精准拆出只有人声、毫无混响和乐器残留的干声,用于AI翻唱训练或声纹建模——这不是简单“去伴奏”,而是要保留气声、唇齿音、换气点等细微动态,同时彻底剥离鼓点底噪、和声层、空间混响。实测发现,90%的失败源于模型选错、参数设低、格式压损三个环节。
第一步:选对分离工具与模型
不推荐用手机APP一键提取干声做RVC训练,它们默认输出MP3+192kbps,高频齿音和呼吸衰减严重,模型学不到真实声纹细节。
实测有效的本地化方案是:ClearerVoice-Studio + AV_MossFormer2_TSE_16K模型。它支持音画协同定位主唱,即使原曲是MV或带画面的现场视频,也能锁定主唱声道,避免传统盲分离导致的“人声撕裂”或“伴奏粘连”。
若只有纯音频(无画面),改用openvino-plugins-ai-audacity中的FRCRN模型,它在16kHz采样下对中频人声保真度最高,尤其适合中文咬字场景。
第二步:预处理原文件
直接拖入MP4/MKV视频或MP3音频会失败——ClearerVoice-Studio要求输入为未压缩的PCM WAV或FLAC,且采样率必须为16kHz或48kHz。
操作路径:用Audacity打开原始文件→ Tracks → Resample → 设为48000Hz→ File → Export → Export as WAV → Encoding设为“Signed 16-bit PCM” → 保存。
注意:如果原文件是抖音下载的AAC格式,先用FFmpeg转一次:ffmpeg -i input.aac -ar 48000 -ac 2 -c:a pcm_s16le output.wav。跳过这步会导致模型加载失败并报错“sample rate mismatch”。
第三步:在ClearerVoice-Studio中执行目标说话人提取
方法一:有画面的视频(如演唱会MV)
① 浏览器打开 http://localhost:8501 → 点击「Target Speaker Extraction」标签页 → 拖入已转好的WAV文件(或MP4)
② 勾选「Enable Face Detection」→ 系统自动逐帧扫描,高亮主讲人脸区域;若识别不准,手动点击画面中主唱脸部任一帧,模型将以此为锚点追踪整段语音
③ 模型选择下拉框中选AV_MossFormer2_TSE_16K → 输出采样率保持48kHz → 点击「Start Processing」
方法二:纯音频(如QQ音乐下载的MP3)
① 切换到「Speech Separation」标签页 → 上传已转WAV文件
② 模型选FRCRN_48K(不是MossFormer2_Base)→ Output Channels选“Mono”(干声必须单声道,双声道会引入相位干扰)
③ 点击「Start Processing」→ 处理时间约原长×1.8倍(1分钟音频耗时1分50秒左右)
第四步:验证与导出干声
处理完成后页面自动生成波形图与频谱图。重点看3kHz–8kHz区间:干净干声在此段应有连续、毛刺状高频能量(对应齿音/擦音),若该区域平滑如纸,则说明模型过度滤波,需重跑并关闭“Aggressive Denoise”选项。
导出前务必检查:Output Format选WAV → Bit Depth选16-bit → Sample Rate与输入一致(48000Hz)→ 点击「Download Dry Vocal」
【导出后不要用Windows自带播放器听!】它的音频引擎会插值渲染,掩盖高频缺失。用Audacity或foobar2000打开,放大波形看0.1秒级气口是否清晰可见。

















