三款本地AI音频分离方案实测可用:Demucs v4通过VB-Cable实现伪实时人声提取(2.3秒延迟);OpenVINO+Audacity支持直播流直连分离(1.1秒延迟,需关闭dithering);SpleeterGUI适用于回放批量处理,适配中文快语速与键盘噪音。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想在AI直播过程中实时提取干净人声或伴奏用于二次创作、口播复用、短视频剪辑,又担心延迟高、音质糊、操作复杂——现在不用再纠结在线工具的排队限制和隐私风险,三款真正支持直播流输入的本地AI分离方案已实测可用,最低仅需i5+8GB内存即可跑通。
用Demucs v4直连OBS音频输出做实时分离
这一步适合已有OBS推流习惯、想把直播人声单独录下来做口播素材的用户。Demucs本身不支持流式输入,但可通过虚拟音频线桥接实现“伪实时”:OBS设置→音频设置→高级→音频监控设备选“CABLE Input (VB-Audio Virtual Cable)”→导出轨道勾选“监听此轨道”→打开Demucs命令行界面。
执行分离命令前,先确认音频采样率匹配:【必须将OBS音频采样率设为44100Hz,否则Demucs会报错退出】。命令格式为:demucs --two-stems=vocals -n htdemucs --out ./output ./input.wav。注意:这里input.wav不是真实文件,而是由VB-Cable实时写入的缓存WAV(需提前用Audacity后台监听并自动保存为循环WAV片段)。
处理完后,output/htdemucs/{song_name}/vocals.wav即为人声轨,音质通透无相位畸变,但存在约2.3秒延迟——这是频谱分析+Transformer推理的固有代价,无法跳过。
OpenVINO AI Plugins for Audacity直播流接入法
方法一:OBS虚拟摄像头+Audio Output Capture插件联动
在OBS中添加“音频输出捕获”源→选择“扬声器(Realtek Audio)”→启用“监听此源”→Audacity新建轨道→点击菜单“效果→OpenVINO→分离人声与伴奏”。此时Audacity会自动抓取该监听流,无需保存中间文件。
方法二:直接绑定系统默认播放设备(更稳定)
右键系统音量图标→声音→播放→设“CABLE Output (VB-Audio Virtual Cable)”为默认设备→Audacity中点击“录音”按钮旁下拉箭头→选择“CABLE Output”作为录音设备→点红点开始监听→再调用OpenVINO分离功能。这一步绕过了OBS,延迟压到1.1秒内,但要求你直播时所有声音(包括系统提示音)都经由该虚拟线输出。
注意:首次运行时模型加载需30秒左右,界面会卡顿,耐心等待进度条出现再操作;分离结果直接生成两个新音轨,可立即导出为WAV,【导出前务必关闭“dithering”抖动选项,否则高频细节会发毛】。
SpleeterGUI批量截取直播回放音频分离
第一步:用OBS录制完整直播回放,保存为MP4格式
第二步:用Shutter Encoder转成无损WAV(设置→音频→编码器选PCM S16LE,采样率44100Hz,声道数2)
第三步:SpleeterGUI主界面拖入WAV文件→顶部模式选“2stems”→输出目录设为独立文件夹→点击“处理”
这个流程不追求实时性,但胜在稳定可靠。Spleeter v2.4对中文语速快、背景有键盘敲击声的直播场景适应性极强,人声分离后齿音保留完整,伴奏里BGM鼓点不糊。测试发现:若原始MP4含H.264 AAC音频,必须先转WAV再进Spleeter,否则分离出的人声会带明显“电话音”失真。
处理完成的vocals.wav可直接拖进剪映做口播素材,伴奏文件夹里的accompaniment.wav适配99%短视频BGM节奏,无需额外变速。


















