可灵AI长视频需Kling 2.6+版本才支持原生配音,否则须手动配音;内置“音画同出”支持文本一键生成情绪化语音并精准口型同步,外部配音须用WAV格式音频导入校准。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

可灵AI生成超过60秒的长视频后,系统默认不自动配音,需手动介入完成语音合成与口型同步,否则视频将无声或仅保留背景音效。
确认长视频是否支持原生配音
打开已生成的长视频项目,在编辑界面右上角查看版本标识——【必须显示“Kling 2.6”或更高】,低于此版本的长视频项目无法启用音画同出功能,只能走外部配音流程。
若界面显示“Kling 2.5”或无版本号,点击右上角头像→“检查更新”,强制刷新页面并重新加载项目。
使用内置“音画同出”一键配音(推荐)
该功能专为1–3分钟长视频设计,直接从文本生成带情绪、节奏、口型匹配的完整语音,无需导出再处理。
第一步:在视频编辑页左侧工具栏点击“配音”图标(麦克风形状),确保当前处于“文本配音”标签页。
第二步:粘贴完整脚本,注意分段——每段不超过80字,段间空一行;长句必须拆成主谓宾结构,例如把“尽管天气炎热但用户仍坚持户外运动”改为“天气很热。用户还在坚持户外运动。”否则语调会生硬断裂。
第三步:勾选“启用音画同出”,系统自动分析视频时长与画面节奏,生成三组语音方案,标注如“沉稳男声|语速1.1x|口型对齐精度97%”。
第四步:点击任一方案右侧的“试听+对口型”按钮,播放时观察数字人嘴唇开合帧是否与重音字完全同步;若首句延迟,拖动时间轴将语音起始点向左微调至画面人物首次眨眼帧。
导入外部音频实现高保真配音
适用于已有专业录音、方言配音、多角色对话或需精确控制气口停顿的场景。
方法一:用ElevenLabs生成音频后导入
登录ElevenLabs → Voice Changer → 上传3秒参考音 → 选择音色 → 粘贴分段脚本 → 设置语速1.05 → 生成WAV → 下载。
方法二:用Audacity降噪后导入
导入原始录音 → 选中空白段 → 效果→噪声采样 → 全选→效果→降噪(降噪程度设为12dB)→ 导出为WAV(非MP3)。
【关键提醒:必须用WAV格式,MP3会导致口型错位】
返回可灵AI → 点击“音频”面板 → “导入本地音频” → 选择WAV文件 → 自动进入“对口型校准”界面。
拖动音频波形,使第一句话的声波起始峰值对齐画面中人物张嘴的第一帧;系统会以该点为锚点,全自动拉伸/压缩后续语音节奏匹配画面运动。


















