需调用可灵AI“对口型”功能并辅以自然度增强操作,支持音频驱动、文本驱动及参考视频校准三类路径,分别适配专业配音、标准口播与IP数字人高保真还原场景。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您已使用可灵AI生成了人物视频,但希望让角色精准匹配新上传的配音或文本语音,并实现唇部动作与语音节奏高度协调,则需调用其内置的“对口型”功能并辅以自然度增强操作。该功能支持音频驱动、文本驱动及参考视频校准三类路径,每种路径均对应不同输入条件与优化目标。以下是具体操作步骤:
一、基础音频驱动对口型
该方式以真实语音波形为基准,强制数字人口型、语速、停顿完全贴合原始音频,适用于专业配音、复刻讲话风格等场景,无需手动标注时间轴即可完成音素切分与唇形参数绑定。
1、确保音频为单声道WAV格式、采样率16kHz、位深度16bit,无背景噪声、削波失真与爆音。
2、在可灵AI项目页点击“对口型”功能入口(位于预览窗口下方或右键菜单中)。
3、点击“上传音频”,选取已准备好的中文语音文件,系统自动解析音素时序并显示波形能量分布。
4、上传完成后,确认首音节起始点与波形首个能量峰对齐;若提示“音频质量不足”,请返回检查静音段长度与峰值电平是否在-1dB以内。
5、点击“开始同步”,等待处理完成,生成带唇部动作的新视频轨道。
二、文本驱动+情感化唇动增强
该方式由可灵AI内置TTS引擎将中文文案转为语音,并同步生成匹配的唇部动画,适用于标准口播、课程讲解等场景;通过启用情感语调与动态微调,可显著提升自然度,避免机械式张嘴闭嘴。
1、进入可灵AI「创建作品」页面,点击右上角齿轮图标启用「高级模式」。
2、在左侧工具栏点击「人物驱动」按钮,切换至驱动配置面板,选择「输入文本」页签。
3、在文本框中粘贴简体中文口播文案,确保每句≤6秒、主谓宾结构清晰,避免“综上所述”“鉴于”等书面连接词。
4、在「音色选择」中指定标注为「中文(普通话)」且含「Viseme-Optimized」后缀的音色,例如Xiaoqiu (Multilingual)或Lingyun (Emotion-Enhanced)。
5、勾选「启用动态唇部微调」与「强制对齐音素边界」,点击「生成配音」,系统同步输出语音波形与口型动画帧序列。
三、参考嘴型视频校准物理一致性
针对需高度还原真实讲话风格的IP数字人,可利用其本人高清正面讲话视频提取运动包络,覆盖模型默认预测偏差,提升唇部微表情可信度与物理一致性,使说话动作更接近真人肌肉运动规律。
1、截取目标人物3秒连续说话片段(需包含/a/、/e/、/i/、/o/、/u/五种元音),保存为MP4(H.264编码,1080p)。
2、在可灵AI“校准工具”中上传该视频,点击“提取嘴部运动包络”,系统自动生成12维唇部关键点时序曲线。
3、将提取出的曲线文件(.csv)拖入当前项目“驱动覆盖区”,选择“覆盖下颌垂直位移”与“嘴角水平拉伸”两项。
4、重新运行合成,此时AI仅保留原音频的音素序列,其余唇部运动完全按参考视频包络执行。
四、唇动幅度与延迟精细补偿
模型内部渲染链路存在固有延迟,导致唇动起始滞后于语音onset;同时默认唇部张合幅度适配朗读语境,难以匹配歌唱或快语速场景。人工干预可消除此类系统性偏差。
1、进入「高级校准」面板,将“唇动幅度”滑块拖动至0.65–0.78区间,数值低于0.6易显呆滞,高于0.78则可能引发纹理撕裂。
2、调节“口型响应延迟”为-80ms,该值经实测覆盖绝大多数普通话音频的系统延迟偏差。
3、勾选“强制元音帧锁定”,确保/a/、/i/、/u/三类核心元音生成明确轮廓,防止过渡模糊。
4、针对儿化音或轻声词,手动在音素映射表中将/r/音的唇部张力系数上调至1.35。
五、多角色对话的独立唇动绑定
当视频中存在多个数字人时,需确保各角色口型仅响应自身语音,避免串扰或同步漂移。该方法通过音频分轨注入与视觉锚点标注,实现声画空间一致性。
1、使用Audacity将多人对话音频分离为独立WAV文件,命名为“角色A_台词.wav”“角色B_台词.wav”等,每轨仅含单人语音,静音段保留原有时长对齐。
2、在可灵AI「图生视频」模块中,依次上传各角色正面高清图,每张图单独创建一个子项目,并在项目设置中标注对应角色名称(如“教师”“学生”)。
3、进入各子项目预览页,点击「对口型」按钮,分别上传对应角色的专属音频文件。
4、生成各角色独立口型视频后,在「多轨合成」面板中导入全部视频,拖拽对齐时间轴,启用“角色音频锁定”开关,防止导出时音轨错位。
5、点击「最终合成」,系统自动识别各视频中角色身份标签,将对应音频嵌入指定声道并完成帧级唇动校准。


















