可灵AI文生视频无法实现人物自动开口说话,因其不生成音频、不解析语音时序、无台词时间轴编排能力;所有“说话”效果均需导出后用剪映等工具手动配音并智能对口型实现。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

可灵AI文生视频本身不支持直接指定某个人物“先说话”,因为它的文生视频功能目前不生成音频、不解析语音时序、也不具备多角色台词时间轴编排能力;所有“说话”效果必须通过后期添加配音+对口型实现。
为什么文生视频里没人能开口说话
可灵当前所有文生视频输出均为无声画面,模型未接入TTS语音合成模块,也未开放台词时间戳输入接口。即使提示词中写“张三张嘴说话,李四随后点头”,系统只会渲染张嘴动作或模糊口型,无法控制谁在第几秒开口、谁接话、语速快慢——这些全部缺失。
这一步不能跳过:你看到的所谓“会说话”的可灵视频,100%是用户导出后用剪映、CapCut等工具手动配了音,再用“智能对口型”功能逐帧匹配出来的。
用首尾帧+对口型实现“张三先说、李四后说”
方法一:分镜拆解法(推荐)
① 先用即梦或通义万相生成两张独立图:第一张是“张三正面开口说话姿态”,第二张是“李四侧身倾听并微微张嘴”;
② 在可灵【首尾帧生视频】中,分别上传这两张图,提示词写:“张三说完后李四开始回应,自然过渡,无跳跃感”;
③ 生成10秒视频后导出,导入剪映 → 点击“文本成片”输入张三台词 → 生成配音 → 拖入轨道 → 选中视频片段 → 点击“智能对口型”→ 等待自动匹配;
④ 再插入李四台词配音轨道,起始时间设为张三说完后0.3秒,同样执行对口型;【必须确保两张首尾图中人物唇部朝向、光照角度一致,否则对口型错位明显】。
用动作控制+配音时间轴硬控说话顺序
如果你已有张三说话的参考视频(比如自己录的10秒讲话片段),可用动作控制模式绑定到张三形象上:
上传张三静态图 + 他本人说话视频 → 生成纯动作视频(无声);
导出后,在剪映中把该视频放在主轨道,再新建音频轨道,把张三台词按真实语速拖入,起点对齐视频开头;
接着把李四的静态图+另一段他说话的参考视频,同样走动作控制流程,生成第二个10秒动作视频;
将第二个视频剪辑成3秒片段,起始时间设为张三台词结束后的第1帧,覆盖在主轨道对应位置;
最后统一加字幕、调色、导出。


















