应根据素材类型选择对应模式:仅1张图选图生视频;多图多视频混搭用多模态混合输入或建主体特征库;已有音频+脚本+草图则用音画同出模式。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用可灵AI把手里已有的图片、视频或音频快速变成短视频,但不确定该选文生视频、图生视频还是多模态混搭——不同素材类型直接决定生成质量与可控性。
只有1张高清人物照,想让ta动起来说话
选【图生视频】→点击上传图片→在提示词框输入“微笑挥手,说‘你好呀’,自然口型,柔和室内光”→选择“Kling 4.0 Flash”模型→生成。
这一步不能选文生视频,因为单靠文字描述无法还原你照片里人物的五官结构、发型和衣着细节;图生视频会以该图作为主体锚点,确保人脸一致性。若误选文生视频,生成结果大概率是全新面孔,和原图无关。
手头有3段不同角度的宠物奔跑视频+1张宠物正面照
方法一:多图多视频混合输入
拖入全部素材(最多10图+5视频)→在统一输入框内粘贴提示词“金毛犬在草坪上连续奔跑,镜头从低角度跟拍→侧身跃起→回眸凝视,阳光通透”→启用“关键帧控制”,在时间轴第0秒、1.5秒、3秒分别插入三张参考图对应动作节点→生成。
方法二:先建主体特征库再生成
先用“视频主体特征库”功能,上传其中一段3秒以上的清晰视频→等待系统提取毛色、体型、步态特征→返回创作页,选择“Kling 4.0 Omni”模型→勾选“启用主体特征库”→输入提示词“同一只金毛,在森林小径奔跑,慢动作,落叶飞散”→生成。
【必须保证至少1段视频时长≥3秒且画面稳定,否则特征提取失败】
已有配音音频+分镜脚本文字+2张场景草图
第一步:进入“音画同出”模式
上传音频文件(MP3/WAV,≤60秒)→粘贴分镜脚本,例如:“0:00-0:03 镜头从天空俯冲至稻田;0:04-0:07 农妇弯腰割稻,汗珠滴落;0:08-0:10 远处山峦泛金光”。
第二步:插入视觉锚点
在对应时间码位置上传2张草图:第一张标“俯视稻田”,第二张标“农妇侧影+稻穗特写”→系统自动将草图匹配到脚本时间节点。
第三步:选择模型与输出
选“Kling 4.0”而非Flash版→勾选“10-bit HDR”与“21:9超宽画幅”→生成。
这一步如果漏掉草图,仅靠音频+文字,AI可能把“汗珠滴落”渲染成雨水效果;草图是强制视觉语义对齐的关键约束。


















