首帧参考决定视频起始画面与视觉基调,主体参考锁定特定角色或物品的外观特征;前者约束第1帧并影响光影、视角等全局要素,后者通过框选区域实现像素级特征稳定。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在可灵AI图生视频中,首帧参考和主体参考解决的是完全不同的控制问题:首帧参考决定整段视频的起始画面与视觉基调,主体参考则专门锁定画面中某个具体角色或物品的外观特征,二者作用层级、生效范围和操作逻辑均不相同。
首帧参考:给视频定下第一帧的“锚点”
首帧参考就是你上传一张图片作为视频生成的起点画面,可灵AI会以这张图为基础,按提示词描述的方向生成后续帧序列。
这一步必须上传一张清晰、构图完整、主体居中的图片,且【首帧图的短边分辨率不得低于300px】,否则系统会拒绝识别或自动降质处理。
首帧图直接影响光影方向、镜头视角、画面比例和初始色调——比如你传一张仰拍角度的建筑照片,后续生成的镜头大概率保持仰视;传一张柔焦暖调人像,整段视频的肤色与氛围都会向该风格靠拢。
注意:首帧参考只对第1帧有强约束,后续帧的连贯性依赖模型自身的时间建模能力,若未配合尾帧或参考图,第3秒开始就可能出现人物变形或背景漂移。
主体参考:让AI记住“这个人到底长什么样”
主体参考不是上传一张独立图片,而是在已选的首帧图(或额外上传的参考图)上,用鼠标框选出你希望AI严格复现的具体区域——可以是整张脸、一只戴戒指的手、一件带logo的卫衣,甚至是一只猫的眼睛。
方法一:单图主体参考
在首帧图上传后,点击“启用主体参考”→用矩形框精准圈出目标部位→确认。此时AI将从该区域提取像素级特征向量,用于稳定后续所有帧中该主体的纹理、比例、光影关系。
方法二:多图局部参考(需可灵1.6及以上模型)
上传2–4张图,每张图分别框选不同主体:例如图1框脸部、图2框服装、图3框道具。系统会把它们作为独立视觉锚点融合进生成过程,比单图主体参考一致性提升102%。
这一步的关键在于框选必须干净——不能包含大量背景干扰物,否则AI会误把背景纹理当作主体特征学习。例如框选人脸时,如果连带框进半截窗帘,生成中人物耳垂可能突然泛出布纹反光。
组合使用路径:先定首帧,再锁主体
第一步:上传一张高质量首帧图,确保构图、打光、主体姿态符合预期;
第二步:在该图上启用主体参考,用框选工具精确圈出需强一致性的部位;
第三步:输入提示词,重点描述动作、环境变化或镜头运动,而非重复定义长相或服装;
第四步:提交生成,等待输出。
若跳过第二步,仅靠首帧图+长提示词,AI仍可能在第4帧把主角的发色从棕变黑、袖口褶皱从左斜变右斜;只有加上主体参考,这些像素级细节才会被真正“钉死”。

















