Vidu生成视频角色失真根本原因是参考图信息未被充分捕获或提示词缺乏视觉锚点,须从图像质量、结构规范、文本约束三路协同解决。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用Vidu生成视频时人物总不像你设定的角色,不是五官偏移就是体态走样,根本原因是参考图信息未被模型充分捕获,或提示词缺乏可执行的视觉锚点;必须从图像质量、结构规范、文本约束三路同时切入,缺一不可。
参考图必须满足三项硬性条件
上传前不检查分辨率、构图和光照,等于白传。Vidu对低质参考图的容忍度极低,会直接放弃面部几何建模,转而依赖文本泛化——结果就是“像又不像”。
第一步:裁掉所有背景与无关肢体,只留主体上半身或标准正面头肩像,确保人脸占据画面面积≥65%。
第二步:用手机原相机在均匀自然光下拍摄,禁用美颜、滤镜、闪光灯;若用已有照片,需确认无动态模糊、无强阴影遮挡眉骨与鼻翼。
【分辨率不得低于768×768像素,低于此值将触发自动降级为通用特征提取模式】
第三步:同一角色至少上传3张——1张正脸(双眼睁开、嘴唇微启)、1张左45°侧脸(清晰露出左耳与颧骨)、1张右45°侧脸(同理)。三张图光照方向需一致,否则模型会误判为不同人。
提示词要带解剖级动词和空间坐标
“一个穿红衣服的女孩”这种描述,Vidu会随机匹配数据库里17个相似面孔,根本不会锁定你的目标。必须让每个词都对应到真实肌肉运动或骨骼位置。
方法一:绑定部位+动作+幅度,例如“左眼睑缓慢下垂→持续0.8秒→形成自然眨眼弧线”,而不是“眨眼睛”。后者会让模型自由选择眨眼速度、角度甚至单眼闭合。
方法二:插入不可替换的识别标记,比如“耳垂下方有浅褐色小痣”“右眉尾比左眉尾高3毫米”“门牙轻微外凸,笑时露齿间隙≤1.2mm”。这些细节能迫使模型优先重建该特征,而非泛化。
方法三:用英文动词锚定关节运动,中文易被分词切碎。写“raising right hand → palm up → elbow bent at 110 degrees”比“右手抬起掌心向上手肘弯曲”稳定3倍以上。
注意:禁止混用冲突修饰,如“纤细手指+粗壮前臂”,模型无法协调二者解剖逻辑,会随机丢弃某一项,导致手部断裂或比例崩坏。
启用主体库并强制调用@符号
这是2024年9月上线的“主体参照”功能,也是目前唯一能跨场景锁定角色外观的机制。不启用等于放弃一致性控制权。
进入Vidu官网→点击「主体库」→上传已通过前述质检的参考图→填写唯一名称(如“银发剑士_01”)→保存。
在新视频提示词开头直接输入@银发剑士_01,不要加空格、不要换行、不要放在句中。模型只识别开头@后紧邻的字符作为主体ID。
若需多人物共存,用空格分隔多个@,例如@银发剑士_01 @黑袍法师_02,但每张参考图必须单独入库且命名无重叠。
【未使用@调用的生成任务,系统默认忽略主体库数据,完全按文本重建角色】


















