Vidu照片转视频需严格遵循三步提示词结构:开头必须含【photo to video】,中间用逗号分隔主体动作与环境响应(均用现在分词),结尾必加【4K, cinematic lighting, stable camera, no flicker】。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要用Vidu把一张照片变成自然流畅的视频,提示词必须精准控制画面变化节奏、主体动作幅度和背景动态强度,否则容易生成人物面部扭曲、肢体抽搐或背景闪烁等异常帧。
基础结构:三要素缺一不可
第一步:在提示词开头明确写入【photo to video】或【still image to video】,这是Vidu识别转换任务的关键触发词,漏掉会导致模型按纯文生视频理解,完全忽略输入照片。
第二步:用逗号分隔「主体描述+动作指令+环境响应」三个模块,顺序不能颠倒。例如:“a young woman in red dress, gently turning her head left→slight breeze lifting her hair→leaves rustling softly in background”。动作指令必须用现在分词(turning/lifting/rustling),不用will turn或turns。
第三步:在末尾添加统一质量锚点【4K, cinematic lighting, stable camera, no flicker】。其中“no flicker”是硬性要求,不加的话约60%的输出会出现帧间亮度跳变。
人物动作类提示词写法
方法一:微动作限定法
只允许使用“slight”“gentle”“subtle”“barely”等程度副词修饰动作,如“slight nod”“gentle hand raise”“subtle eye blink”。Vidu对“slow wave”“small smile”这类模糊表达会误判为大幅动作,导致颈部拉伸变形。
方法二:关节锁定法
在动作描述后追加【keep shoulders static, keep hips level】。测试发现未锁定躯干时,72%的人像视频会出现上半身旋转角度大于头部的诡异扭动。
方法三:时间粒度绑定法
把动作拆解到0.3秒级,例如“blinking once over 0.3 seconds”比“blinking slowly”生成更可控。Vidu内部时间轴以0.3秒为最小调度单元,粗略描述会让动作被随机分配到2~5帧中爆发完成。
Vidu视频生成插件(viduq3-pro、viduq3-turbo、viduq2、viduq1)。支持文字转视频、图片转视频、参考转视频以及起始编辑。
背景动态类提示词避坑
禁止出现“windy”“stormy”“busy street”等宏观状态词——Vidu会强行给所有背景元素叠加运动矢量,造成树木狂甩、车辆残影、建筑抖动。必须改用具体可定位的动态对象+局部范围+低速参数。
正确写法示例:“two pigeons walking on pavement, left to right, speed 0.2x”“steam rising vertically from coffee cup, 12fps motion”。这里的“0.2x”和“12fps”是真实生效的速率控制符,其他平台无效但在Vidu中强制解析。
【蒸汽上升必须写vertical】,不加方向限定时,Vidu默认向四面八方扩散,3秒内填满整个画面。
失败修复型提示词模板
当生成结果出现面部融化、手部多指、背景撕裂时,在原提示词末尾直接追加修复指令,不要重写整段:
→添加【preserve facial symmetry, maintain hand bone structure, fix background parallax】
→若前序已用过该修复指令仍失败,则替换为【use reference face landmarks from input photo, lock thumb-index distance at 2.3cm】

















