优先选参考生视频当有多张角色/场景/道具图需自然互动,选图生视频当仅有一张构图完整图需动态延展;前者是多图语义融合生成,后者是单图动作推演。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要快速判断该用Vidu参考生视频还是图生视频,得先看手头有没有现成的多张角色、道具、场景图——如果有且想让它们自然互动,参考生是唯一能一步生成的方案;如果只有一张构图完整的图,想让它动起来,图生视频才是正解。
核心逻辑差异
参考生视频的本质是“元素融合”:你上传的每一张图都被模型识别为独立语义单元(比如@图1是穿红裙的女主,@图2是咖啡馆内景,@图3是旋转木马),AI理解这些元素之间的空间关系与行为逻辑,再合成一段有叙事连贯性的视频。图生视频则是“单图延展”:它把输入图当作静态锚点,只在此基础上推演动作方向、幅度和镜头运动,无法引入第二张图里的新主体或新场景。
这一步区别直接决定后续流程——参考生跳过分镜,图生视频必须靠分镜图堆精度。
操作路径对比
方法一:参考生视频(零分镜)
① 打开Vidu Q3 Web端 → 点击「参考生」入口 → 上传最多7张图(人物/道具/场景/风格各1张起)→ 在提示词框输入带@图编号的指令(如“@图1在@图2中走向@图3,微笑挥手”)→ 点击生成。
【上传时务必给每张图手动命名,否则系统无法识别@图1/@图2等引用关系】
方法二:图生视频(需分镜支撑)
上传单张图 → 输入动作描述(如“女孩转身,裙摆扬起,风吹发丝”)→ 调整运动幅度(轻微/明显/剧烈)→ 选择镜头运动(推/拉/环绕)→ 若需多镜头,必须提前生成并上传对应分镜图,再逐帧绑定。
一致性控制能力
参考生视频在Q3版本中实现主体一致性满分:同一人物在不同场景中出现时,五官结构、发型纹理、服饰褶皱还原率稳定在92%以上,即使跨7张图输入也无漂移。图生视频的一致性完全依赖输入图质量——若原图侧脸比例失真,生成视频中人物转正脸时会出现五官错位,且无法通过提示词修正。
Vidu视频生成插件(viduq3-pro、viduq3-turbo、viduq2、viduq1)。支持文字转视频、图片转视频、参考转视频以及起始编辑。
这一步不可逆:图生视频出错只能重传原图,参考生视频出错可单独替换某张问题参考图再重跑。
适用场景硬区分
做品牌IP短视频:用参考生。上传吉祥物正脸图+标准动作图+门店实景图,一句提示词就能生成“吉祥物从门店门口跑出,挥手打招呼”的3秒视频,动作衔接自然,背景透视匹配。
做产品功能演示:用图生视频。截取App界面截图,提示“按钮被点击,弹窗滑入”,模型会精准保持UI元素位置不动,仅让指定区域产生动效,不会混入其他参考图元素。
拍双人对话口播:必须用参考生。两张主持人正面照+录音棚环境图,配合“@图1说话时@图2点头微笑”提示词,口型、微表情、视线焦点全部同步,图生视频做不到双主体联动。

















