必须先结构化分镜规划:按15–20秒切分镜头,每镜含明确起止状态;提取主体、单向动作、环境三项硬信息组成提示词;上传角色/道具/场景参考图并关闭自动裁剪;在Vidu Q1参考生视频模式下逐镜配置后批量生成。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要把一段完整故事脚本变成多个连贯镜头组成的视频,必须先做结构化分镜规划,不能直接把整段文字丢进Vidu——模型会丢失动作节奏、人物站位和空间逻辑,生成结果常出现角色突然换装、场景跳变或动作中断。
按15–20秒切分镜头段落
通读你的原始脚本,找到人物动作完成节点或环境切换点作为分镜边界。例如“她冲进雨幕→拽开生锈铁门→在地下室手电光里看见三具棺材”要拆成3个镜头,而不是1句长描述;每个镜头对应15–20秒视频时长,这是Vidu Q1对单次生成稳定性的黄金承载量。
若某段情节信息密度过高(如连续5个微表情变化),需强制拆解:哪怕只写“她瞳孔收缩→喉结滚动→左手按住右腕颤抖”,也要拆成3个独立提示词——Vidu无法在一镜内精准还原多阶生理反应。
检查每段是否含明确起止状态:开头人物在哪儿、朝向哪、手里有没有东西;结尾是否达成新位置/新姿态/新道具接触。没有起止锚点的段落,生成后必然漂移。
提取三项硬信息并压缩成提示词
为每个镜头单独提取:主体(如“穿战术背心的左撇子女特工”)、动作(必须是单向动词,如“踹开”“撕下”“按下”,禁用“试图”“准备”)、环境(含光源方向与空间关系,如“顶灯频闪,水泥墙裂缝斜贯画面左上至右下”)。
将三项拼成一句固定格式提示词:【主体 + 动作 + 环境 + 风格关键词】。例如:“左撇子女特工单膝砸碎监控屏,飞溅玻璃渣映出身后走廊红光警报,赛博朋克霓虹冷调,动态模糊强化冲击感”。
这一步操作起来很简单,但错一个字就翻车:删掉所有“似乎”“大概”“隐约”,这些词会让Vidu Q1置信度下降,生成画面出现双影、肢体错位或光影断裂。
Vidu视频生成插件(viduq3-pro、viduq3-turbo、viduq2、viduq1)。支持文字转视频、图片转视频、参考转视频以及起始编辑。
上传参考图并绑定到对应镜头
方法一:角色图上传。每位主要角色传1张高清正面半身照,背景纯白或深度虚化,确保耳钉、疤痕、袖口磨损等细节清晰可见;若角色戴墨镜,必须另传1张镜片反光角度自然的特写图——否则生成时镜面会随机反射错误光源。
方法二:道具图上传。关键道具(如古董怀表、带血匕首)传3张图:平铺正视图(显刻度/铭文)、手持45°图(显握持弧度与指压痕)、侧光打亮图(显金属划痕或皮革老化纹)。少于3张,道具在多镜头中容易变形或消失。
方法三:场景图上传。典型场景(如地铁隧道、实验室控制台)传1张带透视实拍图,重点保留地砖接缝走向、设备面板螺丝排列、吊灯垂落角度——这些线条会被Vidu Q1自动提取为空间坐标基准。【上传时务必关闭“自动裁剪”开关,否则边缘构图信息丢失,多镜头间人物站位会漂移】。
在Vidu Q1中启用参考生视频并批量生成
第一步:登录 vidu.cn → 进入「创作视频」→ 选择模型为Vidu Q1 → 切换至「参考生视频」模式。
第二步:在提示词框中粘贴第一个镜头的结构化提示词;点击“上传参考图”,依次导入该镜头对应的角色图、道具图、场景图;系统将自动识别并绑定各元素语义标签。
第三步:设置输出参数:时长选15秒,分辨率选1080P,画幅比例设为16:9(保障运镜空间余量);确认“生成模式”为高表现。
第四步:重复第二、三步,逐个输入其余镜头提示词并绑定对应参考图;全部配置完成后,点击「Vidu Agent批量生成」按钮,系统将自动串联镜头、插入转场、匹配配乐并输出成片。

















