要用可灵AI生成第一人称视角视频,关键在于提示词以“我”开头绑定感官动作、加入固定近景参照物、禁用第三人称词汇,并启用MVL标记与竖屏9:16、8秒内、高清+物理引擎增强参数组合。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要用可灵AI生成第一人称视角视频,关键不是靠后期剪辑或镜头旋转,而是从提示词结构、视角锚点和MVL多模态指令三处同步锁定“我”的存在感——否则模型默认输出第三人称观察镜头,生成结果会是“你看着手在动”,而不是“你感觉手在动”。
构建可信的第一人称提示词骨架
第一步:在文本框中输入主干提示词,必须以“我”开头并绑定身体动作或感官反馈。例如:“【我正低头看着自己的双手正在揉捏一团蓝色陶土,指尖沾着湿润泥痕】”。
第二步:补充空间参照物,避免画面漂移。加入固定近景元素,如“面前木工作台边缘入画”“左上角露出半截安全护目镜反光”,这些细节会强制模型维持视点稳定。
第三步:禁用易触发第三人称的词汇。不要写“一个男人在做饭”,也不要写“镜头对准我的手”——后者会让模型误判为导演指令,反而跳出第一人称。所有描述必须是“我感知到的”,不是“别人看到的”。
启用MVL多模态视觉语言模式
方法一:点击输入框右下角「+」号→选择「上传参考图」→上传一张第一人称手持设备拍摄的实景照片(如你握着咖啡杯的手部特写),系统将自动提取MMW多模态描述子,强化手部比例与视角深度。
方法二:在提示词末尾追加MVL专用标记符。例如,在主句后换行写:[视角:主观手持][抖动:轻微][FOV:75°]。这组标记不参与语义理解,但会直接注入O1模型的Chain-of-Thought推理链,强制激活第一人称物理模拟模块。
【注意:MVL标记符必须独占一行,且不能加引号或括号以外的任何符号,否则整条指令会被忽略】
参数设置中的关键卡点
1. 视频比例选9:16而非16:9——竖屏天然压缩横向视野,更贴近人眼单眼有效视场,能抑制模型生成“全景扫视”类错误镜头。
2. 时长控制在8秒以内。可灵AI对长时序第一人称连贯性支持有限,超过10秒易出现手部突然消失或视角跳变;实测8秒内动作完成率超92%。
3. 质量档位必须选「高清+物理引擎增强」。普通高清档会关闭O1模型的多视角主体构建功能,导致手指关节弯曲角度失真,失去“自己在动”的真实感。


















