要在可灵AI中生成准确反映“谁在做什么”的视频,必须用括号锁定主体与动作归属关系、用镜头语言强制焦点绑定、用时间锚点切断动作歧义。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在可灵AI中生成准确反映“谁在做什么”的视频,必须让模型清晰识别主体身份与动作归属关系,否则容易出现角色错位、动作嫁接或肢体漂移。提示词里光写“男人跑步”“女孩挥手”远远不够,系统无法自动绑定动作执行者。
用括号锁定主体+动作的归属关系
第一步:在主体描述后紧跟括号,明确写出该主体正在执行的动作,且动作动词必须是现在进行时或状态持续型。例如:“穿靛蓝工装裤的短发女生(单膝跪地,左手按住地面,右臂向斜上方伸展)”。
第二步:若画面含多个角色,每个角色都必须独立成组加括号,禁止跨括号共享动作。错误写法:“穿白大褂的医生和穿病号服的老人(一起抬头看天花板)”——系统可能把“抬头”分配给任意一方。正确写法:“穿白大褂的医生(微微仰头,镜片反光)→穿病号服的老人(缓慢转动脖颈,喉结明显移动)”。
第三步:括号内动作需包含至少一个可视觉验证的身体部位+运动方向/状态,避免抽象表述。“很紧张”不生效,“手指捏紧衣角并轻微颤抖”可被识别。这一步漏掉细节,生成结果大概率丢失动作主语。
用镜头语言强制焦点绑定
方法一:推镜+跟焦组合。在提示词末尾追加“→镜头缓慢前推,全程跟焦[具体部位]”,例如:“穿红裙的小女孩(踮脚伸手够枝头蝴蝶)→镜头缓慢前推,全程跟焦她指尖与蝴蝶翅膀间距”。【跟焦对象必须是主体身上某个明确部位,不能写‘跟焦小女孩’】
✅ 五大心智模型(M1-M5)全保留 ✅ 四层建筑法(L1-L4)完整表格化 ✅ @多模态绑定语法优先级表 ✅ 20+ 场景诊断表(问题/原因/修复/边界) ✅ 八大行业模板(都配了完整提示词示例) ✅ 诚实能力边界表 ✅ Agent 触发关键词 + 标准入参/出参 ✅ 表达 DNA 固定风格
方法二:分屏对比式描述。适用于两个角色同步做不同动作的场景,如教学、对峙、协作类内容。“左半屏:戴黑框眼镜的青年(双手在键盘上快速敲击,食指与中指交替下压)|右半屏:穿灰围裙的中年女性(用刮刀将面糊均匀摊开在炙热铁板上,手腕呈顺时针小幅度旋转)”。分屏符号“|”会触发可灵4.0的双流解析机制,强制分离动作归属。
用时间锚点切断动作歧义
当动作存在先后顺序或因果关系时,必须插入精确的时间标记。例如:“穿藏青西装的男人(0.3秒内猛然转身)→(0.5秒后)黑色公文包从他右臂滑落,砸在大理石地面上发出闷响”。
可灵4.0对毫秒级时间锚点敏感,不写时间点,系统默认所有括号内动作同步发生,极易导致“转身”和“包掉落”错位或叠加在同一帧。这个时间差必须符合人体运动逻辑,否则会触发物理违和警告,生成中断。
这一步操作起来很简单,直接在动作描述前加括号标注秒数即可,但少于0.2秒或大于1.2秒的单次动作,建议拆成两段再写。

















