要让可灵AI输出稳定连贯的视频或脚本,必须用结构化提示词锁死首尾帧物理状态、五层嵌套分镜节奏、国风质感细节、口播身份与信息节奏,并遵循基础五要素模板。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要让可灵AI输出稳定、连贯、符合预期的视频或脚本,必须绕过模糊描述和自由发挥陷阱,用结构化语言把画面、节奏、声音全部钉死在提示词里。
先锁死首尾帧物理状态
第一步:在首帧提示词中写死全部静态特征,包括服装纹理走向、发型分线位置、配饰反光点数量、手持物朝向角度、杯中液体弧度与水珠颗数。例如:“穿哑光黑皮衣的卷发女性,左耳戴银色月牙耳钉(镜面反射高光点直径0.8mm),右手握半满玻璃杯(杯壁凝结三颗水珠,液面倾斜角7°)”。
第二步:尾帧提示词必须100%复用首帧所有静态描述,仅改动能动部分。把“液面倾斜角7°”改为“液面已恢复水平,杯底沉淀物均匀铺开”,把“右手握杯”改为“右手仍握杯,拇指指腹压在杯沿第三道磨砂纹上”。【首帧漏掉水珠或耳钉,尾帧就可能生成新耳洞或凭空多出水渍】
这一步操作起来很简单,直接复制粘贴首帧文本,再逐字替换动词和方位词即可。但很多人重写尾帧,AI立刻判定为两个不同主体,中间帧必然崩解。
用五层嵌套法绑定分镜+旁白+节奏
方法一:画面基底→旁白→节奏动作→下一镜→音效
① 先写人物+动作+环境(视觉基底),例如:“穿牛仔外套的女孩站在天台边缘,风吹起她额前碎发,背后是渐暗的橘红晚霞”;
② 紧接一个英文分号“;”,然后写旁白句,必须带引号且控制在28字以内,例如:“‘这城市从没等过谁,但我决定跳下去’”;
③ 再接一个分号,写节奏动作,必须含触发条件+执行结果,例如:“鼓点落下瞬间,镜头匀速推进1.2米,女孩右手指尖同步抬起”;
④ 所有分镜之间用“下一镜:”强制分隔,不能用“然后”“接着”“随后”等模糊连接词;
⑤ 每个分镜结尾加括号音效,如(风声骤停)、(心跳声放大),这是激活节奏同步的关键信号,漏掉会导致节拍漂移。
国风短片提示词避坑写法
开头必须用「国风电影质感」起头,不能写“中国风”或“古风”——前者触发模型调用《卧虎藏龙》《长安十二时辰》级影像库,后两者会混入抖音滤镜或PPT模板。
紧接着限定镜头语言:写「固定机位→缓慢横移→浅景深」,避免模型默认使用抖动运镜或夸张变焦破坏意境。
加入具体器物与材质关键词:「宣纸肌理背景」「青绿山水晕染边缘」「缂丝纹样窗格投射光斑」。这类词比「传统元素」有效十倍——可灵AI的训练数据中,缂丝、宣纸、青绿山水均有高精度视觉锚点。
【禁用“水墨风”单独出现】单独写“水墨风”会触发AI生成大面积泼墨飞白,掩盖人物与叙事;必须搭配控制词,如「水墨晕染仅限画面四角」「主体人物保持工笔线描精度」。
口播脚本提示词进阶写法
第一步:锁定声音身份与物理场景。例如:“一个刚做完皮肤测试的医美咨询师,坐在诊室里,手机横屏自拍,对着镜头轻声说给刚做完光子嫩肤的客人听”。这比“美妆博主”具体十倍,模型能调取“压低声音”“偶尔看手边仪器”“语速略慢带安抚感”的语音特征库。
第二步:强制插入口语锚点。在提示词中直接写进不可删减的口语信号词,例如:“每段话结尾必须带一个升调语气词(呀/哦/哈/诶),且整篇最多出现2次‘所以呢’,禁止使用‘综上所述’‘由此可见’”。
第三步:规定信息裸露节奏。不写“全面介绍成分”,而是写:“前10秒只说‘摸起来像水’,第15秒才第一次提‘酒精’,第40秒突然停顿1秒后说‘但它真的不辣眼睛’”。这种时间戳指令迫使模型放弃平铺,主动设计信息释放坡度。
基础五要素保底模板
① 主体+动作+场景(顺序不能乱):例如“穿哑光灰西装的男人(面部清晰,双手静止交叠于膝上)→咖啡馆靠窗卡座→午后斜射光在桌面拉出45度影线”;
② 补镜头语言,只选1个明确类型:“中景平视拍摄”比“电影感镜头”稳定,“固定机位,无运镜”比“自然流畅”可控;
③ 加画质与禁忌指令:“以24fps恒定输出,无插值→画面稳定,无肢体撕裂,无背景漂移→禁用副词,禁用‘非常’‘略微’‘隐约’等模糊修饰”。【漏掉‘24fps恒定输出’会导致AI自动补帧,动作必然粘滞或突兀加速】


















