豆包能根据平台、时长、人群、核心信息四大要素生成可落地的短视频脚本初稿,支持追加指令优化抖音留存、小红书颗粒度或B站分镜,再通过结构化追问补全镜头、动作、音效等生产级细节。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想快速产出符合平台调性、有钩子有节奏的短视频脚本,但又没时间反复试错、写完还得人工改三遍?豆包能直接按你的目标平台、时长、人设和核心信息点,生成结构完整、台词口语化、分镜可落地的初稿,全程不用写一句原始文案。
明确需求并输入精准指令
豆包不会猜你要什么,模糊指令如“写个美食脚本”大概率产出泛泛而谈的模板。必须把视频的骨架提前钉死。
打开豆包App或网页端→进入新建对话→输入包含四大要素的指令:①平台(小红书/抖音/B站);②时长(30秒/60秒/90秒);③目标人群(25–35岁职场妈妈/00后大学生/新手家长);④核心信息(“空气炸锅烤鸡翅不出水的3个关键温度点”)。
示例指令:“请为抖音平台生成一条45秒以内的美食科普脚本,面向25–35岁职场女性,主题是‘空气炸锅烤鸡翅不出水的3个关键温度点’,要求开头3秒抛出反常识结论,每句口播不超过7个字,加入‘姐妹们’‘真的别再瞎调了’等强互动词,结尾引导点击收藏。”
立即进入“豆包AI人工智官网入口”;
立即学习“豆包AI人工智能在线问答入口”;
【平台和时长不写清楚,豆包默认按通用逻辑输出,剪辑时会发现节奏拖沓、前3秒无冲突】
追加指令实时适配风格
初稿生成后,别急着复制粘贴。不同平台对信息密度、语气、镜头提示的要求差异极大,靠一次输入很难一步到位。
Doubao-Seedream-5.0-lite是字节跳动发布的最新图像创作模型。该模型首次搭载联网检索功能,能融合实时网络信息,提升生图时效性。同时,模型的聪明度进一步升级,能够精准解析复杂指令和视觉内容。此外,模型在世界知识广度、参考一致性及专业场景生成质量上均有增强,可更好地满足企业级视觉创作需求。
方法一:针对抖音强化“前3秒留存”
在初稿下方直接输入:“开头3秒必须用疑问句制造冲突,比如‘你还在用200℃烤鸡翅?’,删掉所有‘首先’‘其次’这类书面过渡词,全部改成第一人称口播,加入‘家人们’‘信我’‘手慢无’等高频词。”
方法二:针对小红书优化信息颗粒度
追加指令:“把每条知识点拆成带emoji的小标题+一句话结论+1个生活化类比,例如‘?200℃=鸡翅表面焦黑内里生’→‘像煎牛排只看表面,里面还是冰的’,去掉所有专业参数单位,换成‘手指摸锅壁温热’这类体感描述。”
方法三:针对B站补充分镜动作提示
输入:“请为每一句台词补充对应画面:镜头类型(特写/中景/俯拍)、主体动作(手部翻动鸡翅/温度计插入肉厚处)、是否需要动态字幕(如‘⚠️160℃起跳’弹出)、背景音效建议(滋滋声/叮一声)。”
结构化追问补全分镜要素
AI生成的文本只是台词草稿,真正能拍的脚本必须包含画面、节奏、音效等生产级信息。这步不做,剪辑时你会反复回聊记录、自己补写分镜表。
第一步:选中脚本中任意一句关键台词,例如“160℃是鸡翅锁汁黄金线”。
第二步:单独发送追问指令:“请为这句话设计分镜:①镜头从哪里开始推进(如‘从油滴特写拉远到整盘鸡翅’);②人物手部是否入镜(是,左手持夹子翻面,右手调温控旋钮);③背景需出现什么道具(空气炸锅面板显示160℃,旁边放计时器倒数10秒);④是否添加动态文字特效(‘160℃’随翻面动作同步弹入,带轻微抖动)。”
第三步:将豆包返回的分镜描述直接复制进脚本对应位置,替换原台词旁的括号备注。
这一步操作起来很简单,直接把追问指令发过去就行,但漏掉会导致拍摄当天才发现“不知道镜头怎么切”“缺道具没准备”。


















