可灵AI支持3分钟内生成带口型、字幕和BGM的口播视频,无需出镜剪辑配音;上传人像、输入50–200字口语化文案,选音色或音频驱动,配提示词与1080p参数,一键生成竖屏MP4。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用可灵AI快速生成一条口播视频,不需要出镜、不需剪辑、不需配音,输入文案就能自动合成带口型、配字幕、加背景音乐的完整短视频。整个流程控制在3分钟内,适合知识分享、产品推荐、节日祝福等高频使用场景。
准备口播素材与基础设置
打开可灵AI官网或电脑客户端,登录账号后点击首页“数字人2.0”入口,或从左侧边栏进入“生成→数字人”。【必须使用最新版客户端或Chrome/Firefox浏览器,Safari暂不支持音频驱动】
上传一张清晰正面人像图,支持真人照片、AI生图、形象库人物;若用动物或二次元角色,确保面部轮廓完整、无遮挡、光照均匀。
在文案框中输入50–200字的口语化内容,例如:“这双鞋上脚轻得像踩云朵,3D编织鞋面透气不闷脚,新手跑步党闭眼入!”——避免长句、括号、英文混排、专业术语堆砌。
配置语音与口型驱动
方法一:文本驱动(推荐新手)
点击“输入文本”页签 → 选择音色(建议先试听“林薇-亲切女声”或“陈哲-沉稳男声”)→ 开启“情感语调”开关 → 将语速调至1.1x(比原速快10%,更符合短视频节奏)。
方法二:音频驱动(适合复刻本人声音)
切换至“上传音频”页签 → 选取一段15–45秒的纯净录音(手机录音即可,但需关闭降噪、不加滤镜、无环境杂音)→ 上传后点击“试听驱动效果”,若口型延迟明显或嘴部静止,说明音频起始有0.5秒以上静音,需用Audacity裁掉开头空白段再重传。
调整数字人表现与输出参数
第一步:点击“角色表现”输入框,手动输入一句提示词,例如:“微笑点头,右手自然抬起示意,语速适中带亲和力”——不填则默认中性表达,容易显得呆板。
第二步:分辨率选1080p(免费用户可用),生成数量固定为1(多生成不提升质量,只消耗灵感值)。
第三步:勾选“自动匹配背景音乐”和“智能美化”,这两项开启后系统会根据文案情绪自动选BGM并优化肤色与光线,关闭则画面偏灰、音画割裂。
生成与导出视频
点击右下角“生成”按钮,等待40–90秒(取决于文案长度与服务器负载)。
预览时重点检查三点:口型是否随关键词同步开合、字幕是否逐句浮现且无错别字、背景音乐音量是否压过人声——如有任一问题,返回修改文案或重选音色,不要强行导出。
确认无误后点击“下载MP4”,文件自动保存至默认下载路径,格式为H.265编码、1080×1920竖屏尺寸,无需再导入剪映做二次压缩。


















