可灵AI生成60秒视频需首选数字人模式:上传正面角色图+280–320字文案(或严格60秒音频),选高品质模式,一键输出完整MP4;文字/图生视频须手动设60秒时长并匹配参数,否则默认5秒。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你正在用可灵AI制作产品讲解、课程口播或电商推广视频,但发现默认输出只有5秒,无法完整表达信息,需要稳定生成1分钟(60秒)的连贯视频,且不依赖剪辑拼接或多次续写。
明确核心路径:先选模式,再定分工
可灵AI目前仅【数字人模式】支持单次直出60秒MP4,其余模式必须分段生成再合成。这意味着第一步不是写文案或挑图,而是判断内容是否适合真人/数字人出镜——若需角色口播、品牌人设强化、多语种配音,直接走数字人;若为纯场景演绎、抽象概念可视化、产品动态演示,则必须拆解为画面+配音+剪辑三段任务。
数字人模式承担全部工作:角色形象、口型同步、语音节奏、情绪微动作、60秒时长控制;文字/图生视频模式只管画面,配音和剪辑必须外挂剪映或HeyGen。
数字人模式:一步到位,但前提卡死
打开可灵AI官网或App→点击【数字人】入口→上传一张清晰正面的角色图(支持真人、动漫、动物等类型)→在文字输入框中粘贴60秒内能说完的文案(建议控制在280–320字,语速适中)。
选择“高品质”模式(1080p/48FPS),系统自动匹配TTS音色与情绪动作;若使用音频输入,则直接上传MP3/WAV文件,时长需【严格等于60秒】,超时会被截断,不足则静音补足。
点击“生成视频”,约2–4分钟完成,输出即为完整60秒MP4文件,口型、眼神、微动作全程同步。
文字生成视频:三步拆解,参数不可逆
该方式适用于无真人出镜的场景化视频,比如品牌故事、产品功能演示,但必须主动干预参数,否则默认仍为5秒。
第一步:进入“文字生成视频”模式→输入完整描述性文案(如:“晨光中的智能咖啡机自动研磨、萃取、倾倒,最后杯沿浮起一层细腻奶泡”)→在右侧参数栏找到“视频时长”下拉菜单,选择“60秒”档位。
第二步:系统会自动将画质模式从“超清锐化”切换为“高表现”,【此切换不可逆,且若手动改回“超清锐化”,生成将失败并退回5秒】。
第三步:确认“运动校准”已开启,再点击生成。60秒视频将在7–9分钟内产出,首尾画面连贯,中间无跳帧。
图生视频:双轨并行,首尾帧锚定
当你已有关键画面,又希望保留镜头语言和运镜逻辑时,可用此法结构化生成接近60秒的内容,实际输出为两段各30秒视频,需手动合并。
方法一:双首尾帧分段控制
① 第一段:上传起始图A与过渡图B→设时长为30秒→提示词强调“缓慢平移推进”;
② 第二段:上传过渡图B与结束图C→同样设30秒→提示词强调“镜头缓缓拉远,露出全景”。
方法二:时间戳锚点分段
上传同一张图→在提示词中插入时间锚点,例如:“0–15秒:特写手部操作按钮;15–30秒:中景展示整机运行;30–45秒:镜头环绕机器一周;45–60秒:聚焦屏幕数据变化”。可灵AI会按锚点切分生成四段15秒视频,再导入剪映拼接。
注意:图生视频不自带语音,所有配音、字幕、BGM必须在剪映中单独添加,且首尾帧一致性高度依赖图源质量——模糊、低对比度或多人物混杂的图,30秒后极易崩解。


















