即梦AI可将正脸照片一键生成带口型与动作的数字人口播视频,全程无需露脸录音剪辑,3分钟内导出。上传合规正面照后自动建模,输入80字内文案并设置音色语速情绪,添加1~2个动作提示词,选择快速或大师模式生成即可。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用即梦AI把一张正脸照片变成能开口说话、带动作的口播视频,全程不需要露脸、不录声音、不剪辑,3分钟内可导出首条成品。
上传人像并启用数字人模式
打开即梦AI网页版(https://jimeng.jianying.com/ai-tool/home)或App,点击左侧【生成】→选择【数字人】模式。
在左侧角色窗口中,拖拽一张【人脸居中、无遮挡、光线均匀的正面清晰照】,建议使用肩部以上半身照,避免戴帽、墨镜或侧脸;系统会在2秒内自动完成人脸检测与建模。
若上传后提示“未识别到有效人脸”,说明图片质量不达标,需重选——模糊、过暗、角度偏斜都会导致失败。
输入文案并设置语音参数
方法一:直接输入口播文案
在右侧文本框中粘贴或手写台词,字数控制在80字以内效果更稳;超过150字可能触发截断或口型错位。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
方法二:用DeepSeek辅助生成文案
打开 https://chat.deepseek.com/ ,输入提示词:“写一条30秒短视频口播文案,主题是‘夏季防晒霜推荐’,语气亲切专业,带3个卖点,结尾有行动号召”,复制返回结果粘贴进即梦。
选择音色(如“温柔知性女声”)、调节语速(建议0.9~1.1倍速)、设定情绪(如“轻快”“真诚”);【若上传本地录音,请确保为单声道、44.1kHz、WAV格式,时长必须严格匹配文案朗读时长】。
添加动作提示词并生成视频
第一步:在“动作描述”栏输入1~2个自然动作短语,例如“微笑点头”“右手抬起比赞”“微微前倾身体”。
第二步:避免堆砌动词,如“挥手+眨眼+转头+微笑”会导致动作混乱;系统只解析前两个有效动作指令。
第三步:选择生成模式——
【快速模式】消耗12点,生成耗时约40秒,适合日常口播;
【大师模式】消耗20点,口型咬合更精准、微表情更丰富,适合封面视频或平台首发。
点击【生成】按钮,等待进度条走完,自动跳转至预览页;导出MP4前可拖动时间轴检查嘴型同步是否卡顿。
















