百度一镜数字人可实现双人同框对话:上传两张合规正脸照生成A、B数字人,脚本用【A】【B】标注台词,选择左右分屏或自定义布局,配置不同语音模型后一键生成1080P对口型视频。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

用百度一镜数字人实现两个角色同框对话,无需剪映蒙版、不拼接视频、不调时间轴——上传两张人物图+一段分角色脚本,系统自动合成双人精准对口型视频。
准备阶段:确保两人形象可被识别
打开百度一镜官网,登录账号后进入「形象克隆」模块。必须分别上传两位人物的正面高清照片,要求:面部无遮挡、光线均匀、背景干净、人脸占比超60%。【照片中不能出现第三个人、不能戴墨镜或口罩,否则系统会拒绝识别】
每张图单独提交,等待15秒左右生成独立数字人形象。生成成功后,页面会显示“已就绪”状态图标,此时才可进入下一步。
脚本输入:按角色标注说话内容
进入「数字人视频生成」工作台,点击「新建项目」→选择「双人对话模式」。
在脚本编辑区,用明确角色前缀标注每一句台词,格式必须为:【A】你好,今天推荐一款新咖啡 → 【B】确实香,我刚喝完一杯 → 【A】它还有提神不心悸的特点……
注意:角色名只能用【A】和【B】,不能写成【左】【右】或【张三】【李四】;每句换行,总字数建议控制在300字以内;标点用中文全角,避免英文引号或特殊符号。
这一步操作起来很简单,直接把写好的文案复制粘贴进去就行。但若漏掉【A】/【B】前缀,系统会默认全部由A角色说完,无法触发双人逻辑。
调用百度PaddleOCR‑VL大模型API,支持PDF、Word、PPT、图片等多格式文档解析,精准识别印刷体、手写体、表格、公式、图表、印章等复杂元素,支持100+语言,可处理不规则布局和跨页长文档。触发词:文档解析、VLM解析、大模型OCR、PaddleOCR、多模态文档、手写识别、公式识别、复杂版面。
配置双人画面布局
方法一:系统预设布局
在「画面设置」中下拉选择「左右分屏」,A角色自动居左,B角色自动居右,比例固定为1:1,背景默认纯色(可后续替换)。
方法二:自定义位置与大小
点击「高级布局」→拖动A/B角色头像到画布任意位置→用缩放滑块调节单人尺寸→开启「动作同步开关」让两人点头、抬手等微动作自然匹配。此时【务必关闭“自动居中”选项,否则手动调整的位置会被重置】。
生成与导出:一键完成双人视频
第一步:确认语音模型——A角色选「知性女声-Zeroshot」,B角色选「沉稳男声-Minimax」,音色差异越大,对话辨识度越高。
第二步:点击「生成视频」按钮,等待90~120秒。期间页面显示实时进度条与双人嘴型渲染预览。
第三步:生成完成后,点击「下载MP4」,选择1080P分辨率,文件自动保存至本地。视频已包含完整音画同步、自然停顿与角色眼神交互,无需任何后期处理。

















