一镜数字人批量导入仅支持UTF-8无BOM的TXT(单字段每行一条)和CSV(仅content、metadata两列),需规避BOM、隐藏字符、换行错位及引号转义问题。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

百度一镜数字人批量导入文案时,常因文件格式不规范导致报错、内容截断或字段错位,尤其是中文文案出现乱码、换行丢失、引号解析异常等问题。必须严格按平台要求组织文本结构,否则系统直接拒绝导入。
确认文件类型与基础限制
一镜数字人仅支持 UTF-8编码的纯文本文件(.txt)和CSV文件(.csv),不接受Excel、Word或其他富文本格式。TXT文件仅允许单字段纯文本,每行一条文案;CSV文件则必须包含且仅包含两列:第一列为“content”,第二列为“metadata”(可为空)。任何多余列、空行、BOM头、隐藏字符都会触发校验失败。
注意:CSV文件若含逗号、双引号、换行符,必须用英文双引号包裹该字段,并对内部双引号做转义(如"他说""你好""" → "他说""你好"")。
整理TXT文件:单字段纯文本规范
第一步:用记事本或Notepad++打开原始文案文件,删除所有空行、首尾空格、制表符、全角空格。
第二步:确保每行只有一条完整文案,禁止在行内使用回车换行——如需段落分隔,请用“\n”字符串代替实际换行(例如:“欢迎光临\n点击查看详情”),一镜会自动识别并渲染为换行效果。
第三步:保存为UTF-8无BOM格式。在Notepad++中操作路径为:编码 → 转为UTF-8无BOM → 文件 → 另存为 → 选择“UTF-8”编码(非“UTF-8-BOM”)→ 保存。若用Windows记事本,默认保存带BOM,务必改用专业编辑器。
构建CSV文件:两列强制结构
方法一:Excel手动构建(新手适用但易踩坑)
① 新建空白Excel表格,第一行输入两个单元格:【content】(小写,不可拼错)、【metadata】(可选,留空亦可)。
② 从第二行起,在“content”列逐行填入文案,每条独立一行;“metadata”列可填写JSON格式键值对(如{"scene":"开场问候"}),不含metadata则整列留空,但列必须存在。
调用百度文档解析API,支持18+格式,提取文本、表格、版面分析、OCR识别及RAG文档分块。适用于文档解析、文本/表格提取、结构分析、扫描件处理。触发词:文档解析、PDF解析、Word解析、表格提取、OCR、文档分析、提取文本、文档结构、扫描识别。
③ 全选数据区域 → 数据 → 分列 → 选择“分隔符号” → 取消勾选所有分隔符 → 完成 → 防止Excel误将中文逗号识别为字段分隔符。
④ 文件 → 另存为 → 保存类型选“CSV(逗号分隔)(*.csv)” → 编码必须选“UTF-8”(Office 365及2021版支持;老版本需用Notepad++二次转码)。
方法二:Python快速生成(推荐用于百条以上文案)
运行以下脚本即可生成合规CSV:
import pandas as pd
data = [{"content": "今天天气真好", "metadata": '{"role":"主播"}'}, {"content": "欢迎订阅我们的频道", "metadata": ""}]
df = pd.DataFrame(data)
df.to_csv("script.csv", index=False, encoding="utf-8")
这一步操作起来很简单,直接把生成的CSV拖进一镜后台即可,但必须确认pandas默认encoding="utf-8"未被覆盖——若导出后仍乱码,说明环境默认编码非UTF-8,需显式指定encoding参数。
验证与上传前必检项
打开CSV或TXT文件,用十六进制编辑器(如HxD)或Notepad++的“显示所有字符”功能检查:无0xEF 0xBB 0xBF字节(即无BOM头);无0x00(NULL字符);无0x0D 0x0A混用(Windows换行应统一为0x0D 0x0A,Linux为0x0A,一镜兼容两者,但禁止混用)。
上传前,在一镜后台选择文件后,页面会实时校验前10行。若提示“字段数量不匹配”或“编码错误”,立即返回检查列数是否为2(CSV)或是否存在不可见控制字符(TXT)。
上传时,勾选“启用智能清洗”选项——该功能会自动过滤连续空格、折叠全角标点、移除不可见Unicode控制符(如U+200B零宽空格),但不会修复编码错误或列结构错误,仅作为辅助手段。

















