必须先将PDF转为结构化Markdown再导入扣子AI知识库,因扣子无法直接解析PDF语义;使用MinerU 2.5-1.2B加--task doc参数解析,确保标题层级、表格、公式($$...$$)和图片caption完整;再用Python清洗页眉页脚并人工校验补全公式;最后在扣子中以By heading分块上传clean.md。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

扣子AI知识库无法直接解析PDF中的真实语义结构,上传扫描件或排版复杂的PDF会导致标题错乱、公式丢失、表格变形,最终检索结果完全不可用——必须先将PDF转为结构化Markdown再导入。
用MinerU 2.5-1.2B解析PDF为结构化Markdown
进入预装MinerU 2.5-1.2B的深度学习镜像环境(如CSDN星图镜像),默认工作路径为/root/workspace。
执行命令:mineru -p ./input/report.pdf -o ./output --task doc
【必须加--task doc参数】,否则只做OCR文字提取,不保留标题层级和公式语义,后续在扣子中切块会把“摘要”和“参考文献”混在同一chunk里。
解析完成后检查./output/report.md:确认一级标题(#)、二级标题(##)完整,表格已转为Markdown语法,数学公式保留为$$$$格式,且每个图片下方有对应caption描述——这是扣子能正确理解上下文的前提。
清洗与校验关键内容
方法一:用Python脚本删除页眉页脚、重复页码、扫描水印文字
打开report.md,运行以下代码:
import re<br>with open("report.md") as f: text = f.read()<br>text = re.sub(r"第 \d+ 页|©.*?20\d{2}|Confidential.*", "", text)<br>text = re.sub(r"\n\s*\n\s*\n+", "\n\n", text)<br>with open("clean.md", "w") as f: f.write(text)
方法二:人工校验含公式的章节(如“3.2 模型推导”)
重点确认$$\frac{\partial L}{\partial w} = 0$$未被截断为$$\frac{\partial L——MinerU偶发在长公式末尾丢掉右括号,这种错误会导致扣子嵌入时整个chunk向量失真,必须手动补全。
在扣子中创建知识库并导入clean.md
第一步:登录Coze平台 → 点击左上角「Bot」→ 选择目标Bot →「Knowledge Base」→「Add Knowledge」
第二步:点击「Upload Files」→ 选择clean.md → 在弹窗中设置:
• 分块策略选「By heading」
• 文本预处理规则保持默认(自动清洗空行、删除URL等)
上传完成后等待处理完成,绿色“已完成”提示出现即表示成功。


















