必须用MinerU加--task doc参数结构化解析PDF,确保图注独立成行且含“图X-Y:”前缀,再在Coze中启用智能分段与图文混合检索,权重设为向量0.7+关键词0.3,最小匹配度调至0.55。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让扣子准确理解并检索一份含图表、公式、流程图和正文说明的图文混合PDF文档,但发现AI只答出文字部分、漏掉图注关键参数、把示意图误判为装饰性图片——这不是模型不识图,而是你没告诉它哪些图必须参与向量化。
预处理:先分离图文语义再喂给扣子
扣子不直接解析PDF中的图像内容,它只对OCR提取出的文本流做向量化。若你上传带图的PDF,系统会默认跳过所有图片区域,仅处理图下方或旁边的可选文字——图注被截断、流程图箭头逻辑丢失、表格数据与图例错位,全是默认OCR策略导致的硬伤。
第一步:用MinerU 2.5-1.2B执行结构化解析,命令必须带--task doc参数:
mineru -p ./input/tech_spec.pdf -o ./output --task doc
这一步不做,后续所有操作都无效。不加--task doc,MinerU只会输出纯OCR文本,标题层级消失、公式变成乱码、图注被揉进正文段落里,扣子切块时会把“图3-2 接口时序图(含握手信号延迟≤5ns)”和下一段代码混成一个chunk,导致向量嵌入时关键约束条件被稀释。
第二步:检查输出的tech_spec.md中是否每张图都有独立caption行,格式必须是:
<br>图3-2:接口时序图,含握手信号延迟≤5ns,CLK上升沿采样
【图注必须单独成行且以“图X-Y:”开头,不能和正文连写,否则扣子无法识别其为独立语义单元】
第三步:删除冗余干扰项——重点清理三类内容:
• 扫描水印文字(如“CONFIDENTIAL – INTERNAL USE ONLY”)
• PDF阅读器自动生成的页眉页脚(如“第42页 共89页”)
• 多栏排版残留的换行符(如“参见图
3-2”应合并为“参见图3-2”)
知识库创建:启用图文感知型分块策略
进入Coze平台 →「知识库」→「创建知识库」→ 命名为“硬件规格图文库”。
上传clean.md文件后,不要点击“完成”,先点右下角「高级设置」→ 开启「启用智能分段」→ 分块策略选「By heading」。
关键配置:勾选「保留标题层级」+「将图片caption识别为独立chunk」。
这一步漏掉,图注就会被吞进上一段正文里。例如“图3-2”那行caption若未被识别为独立chunk,向量检索用户问“握手信号延迟要求”,系统只能从文字段里找“延迟”关键词,而真正带数值约束的图注内容根本不会被召回。
检索配置:图文混合召回必须开启双路权重
方法一:在Bot编辑页 →「知识库」→ 点击刚建的“硬件规格图文库”→「检索设置」→ 开启「混合检索」开关。
方法二:拖动滑块设定权重:
• 向量权重设为0.7(图文语义关联强,需靠向量捕捉“时序图→延迟→采样边沿”隐含逻辑)
• 关键词权重设为0.3(保留对“CLK”“ns”“上升沿”等硬指标的精确匹配)
【两个权重之和必须严格等于1,系统不校验输入值,若填0.7+0.4=1.1,保存后自动缩放为0.64+0.36,导致图注召回率下降】
方法三:最小匹配度调至0.55——图注通常比正文短,向量相似度天然偏低,设0.8会直接过滤掉所有图相关chunk。
验证图文召回效果
第一步:进入Bot调试面板 → 输入测试问题:“接口握手信号最大允许延迟是多少?”
第二步:点击「查看检索详情」→ 检查召回列表中是否包含图3-2的caption chunk(内容含“延迟≤5ns”)。
第三步:若未命中,返回「高级设置」→ 关闭「By heading」→ 改用「自定义分隔符」→ 在caption前后手动插入===FIGURE_START===和===FIGURE_END===,再重新上传clean.md。


















