需OCR:当PDF拖选无反应、高亮呈色块或复制为乱码/空格时;表面清晰但文字错位的混合体也必须OCR。用Acrobat Pro选「保留页面布局」识别文本,保存为PDF/A-1b格式后导入QClaw。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

当你拿到一份扫描版PDF,页面里有大量表格、多栏排版、图文混排或倾斜文字时,直接复制文本会乱码、错行、丢字符——这是因为PDF里没有可读的文本层,必须先用OCR识别出文字结构,再导入QClaw做后续分析。
确认PDF是否需要OCR
打开PDF → 用鼠标拖选任意一段正文 → 能正常高亮并复制出完整句子,说明已有文本层,【无需OCR】;若拖选无反应、高亮呈整块色块、复制出来是乱码或空格,就必须OCR。
注意:有些PDF表面看起来清晰,但其实是“图片+透明文字层”的混合体,此时复制可能看似成功,实则文字位置错位严重,QClaw解析表格时会彻底错行——这种也必须OCR重置文本流。
用Adobe Acrobat Pro完成高质量OCR
方法一(推荐):
① 打开PDF → 点击右上角「工具」→「增强扫描」→「识别文本」→「在本文件中」;
② 在右侧面板选择语言(中文必选「简体中文」,含中英混排时勾选「自动检测语言」);
③ 关键设置:务必点击「更多选项」→ 将「布局识别」设为「保留页面布局」,否则多栏和表格会被强行拉成单栏流水账,QClaw后续无法还原原始结构;
④ 点击「识别」→ 等待完成 → 按 Ctrl+S 保存为新文件(原文件勿覆盖)。
方法二(快速应急):
直接按 Ctrl+Shift+R → 弹出OCR对话框 → 保持默认设置点「确定」→ 仅适用于纯正文、无表格、无分栏的简单扫描件;【复杂排版下此法会导致QClaw解析失败】。
导入QClaw前的PDF预处理
确保OCR后的PDF已保存为「PDF/A-1b」或「PDF/A-2b」格式:在Acrobat中 → 「文件」→「另存为其他」→「PDF/A」→ 选择「PDF/A-1b」→ 保存。
这一步不是可选项。QClaw依赖PDF/A标准中的结构化元数据来定位段落边界和字体语义,普通PDF即使OCR成功,也可能因缺少标签导致章节识别断裂、标题降级为正文。
最后将该PDF文件拖入QClaw主界面「添加文档」区域即可开始解析。

















