OCR识别出现“□□□”“???”或中英文错位,主因是语言设置不全、文本方向未校正或系统缺字体;需勾选文档实际所有语种、设垂直方向或启用自动方向检测、更换Arial Unicode MS等兼容字体。

电脑用扫描仪识别文字后出现“□□□”“???”或中英文混杂错位,不是扫描仪坏了,也不是OCR软件故障,而是OCR识别语言选项没对准文档实际语种——尤其当一页含中文标题+英文表格+日文注释,或扫描件为竖排古籍、繁体旧档时,乱码几乎是默认结果。
确认并重设OCR识别语言
第一步:打开扫描软件(如HP Scan、ABBYY FineReader、Acrobat Pro等)→导入待识别的扫描图片或PDF → 点击【识别】或【OCR】按钮旁的设置图标(常为齿轮或“更多语言”字样)。
第二步:在语言选择弹窗中,【务必勾选文档中实际出现的所有语言】。例如:一页含简体中文正文+英文图注+韩文脚注的扫描件,必须同时勾选“简体中文”“英语”“韩语”。只勾一个,其余部分大概率变方块或问号;漏勾日语,遇到日文假名就直接崩成“????”。
第三步:点击【确定】保存语言设置 → 再点一次【识别页面】或【重新OCR】。这一步不能省——已识别过的文本不会自动更新,必须手动触发重识别,否则改了语言也白搭。
处理竖排/倒置/倾斜导致的方向性乱码
方法一:手动定义垂直识别区域
按Ctrl+R调出“绘制区域”工具 → 沿竖排文字走向拖出一条细长矩形(宽度约2–3字符,高度覆盖整列)→ 右键该区域 → 选择【属性】→ 将【文本方向】明确设为“垂直”→ 点击【确定】→ 再执行【识别页面】。
方法二:启用自动方向检测
点击【工具】→【高级OCR】或【图像处理】→ 勾选【自动检测文本方向】和【垂直文本】→ 点击【确定】→ 重新识别。此模式对日文竖排、繁体直书、古籍影印本兼容性更强,但会略微拉长识别时间。
注意:如果扫描时纸张放反了(比如A4纸头朝下进纸),先点【图像处理】→【自动校正】把画面扶正,再调方向设置。否则方向错+语言错=双重乱码,越调越糊。
修复因字体缺失引发的显示层乱码
如果识别结果里文字位置、段落结构都正确,只是大量显示“□”“”“?”,基本可断定是系统缺字体。
直接在右侧文本预览区,选中一段乱码 → 右键 → 【属性】→ 在底部字体下拉框中,切换为【Arial Unicode MS】(覆盖全球主流字符)或【SimSun】(专解中文显示)。
若整篇统一乱码,点击【工具】→【样式编辑器】→ 找到“正文”样式 → 修改其默认字体为【SimSun】→ 点击【确定】。这样所有应用该样式的文字都会同步更新,不用逐段点选。

















