直接调用 ddddocr.DdddOcr() 识别点选验证码会失败,因默认未启用检测模型;必须使用 DdddOcr(det=True) 初始化,再调用 detection() 获取含坐标的识别结果。

为什么直接调用 ddddocr.DdddOcr() 识别点选验证码会失败?
因为点选验证码不是普通 OCR 场景——它要求模型先定位图中文字位置,再返回坐标,而不是只输出文本。默认初始化的 DdddOcr 实例只启用了文字识别(old_version=False),没加载点选专用模型。你看到的空列表、None 或报错 AttributeError: 'DdddOcr' object has no attribute 'classification' 都源于此。
必须显式启用点选模式:DdddOcr(det=True)。注意不是 det=True, rec=False(那是检测+不识别,但点选需要识别每个字并定位)——det=True 已隐含启用文字检测与单字识别双能力。
-
det=True:加载带目标检测能力的模型,输出每个文字的 bounding box 和文本 - 不要传
old_version=True:老版本不支持点选,且已弃用 - 首次运行会自动下载
det.onnx模型文件(约 20MB),默认缓存到~/.ddddocr/,若网络受限需手动放好
如何正确调用 ocr.detection() 获取文字坐标?
detection() 是点选场景唯一有效的入口函数,它返回的是 list[list]:外层每个元素对应一个检测到的文字,内层是 [x1, y1, x2, y2, text](左上+右下坐标 + 识别结果)。不是字符串,也不是字典。
常见错误是误用 ocr.classification(img)(这是纯文本识别)或对 detection() 结果做字符串操作。
立即学习“Python免费学习笔记(深入)”;
SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、
- 输入必须是
PIL.Image或numpy.ndarray(BGR 或 RGB 均可,库内部会转灰度) - 若用 OpenCV 读图:
cv2.imread()返回 BGR,可直接传;但记得别再cv2.cvtColor(..., cv2.COLOR_BGR2RGB)多此一举 - 返回坐标是整数像素值,原图尺寸未缩放——确保你点击时用的是同一张图的原始尺寸
from ddddocr import DdddOcr
import cv2
<p>ocr = DdddOcr(det=True)
img = cv2.imread("click_captcha.png") # BGR 格式,直接传
res = ocr.detection(img) # 返回 [[x1,y1,x2,y2,"苹果"], [x1,y1,x2,y2,"香蕉"]]
print(res)怎么把识别出的坐标转换成「点击中心点」?
点选验证码要求点击文字区域中心,不是左上角。直接取 (x1, y1) 会点偏,多数平台判定失败。
detection() 返回的是矩形框,中心点就是 ((x1+x2)//2, (y1+y2)//2)。注意:OpenCV 坐标系 y 向下增长,但点击坐标通常也是按屏幕 y 向下理解,所以无需翻转。
- 如果返回多个字(如“苹果 香蕉”),
res是长度为 2 的列表,需分别算各自中心 - 若题目要求“点击所有‘苹果’”,得先过滤
item[4] == "苹果",再取其坐标 - 某些验证码字间距极小,模型可能把两个字框进同一个 box——这时要靠后处理切分,但
ddddocr不提供该能力,得换方案
遇到识别不准或漏字怎么办?
点选验证码本身对抗性强,ddddocr 的检测模型在小字体、粘连、低对比度下容易失效。别指望一次调用就 100% 准确。
- 预处理图像往往比换参数更有效:用
cv2.threshold()二值化、cv2.GaussianBlur()降噪、或cv2.resize()放大 2× 再识别 -
ocr.detection()没有置信度阈值参数,无法过滤低置信结果——你只能靠后验规则,比如过滤掉高度 - 部分网站用动态干扰线或文字扭曲,此时
ddddocr无能为力,需结合模板匹配或重试机制 - 模型对简体中文鲁棒,但遇到生僻字、emoji、字母数字混排,准确率明显下降
真正难的不是调通 API,而是把识别结果和业务逻辑对齐:题目问的是“点击图中所有动物”,你得知道“苹果”是不是动物——这层语义判断,ddddocr 不负责,也做不到。

















