直接调用pytesseract.image_to_string(img)失效,因验证码含干扰线、噪点、低对比度等,需先灰度化、高斯模糊降噪、自适应二值化预处理,并配置psm 8、oem 3及字符白名单参数。

纯 Python 实现的验证码识别(OCR)脚本,对大多数简单、无干扰、固定字体的数字/字母验证码有效;但遇到扭曲、粘连、噪点、背景干扰强的图片,pytesseract 直接调用基本会失效——这不是参数调得不够,而是模型没训练过这类样本。
为什么不能直接 pytesseract.image_to_string(img) 就完事?
因为原始验证码图通常包含干扰线、随机噪点、低对比度、轻微扭曲,pytesseract 默认配置只适合清晰印刷体文本。直接喂图,识别率可能低于 30%。
- 常见错误现象:
pytesseract.image_to_string()返回空字符串、乱码(如'O0DQ' → '0000'或'1lI' → '111') - 根本原因:tesseract 未做预处理,二值化阈值不合适,字符未分离,或字体不在其默认语言包中
- 关键动作不是换模型,而是把图“洗”干净——灰度→降噪→二值化→去线→字符切分(可选)
预处理必须做的三步:cv2 + PIL 配合
不用重写算法,用 OpenCV 和 Pillow 做轻量级清洗,比调 tesseract 参数更见效。
- 先转灰度:
img = img.convert('L')(PIL),避免彩色通道干扰 - 高斯模糊降噪(抑制椒盐噪点):
cv2.GaussianBlur(np.array(img), (3, 3), 0) - 自适应二值化比固定阈值鲁棒:
cv2.adaptiveThreshold(img_arr, 255, cv2.ADAPTIVE_THRESH_GAUSSIAN_C, cv2.THRESH_BINARY, 11, 2);注意块大小(11)需为奇数,且大于单字符宽度 - 可选:用形态学操作清理细线:
cv2.morphologyEx(binary_img, cv2.MORPH_CLOSE, kernel),kernel = np.ones((1,2), np.uint8)横向闭合断开的数字笔画
pytesseract 调用时的关键参数组合
不加配置的调用等同于放弃控制权。以下参数组合针对短验证码(4–6位)实测提升明显:
SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、
立即学习“Python免费学习笔记(深入)”;
- 指定白名单(大幅减少误识):
config='--psm 8 --oem 3 -c tessedit_char_whitelist=0123456789abcdefghijklmnopqrstuvwxyz'(--psm 8表示“单行文本”,--oem 3用 LSTM 模型) - 图像尺寸建议放大 2×:小图(img.resize((img.width * 2, img.height * 2), Image.Resampling.LANCZOS)
- 避免中文路径/空格路径:Windows 下若
tesseract安装在C:\Program Files\Tesseract-OCR\tesseract.exe,必须用pytesseract.pytesseract.tesseract_cmd = r'C:\Program Files\Tesseract-OCR\tesseract.exe'显式指定,否则报错FileNotFoundError: [WinError 2] 系统找不到指定的文件
绕不开的硬限制:什么时候该停手?
如果验证码含以下任意一项,Python + 开源 OCR 的自动化脚本就该转向其他方案(如打码平台、微调 CRNN 模型):
- 字符之间有明显粘连(如
'69'连成一个 blob) - 存在非均匀扭曲(如每字符独立旋转 ±15°)
- 背景是复杂纹理/渐变/水印图
- 字体每次请求都动态变化(非固定几款字体)
强行加滤镜、膨胀腐蚀、投影切割,只会让识别结果更随机——这时候花半天调参,不如用 requests + 手动输入一次,把 session cookie 复用起来。

















