讲师中心 微信公众号
AI工具推荐 视频效率加速

为 SEO 专家提供的高级验证码绕过技术以及代码示例

胖静君_9740

胖静君_9740

发布时间:2024-11-07 16:25:43

|

527人浏览过

|

来源于dev.to

转载

为 seo 专家提供的高级验证码绕过技术以及代码示例

每一位参与数据抓取的 seo 专家都知道,验证码是一个具有挑战性的障碍,限制了对所需信息的访问。但是否值得完全避免,还是学习如何绕过它更好?让我们通过真实的例子和有效的方法来分析验证码是什么,为什么它被如此广泛地使用,以及 seo 专家如何绕过它。

seo 中的验证码绕过:它是什么,它是否被高估了?

每个 seo 专业人士都遇到过验证码。如果没有,他们要么不是专业人士,要么误解了首字母缩略词 seo(可能与 smm 或 ceo 混淆),或者他们才刚刚开始这项具有挑战性的工作。

captcha(“完全自动化的公共图灵测试来区分计算机和人类”)是一种保护网站免受自动化操作(例如数据抓取或机器人攻击)的方法。验证码被翻译为“Полностью автоматизированный публичный тест Тьюринга для различения компьютеров и людей。”

人们可能多年来一直否认验证码被高估,并认为它不值得投入大量资源。但是,当您需要从搜索引擎(例如 yandex)检索数据,而对 xml 请求一无所知时,这些论点就站不住脚了……或者,例如,如果客户想要抓取整个 amazon 并且支付了很高的费用……不然后问题出现了:“别再说了……”

尽管有可用的绕过方法,为什么仍使用验证码

情况并不像看起来那么简单。保护站点免遭数据抓取可能很困难,特别是如果它是非商业项目或“仓鼠站点”。通常,既没有时间,也没有意愿(最重要的是)为验证码分配资源。但如果你是一个带来数百万收入的主要门户网站的所有者,情况就不同了。那么考虑全面保护是有意义的,包括防止 ddos 攻击或不诚实竞争对手的措施。

例如,亚马逊应用了三种类型的验证码,每种类型出现在不同的情况下,并且他们随机更改设计,以便自动化工具和抓取工具不能依赖过时的方法。这使得绕过它们的保护变得复杂且成本高昂。

网站保护级别

如果我们谈论的是较小的网站管理员,他们也明白复杂的验证码会阻止真正的用户,特别是在网站的门槛太高的情况下。与此同时,让网站不受保护是不明智的——它甚至会吸引最愚蠢的机器人,它们可能无法绕过验证码,但仍然可以执行大规模操作。

现代网站所有者尝试通过使用通用解决方案(例如 recaptcha 或 hcaptcha)来找到平衡。这可以保护网站免受简单机器人的侵害,而不会给用户造成严重不便。仅当网站面临大规模机器人攻击时才会使用更复杂的验证码。

为什么 seo 专家可能需要验证码绕过

让我们从 seo 专家的角度考虑这个问题:他们为什么以及出于什么目的可能需要绕过验证码?

验证码绕过对于最基本的任务可能是必要的——分析搜索引擎中的位置。当然,这可以通过对每日位置监控收费的第三方服务来实现。此外,您还需要支付第三方验证码识别服务的费用。

验证码在研究竞争对手网站时也可能相关。由于保护级别不同,绕过竞争对手网站上的验证码通常比收集搜索排名更容易。

自动化日常任务是一个更小众的话题。并不是每个人都使用它,但对于专门的 seo 专家来说,它可以是节省时间和精力的宝贵工具。

一般来说,计算成本效益很重要——购买位置监控服务和验证码识别服务更便宜,还是创建自己的解决方案并降低成本更便宜?当然,如果只有一两个项目并且客户付费,则后一种选择听起来过于劳动密集型。但如果你拥有多个项目并自己支付所有费用……那就值得考虑了。

Li Python Sec Check
Li Python Sec Check

Python 安全规范检查工具:基于 CloudBase 规范、腾讯安全指南,LLM 智能分析(默认禁用,优先本地执行)

下载

验证码绕过的主要方法

让我们探索比简单地在密钥收集器中插入 api 密钥需要更多努力的方法。您需要更深入的知识,而不仅仅是知道如何在服务主页上查找 api 密钥并将其插入正确的字段。

1.第三方验证码识别服务

最流行的方法是将验证码发送到专门的服务(例如 2captcha 或 rucaptcha),该服务返回现成的解决方案。这些服务需要根据解决的验证码付费。

以下是用 python 解决 recaptcha v2 的标准代码示例:

import requests
import time

api_key = 'your_2captcha_key'
site_key = 'your_site_key'
page_url = 'https://example.com'

def get_captcha_solution():
    captcha_id_response = requests.post("http://2captcha.com/in.php", data={
        'key': api_key,
        'method': 'userrecaptcha',
        'googlekey': site_key,
        'pageurl': page_url,
        'json': 1
    }).json()

    if captcha_id_response['status'] != 1:
        print(f"error: {captcha_id_response['request']}")
        return none

    captcha_id = captcha_id_response['request']
    print(f"captcha sent. id: {captcha_id}")

    for attempt in range(30):
        time.sleep(5)
        result = requests.get("http://2captcha.com/res.php", params={
            'key': api_key,
            'action': 'get',
            'id': captcha_id,
            'json': 1
        }).json()

        if result['status'] == 1:
            print(f"captcha solved: {result['request']}")
            return result['request']
        elif result['request'] == 'capcha_not_ready':
            print(f"waiting for solution... attempt {attempt + 1}/30")
        else:
            print(f"error: {result['request']}")
            return none
    return none

captcha_solution = get_captcha_solution()

if captcha_solution:
    print('captcha solution:', captcha_solution)
else:
    print('solution failed.')

此代码可帮助您自动提交验证码进行解决并接收绕过保护所需的令牌。

2. 使用代理和 ip 轮换绕过验证码

第二种方法涉及使用住宅代理轮换 ip 地址。这使您可以像不同的人一样从每个新代理访问该网站,从而降低了验证码激活的可能性。

以下是 python 中使用代理轮换的代码示例:

import requests
from itertools import cycle
import time
import urllib.parse

# list of proxies with individual logins and passwords
proxies_list = [
    {"proxy": "2captcha_proxy_1:port", "username": "user1", "password": "pass1"},
    {"proxy": "2captcha_proxy_2:port", "username": "user2", "password": "pass2"},
    {"proxy": "2captcha_proxy_3:port", "username": "user3", "password": "pass3"},
    # add more proxies as needed
]

# proxy rotation cycle
proxy_pool = cycle(proxies_list)

# target url to work with
url = "https://example.com"
# headers to simulate a real user
headers = {
    "user-agent": "mozilla/5.0 (windows nt 10.0; win64; x64; rv:129.0) gecko/20100101 firefox/129.0"
}

# sending several requests with proxy rotation
for i in range(5):  # specify the number of requests needed
    proxy_info = next(proxy_pool)
    proxy = proxy_info["proxy"]
    username = urllib.parse.quote(proxy_info["username"])
    password = urllib.parse.quote(proxy_info["password"])

    # create a proxy with authorization
    proxy_with_auth = f"http://{username}:{password}@{proxy}"

    try:
        response = requests.get(
            url,
            headers=headers,
            proxies={"http": proxy_with_auth, "https": proxy_with_auth},
            timeout=10
        )

        # check response status
        if response.status_code == 200:
            print(f"request {i + 1} via proxy {proxy} was successful.")
        else:
            print(f"request {i + 1} ended with status code {response.status_code}")
    except requests.exceptions.requestexception as e:
        print(f"error with proxy {proxy}: {e}")

    # delay between requests for natural behavior
    time.sleep(2)

此示例演示如何使用代理轮换向目标站点发出请求,降低被阻止的风险。

3. 使用无头浏览器绕过验证码

第三种方法涉及使用像 selenium 这样的无头浏览器来模拟真实的用户操作。这种方法可能更耗费人力,但也更有效。

这是使用 selenium 进行代理轮换的示例代码:

from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from selenium.webdriver.common.by import By
import time
import random
from itertools import cycle

# List of proxies with login and password
proxies_list = [
    {"proxy": "proxy1.example.com:8080", "username": "user1", "password": "pass1"},
    {"proxy": "proxy2.example.com:8080", "username": "user2", "password": "pass2"},
    {"proxy": "proxy3.example.com:8080", "username": "user3", "password": "pass3"},
    # Add more proxies as needed
]

# Proxy rotation cycle
proxy_pool = cycle(proxies_list)

# Settings for Headless Browser
def create_browser(proxy=None):
    chrome_options = Options()
    chrome_options.headless = True  # Enable headless mode
    chrome_options.add_argument("--disable-blink-features=AutomationControlled")  # Disable auto-detection

    # Set up proxy
    if proxy:
        chrome_options.add_argument(f'--proxy-server=http://{proxy["proxy"]}')

    # Additional arguments to hide headless mode
    chrome_options.add_argument("start-maximized")
    chrome_options.add_argument("disable-infobars")
    chrome_options.add_experimental_option("excludeSwitches", ["enable-automation"])
    chrome_options.add_experimental_option("useAutomationExtension", False)

    # Initialize the browser
    browser = webdriver.Chrome(options=chrome_options)
    browser.execute_cdp_cmd("Page.addScriptToEvaluateOnNewDocument", {
        "source": """
            Object.defineProperty(navigator, 'webdriver', {
                get: () => undefined
            })
        """
    })

    return browser

# Main function for CAPTCHA bypass
url = "https://example.com"

def bypass_captcha(url, num_attempts=5):
    for i in range(num_attempts):
        proxy_info = next(proxy_pool)
        browser = create_browser(proxy_info)

        try:
            # Go to the site
            browser.get(url)
            print(f"Attempt {i + 1} via proxy {proxy_info['proxy']} was successful.")
        except Exception as e:
            print(f"Error with proxy {proxy_info['proxy']}: {e}")
        finally:
            browser.quit()

        # Random delay between attempts for natural behavior
        time.sleep(random.uniform(2, 5))

# Run CAPTCHA bypass on the target site
bypass_captcha(url)

此示例展示了如何使用 selenium 通过滚动并与网站上的元素交互来模拟真实用户。

结论

总之,如果您有时间并且想要完成代码,结合代理轮换和无头浏览器等方法可以产生出色的结果。如果您想简化事情,请使用为任务提供现成工具的服务。然而,针对每项特定任务仔细选择最合适的工具至关重要。

祝您免验证码访问!

热门AI工具

更多
AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

音述AI
音述AI Hot

一款AI音频处理工具,主要用于音述AI是一个以“用声音述说故事”为核心的 AI 音乐创作与声音分享社区,适合需要提升相关任务效率的用户。

超级简历WonderCV

一款AI办公效率工具,主要用于免费求职简历模版下载制作,应届生职场人必备简历制作神器,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
pdf怎么转换成xml格式
pdf怎么转换成xml格式

将 pdf 转换为 xml 的方法:1. 使用在线转换器;2. 使用桌面软件(如 adobe acrobat、itext);3. 使用命令行工具(如 pdftoxml)。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

4224

2024.04.01

xml怎么变成word
xml怎么变成word

步骤:1. 导入 xml 文件;2. 选择 xml 结构;3. 映射 xml 元素到 word 元素;4. 生成 word 文档。提示:确保 xml 文件结构良好,并预览 word 文档以验证转换是否成功。想了解更多xml的相关内容,可以阅读本专题下面的文章。

5437

2024.08.01

xml是什么格式的文件
xml是什么格式的文件

xml是一种纯文本格式的文件。xml指的是可扩展标记语言,标准通用标记语言的子集,是一种用于标记电子文件使其具有结构性的标记语言。想了解更多相关的内容,可阅读本专题下面的相关文章。

2362

2024.11.28

什么是搜索引擎
什么是搜索引擎

搜索引擎是一种互联网工具,用于帮助用户在网上查找信息。搜索引擎的目标是提供最准确、最有价值的搜索结果,使用户能够快速找到所需的信息。本专题为大家提供搜索引擎相关的各种文章、以及下载和课程。

3033

2023.08.02

有哪些目录搜索引擎
有哪些目录搜索引擎

目录搜索引擎有Google、Bing、Yahoo、Baidu、DuckDuckGo等。想了解更多目录搜索引擎的相关内容,可以阅读本专题下面的文章。

26108

2023.11.06

搜索引擎营销的主要模式
搜索引擎营销的主要模式

搜索引擎营销的主要模式包括:1. 竞价排名(ppc);2. 搜索引擎优化(seo);3. 本地搜索营销;4. 购物广告;5. 视频广告;6. 展示广告;7. 社交媒体营销;8. 移动广告。想了解更多搜索引擎营销的相关内容,可以阅读本专题下面的文章。

2749

2024.05.20

PHP 命令行脚本与自动化任务开发
PHP 命令行脚本与自动化任务开发

本专题系统讲解 PHP 在命令行环境(CLI)下的开发与应用,内容涵盖 PHP CLI 基础、参数解析、文件与目录操作、日志输出、异常处理,以及与 Linux 定时任务(Cron)的结合使用。通过实战示例,帮助开发者掌握使用 PHP 构建 自动化脚本、批处理工具与后台任务程序 的能力。

466

2025.12.13

Figma AI自动化智能数据填充与交互生成实战
Figma AI自动化智能数据填充与交互生成实战

告别机械重复,详细演示如何用 AI 填充业务真实数据,并自动为页面添加交互连线,将静态设计稿快速转变为动态原型。

285

2026.05.13

LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

80

2026.09.30

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn