
pyquery 本身不直接提供 user_agent 参数,但可通过 headers 字典传入 user-agent,从而模拟真实浏览器请求,有效规避部分网站的反爬限制。
pyquery 本身不直接提供 user_agent 参数,但可通过 headers 字典传入 user-agent,从而模拟真实浏览器请求,有效规避部分网站的反爬限制。
PyQuery 是一个基于 lxml 和 requests 的 jQuery 风格 HTML 解析库,常用于网页抓取与 DOM 操作。虽然其 API 简洁,但默认请求头(如 User-Agent)为 requests 库的默认值(例如 python-requests/2.x),容易被目标网站识别为爬虫并拒绝访问。幸运的是,PyQuery 在初始化时支持通过 headers 参数透传 HTTP 请求头,这是设置自定义 User-Agent 的标准且推荐方式。
✅ 正确设置 User-Agent 的方法
只需在构造 PyQuery 实例时,将 headers 字典作为关键字参数传入即可:
import pyquery
# 模拟主流浏览器的 User-Agent
headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36"
}
pqobj = pyquery.PyQuery(
url="https://www.example.com/",
headers=headers
)
html = pqobj.html()
plain_text = pqobj.text()⚠️ 注意:键名必须为 "User-Agent"(大小写敏感),推荐使用完整、常见的浏览器 UA 字符串,避免过于简略(如 "Foo Browser")导致部分站点仍拦截。
? 补充说明与最佳实践
- 无需额外安装依赖:PyQuery 内部默认使用 requests 发起网络请求,因此 headers 参数可直接生效;
- 支持其他请求头:除 User-Agent 外,还可同时设置 Accept、Accept-Language、Referer 等增强请求真实性;
- 错误处理建议:生产环境中应添加异常捕获,例如 requests.exceptions.RequestException,防止因网络或状态码异常导致程序中断;
- 替代方案(不推荐):若需更精细控制(如 Session 复用、Cookie 管理、代理、重试机制),建议显式使用 requests.Session() 获取响应后,再传给 PyQuery 解析——而非依赖其内置请求逻辑。
示例:结合 requests Session 进行高级控制
import requests
import pyquery
session = requests.Session()
session.headers.update({
"User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36",
"Accept": "text/html,application/xhtml+xml,application/xml;q=0.9,*/*;q=0.8"
})
response = session.get("https://www.example.com/", timeout=10)
response.raise_for_status() # 抛出 HTTP 错误
pqobj = pyquery.PyQuery(response.content) # 直接解析字节内容总之,通过 headers={"User-Agent": "..."} 即可快速、可靠地伪装请求来源。这是 PyQuery 抓取友好型网站的基础配置,也是构建健壮爬虫的第一步。

















