直接用requests请求豆瓣返回403或空数据,因豆瓣反爬严格:需合法User-Agent、有效Cookie、合理频率;且Top250评分由JS动态加载,原始HTML仅含占位符;推荐调用其未公开但可用的API(如/j/chart/top_list),需正确设置type=11、interval_id=100:90、start/limit分页及Referer头。

为什么直接用 requests 请求豆瓣会返回 403 或空数据?
豆瓣对爬虫做了严格反爬:没有合法 User-Agent、缺少 Cookie、请求频率过高,都会被拒绝。更关键的是,Top250 页面的评分和评论数实际由前端 JS 动态加载,原始 HTML 里只有占位符(比如 <span class="rating_num" property="v:average"> </span>),直接解析得不到真实数据。
实操建议:
- 必须带上模拟浏览器的
User-Agent和有效的Cookie(可从浏览器开发者工具中复制一次有效会话) - 优先考虑抓取豆瓣公开的 API 接口,而非渲染后的页面 —— 比如
https://www.php.cn/link/3f3a6943c3ce919cd8a5ee810b459104?这类接口返回 JSON,结构清晰且含评分字段 - 若坚持解析页面,得配合
playwright或selenium渲染 JS,但速度慢、资源开销大,不推荐用于批量采集
用 requests 调用豆瓣 Top250 API 的正确参数怎么填?
豆瓣未公开文档,但通过浏览器 Network 面板可捕获真实请求:https://www.php.cn/link/3f3a6943c3ce919cd8a5ee810b459104?type=11&interval_id=100%3A90&action=&start=0&limit=20。其中:
-
type=11对应“电影”类型(不是所有 type 都返回 Top250,11 是常用值) -
interval_id=100%3A90表示评分区间 9.0–10.0,但 Top250 固定用这个值,改了反而拿不到完整列表 -
start和limit控制分页:每页最多 20 条,共需请求 13 次(start=0,20,...,240) - 必须带
Referer: https://www.php.cn/link/569479b3a8a21a6a83fa86ad9e823652头,否则返回空数组
示例片段:
inference.sh 的 Python SDK:运行 AI 应用、构建智能体,并集成 150 多个模型。包名:inferencesh (pip install inferencesh)。支持同步/异步……
立即学习“Python免费学习笔记(深入)”;
import requests
<p>headers = {
"User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_15_7) AppleWebKit/537.36",
"Referer": "<a href="https://www.php.cn/link/569479b3a8a21a6a83fa86ad9e823652">https://www.php.cn/link/569479b3a8a21a6a83fa86ad9e823652</a>"
}
params = {"type": "11", "interval_id": "100:90", "start": 0, "limit": 20}
resp = requests.get("<a href="https://www.php.cn/link/3f3a6943c3ce919cd8a5ee810b459104">https://www.php.cn/link/3f3a6943c3ce919cd8a5ee810b459104</a>", headers=headers, params=params)
data = resp.json() # 每项含 'score'、'title'、'rating_count' 等字段如何稳定获取 250 条完整数据而不被限流?
豆瓣服务端会检测请求节奏:连续请求间隔
- 务必在每次请求后
time.sleep(1.5),别信“随机 sleep 0.8~1.2 秒”这种侥幸做法 - 不要复用同一个
Session对象跑完全部请求 —— 建议每 5 页重建一次requests.Session(),并更新Cookie - 如果某次响应状态码不是 200,或返回数据长度为 0,立即中断,检查
Cookie是否过期(豆瓣 Cookie 通常 1–2 小时失效) - 避免使用代理池:豆瓣会校验
Cookie与 IP 的绑定关系,换 IP 后旧 Cookie 失效,反而增加失败率
拿到数据后,score 字段为什么是字符串?要注意什么?
API 返回的 score 是字符串类型(如 "9.7"),不是浮点数。直接参与数值计算会报错;更隐蔽的问题是,极少数条目 score 为 ""(空字符串)或 "暂无评分",这是豆瓣对未上映/冷门影片的标记。
- 清洗时必须做类型转换:
float(item["score"]) if item["score"] and item["score"].replace(".", "").isdigit() else None - 注意
rating_count字段是字符串数字(如"1722842"),可直接int(),但得先strip() - 标题字段
title含全角空格和换行符,入库前建议.replace("\n", "").strip()
真实数据里存在少量异常项,比如第 237 名《小鞋子》的 score 是 "8.9" 但 rating_count 仅几十,说明该接口并非完全对应网页版 Top250 的排序逻辑 —— 抓完最好用 title 做交叉核对。

















