不能直接爬取京东或天猫的完整商品评论——平台反爬极严且法律明确禁止,强行突破将触发风控、IP封禁及合规风险;真实评论藏于XHR动态接口中,需正确构造带签名的请求参数与Headers,而Selenium等方案因验证码、特征检测和性能问题难以稳定运行;合法替代路径仅有京东/淘宝开放平台的脱敏聚合接口或付费第三方服务,均不返回原始评论文本。

不能直接爬取京东或天猫的完整商品评论——不是技术做不到,而是平台反爬极严,且法律与协议层面明确禁止,强行突破会触发风控、IP封禁,甚至面临合规风险。
为什么 requests + BeautifulSoup 拿不到真实评论?
京东和天猫的商品详情页(包括评论区)大量内容由 JavaScript 动态渲染,requests 获取的 HTML 源码里基本没有评论数据;真实评论藏在 XHR 请求中,且请求地址、参数(如 callback、score、sortType)、Headers(尤其是 User-Agent、Referer、X-Requested-With)都带签名或时效性校验。
- 京东评论接口类似
https://club.jd.com/comment/productPageComments.action?...,但需携带有效的callback和加密的productId - 天猫(淘宝系)走的是
https://rate.taobao.com/detailCommon.htm?...或更隐蔽的https://h5api.m.tmall.com/h5/mtop.relationrecommend.recommend/1.0/类接口,参数含_aop_signature或时间戳+salt签名 - 不带正确
Cookie(尤其是trackid、thw、uc1等)或未模拟登录态,返回空数据或 403
用 selenium 能绕过吗?
能加载出评论,但实用性极低:页面滚动加载、验证码拦截、滑块验证(尤其是京东高频触发)、动态 User-Agent 切换失败,都会导致中途断掉;而且速度慢、资源占用高、无法稳定抓取分页——一个商品 1000 条评论,跑完可能要 20 分钟以上,还大概率被识别为自动化行为。
快速生成专业的 Python 脚本和应用代码。一键创建完整项目结构,支持CLI、API、爬虫、Bot、Django等多种项目类型,包含完整的项目结构、配置文件、依赖管理、测试、README和文档。
- 京东对
webdriver特征检测非常成熟,document.webdriver、navigator.permissions、chrome.runtime等字段稍有异常就进验证码队列 - 天猫会校验
canvas指纹、WebGL渲染特征,普通无头模式几乎必挂 - 即使成功,每次只能拿当前视口可见的几十条,需反复
scrollIntoView+time.sleep,极易因响应延迟漏数据
有没有合法、可持续的替代方案?
有,但必须接受「不全」和「有门槛」:京东开放平台(jd.open.jd.com)和淘宝联盟(taobao.com/union)提供有限的评论摘要接口,仅面向已备案的开发者,且只返回脱敏后的统计信息(如“好评率 98%”、“提及关键词:物流快、包装好”),不返回原始文本、用户名、时间戳等敏感字段。
立即学习“Python免费学习笔记(深入)”;
- 京东接口需申请
product.comment.get权限,调用时传skuId和page,但返回字段不含content,只有commentCount、goodCount等聚合值 - 淘宝联盟的
taobao.tbk.item.recommend.get也不含评论原文,仅支持按类目推荐商品 - 第三方数据服务商(如魔镜、慢慢买)提供清洗后的评论 API,但需付费,且数据非实时,延迟通常 1–3 天
真正想分析用户原声,唯一靠谱路径是:找平台认证的数据合作方,签协议、走审核、接授权 API。自己硬爬,短期可能跑通几条链接,长期必然失效,还容易踩到《反不正当竞争法》第十二条和《刑法》第二百八十五条的边界。


















