合规采集需确认数据为公开可访问信息、请求行为模拟真实用户、用途限于合理使用边界,否则可能违反《反不正当竞争法》《个人信息保护法》及robots.txt协议。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您尝试通过QClaw类工具采集大众点评上的餐饮行业数据,但对操作是否符合平台规则与法律法规存疑,则需重点核查其行为是否落入《反不正当竞争法》《个人信息保护法》及大众点评robots.txt协议的约束范围。以下是判断合规性的关键路径:
一、确认数据来源是否为公开可访问信息
合规采集的前提是仅抓取平台明确向未登录用户或普通访客开放的页面内容。大众点评首页搜索结果、店铺列表页、已发布且未设权限的商户详情页(不含需登录才显示的用户手机号、订单号、完整身份证信息等)属于公开信息范畴。而需用户登录、短信验证、滑块验证后才加载的内容,或通过App内埋点接口返回的非标准HTTP响应数据,均不属于合法采集对象。
1、打开大众点评网页版(www.dianping.com),在无任何账号登录状态下执行关键词搜索;
2、检查浏览器开发者工具Network面板中,所有请求URL是否均为标准HTTP GET请求;
3、确认响应HTML中不包含“请登录后查看”“该内容仅对VIP用户可见”等提示文字;
4、比对robots.txt文件(https://www.dianping.com/robots.txt)中User-agent: *下Disallow字段是否禁止目标路径。
二、验证请求行为是否模拟真实用户
合规性不仅取决于数据是否公开,更取决于访问方式是否构成对服务器的干扰。高频、无延迟、固定UA、无Referer、无Cookie复用的自动化请求,易被识别为机器流量,违反《计算机信息网络国际联网安全保护管理办法》第十二条关于“不得从事危害网络安全活动”的规定。
1、设置随机请求间隔,相邻两次请求时间差控制在3–12秒之间;
2、每次请求携带真实浏览器User-Agent,并随会话动态更新Accept-Language、Sec-Ch-Ua等头部字段;
3、启用本地浏览器缓存机制,复用已获取的CSS/JS资源,避免重复请求静态文件;
4、禁用Headless模式下的特征标识(如navigator.webdriver为true),采用Playwright的bypass-cdp选项或Selenium的excludeSwitches参数消除自动化痕迹。
三、核查数据用途是否符合“合理使用”边界
根据《民法典》第一百一十一条及《数据二十条》精神,即使数据本身公开,若采集后用于直接替代平台服务、构建竞品数据库进行商业推销、或批量导出联系方式用于电话营销,则超出“为公共利益、学术研究、新闻报道等目的”的合理使用范围,可能被认定为不正当利用他人数据资源。
1、采集所得数据仅存储于本地环境,不上传至第三方云服务或公开数据库;
2、数据字段中主动过滤手机号、身份证号、用户ID、订单编号等可识别自然人身份的信息;
3、分析报告中不出现具体商户名称与原始评论的精确匹配,采用聚合统计(如“某城市火锅类店铺平均评分4.2”)方式呈现;
4、不将采集结果用于向商户发送招商、代理、代运营等商业邀约信息。



















