python - 做爬虫的时候,怎么判断是否爬过呢
天蓬老师
天蓬老师 2017-04-18 10:17:25
[Python讨论组]

以前没有做过爬虫,现在项目有个需求 就是要爬取指定论坛的某个板块的帖子 下面如果出现 “机械XXX” 等关键字就要抓取通知管理员,

但是现在有个问题,怎么判断是否爬过呢, 目前这个爬虫第一版只爬帖子内容 不爬回复 , 目前想到的思路是 定时爬前20页的id 然后去数据库里对比是否有id 如果不存在此id再继续爬,不知道这个思路怎么样

但是第二版的话就要爬回复内容了 这个应该怎么实现呢? 各位大神有什么思路吗

天蓬老师
天蓬老师

欢迎选择我的课程,让我们一起见证您的进步~~

全部回复(3)
天蓬老师

每个html页面都是一棵dom树,你爬取的时候记录下每一个敏感词在节点中的位置,然后再数据库中对比,完活儿.

黄舟

请使用布隆过滤器

怪我咯

记录下爬去过的id的思路很对呀,即使是回复内容,也可以这样子做,记录下回复的id、时间等标识性信息就可以了

热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 意见反馈 讲师合作 广告合作 最新更新 English
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习
PHP中文网抖音号
发现有趣的

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号