最简单可靠的网页内容快照比对方式是用requests抓取response.content(原始字节)并计算SHA-256哈希值,需正确处理编码与压缩、设置User-Agent和超时,结合schedule定时轮询及系统通知提醒,并用lxml清洗无关节点后再哈希。

用 requests 和 hashlib 做轻量级网页内容快照比对
直接抓取页面 HTML 并计算 SHA-256 哈希值,是最简单可靠的检测方式。不依赖 DOM 结构或 JS 渲染,避免前端动态内容干扰,也绕过反爬策略(只要能 requests.get() 成功就行)。
常见错误是只比对 response.text 而忽略响应头和编码——比如服务器返回 gzip 压缩但没解压,或者声明了 charset=gbk 却用默认 UTF-8 解码,会导致哈希值每次都不一样。
- 务必用
response.content(原始字节)计算哈希,而非response.text - 加
headers={'User-Agent': 'Mozilla/5.0'},多数网站会拦截空 UA 的请求 - 设置超时:
requests.get(url, timeout=10),避免脚本卡死 - 首次运行时把哈希存到本地文件(如
cache_hash.txt),后续读取比对
用 schedule 库实现定时轮询,别用 time.sleep() 硬等
time.sleep(300) 在长时间运行时容易因异常中断后无法恢复;而 schedule 支持任务重试、日志记录,且调度逻辑清晰可维护。
注意:它不是异步库,所有任务串行执行。如果你要监控 10 个页面,每个请求耗时 2 秒,一轮就得 20 秒——别指望“每 5 分钟检查一次”真的精确到秒级。
立即学习“Python免费学习笔记(深入)”;
- 安装:
pip install schedule - 推荐写法:
schedule.every(5).minutes.do(check_page, url='https://example.com') - 主循环里加异常捕获:
try: schedule.run_pending() except Exception as e: print(f"Check failed: {e}") - 避免在
check_page函数里写while True:——这会让schedule失效
触发提醒时优先用系统通知,而不是硬编码邮件发送
发邮件要配 SMTP、账号密码、TLS 设置,一出错就静默失败;而本地通知(macOS 的 osascript、Windows 的 ToastNotification、Linux 的 notify-send)成功率高、调试快。
你真需要邮件或微信提醒?先确保基础通知能弹出来,再封装一层。别一开始就陷进 SMTP 认证里。
- macOS 示例:
os.system('osascript -e \'display notification "Page changed!" with title "Web Monitor"\'') - Windows(PowerShell):
os.system('powershell -Command "& { [Windows.UI.Notifications.ToastNotificationManager]::CreateToastNotifier(\'app\').Show((New-Object Windows.Data.Xml.Dom.XmlDocument).LoadXml(\'<toast><visual><binding template="ToastText01"><text id="1">Page changed!</text></binding></visual></toast>\')) }"') - Linux:
os.system('notify-send "Web Monitor" "Page changed!"') - 所有命令都建议包在
try/except里,防止系统不支持时报错中断主流程
忽略哪些内容?用 lxml 或 BeautifulSoup 提前清洗再哈希
很多页面含实时时间戳、广告位、统计脚本 URL,这些每天/每小时变,但你并不关心。硬哈希整页 HTML 必然频繁误报。
这时候不能靠正则硬删,得用解析器精准剔除无关节点。比如只保留 <main> 或 id="content" 区域,或过滤掉所有 <script>、<style>、class="ad-banner" 元素。
- 推荐
lxml:速度快,etree.tostring(tree, method='html', encoding='utf-8')输出干净字节流 - 用
tree.xpath('//div[@id="article-content"]')定位主体,再序列化 - 别用
bs4的.prettify()——它会重排空白符,影响哈希一致性 - 清洗后仍用
hashlib.sha256(html_bytes).hexdigest(),保持比对逻辑统一
真正难的不是写代码,而是定义“什么算变化”:是标题改了?正文新增一段?还是某个按钮文案变了?这个边界得你人工确认,工具只负责忠实反映差异。


















