百度浏览器书签重复问题可通过三种方式解决:一是用Bookmarks Clean Up插件自动识别语义重复并删除;二是手动在收藏管理器中Ctrl多选批量删除;三是导出HTML后用Python脚本比对精准清理。

百度浏览器收藏夹里混入大量重复书签,导致查找目标网站时总要翻好几页、拖慢同步速度,甚至在导入导出时引发结构错乱——这不是个别现象,而是长期未整理的必然结果。
用Bookmarks Clean Up插件自动去重
这是目前唯一能真正识别语义重复(如标题不同但URL相同、或URL带参数差异但指向同一页面)的方案,适用于桌面版百度浏览器(Windows/macOS),需启用开发者模式安装CRX扩展。
1、访问 Chrome 网上应用店或 Crx4Chrome,搜索 Bookmarks Clean Up,下载最新版.crx文件。
2、在百度浏览器地址栏输入 chrome://extensions/ → 开启右上角“开发者模式” → 将下载的.crx文件直接拖入页面完成安装。
3、点击浏览器右上角拼图图标 → 选择该插件 → 点击【Scan for duplicates】启动扫描。
4、等待扫描结束,插件会按“完全重复URL”“相似URL(含UTM参数)”“同域名高频重复”三类分组列出,【务必先勾选“仅预览不删除”再点扫描】,避免误删正在调试的测试链接。
5、确认无误后,回到插件界面取消勾选“Preview only”,再点【Remove selected】,重复项将从书签树中物理移除,不可恢复。
手动批量删重(无需插件,适合少量重复)
当重复书签集中在同一文件夹、且数量不超过20条时,用原生方式更快:不依赖网络、不装插件、一步到位。
第一步:打开百度浏览器 → 右上角三点菜单 → 【书签】→ 【收藏管理器】。
第二步:在左侧书签栏中,找到目标文件夹并双击进入;右侧列表中,按住 Ctrl 键(Mac 为 Cmd) 逐个单击要删除的重复项(非连续时必须用 Ctrl 多选)。
调用百度文档解析API,支持18+格式,提取文本、表格、版面分析、OCR识别及RAG文档分块。适用于文档解析、文本/表格提取、结构分析、扫描件处理。触发词:文档解析、PDF解析、Word解析、表格提取、OCR、文档分析、提取文本、文档结构、扫描识别。
第三步:全部选中后,右键任意一个被选中的条目 → 选择【删除】→ 弹窗确认即可。
注意:若误用 Shift 键多选,会导致只选中首尾之间所有条目,极可能误删正常书签。
导出HTML+Python脚本精准比对
当你怀疑存在“标题雷同但URL不同”的伪装重复(例如多个镜像站、备案不同但内容一致),或需要保留原始顺序做审计留痕,就用这个离线可控方案。
方法一:导出与解析
1、在收藏管理器中点击右上角【⋮】→ 【导出书签】→ 保存为 bookmarks.html 到桌面。
2、新建文本文件,粘贴以下代码并保存为 dedupe_bookmarks.py:
import re
from bs4 import BeautifulSoup
with open("bookmarks.html", encoding="utf-8") as f: soup = BeautifulSoup(f, "html.parser")
links = [(a.get("href"), a.get_text().strip()) for a in soup.find_all("a", href=True)]
seen = set()
duplicates = []
for url, title in links:
if url and url not in seen:
seen.add(url)
else:
duplicates.append((url, title))
print("重复URL共", len(duplicates), "条:")
for u, t in duplicates: print(u, "|", t)
3、确保已安装 Python 3.8+ 和 beautifulsoup4(命令行执行 pip install beautifulsoup4)→ 进入文件所在目录 → 运行 python dedupe_bookmarks.py。
方法二:定位与清理
脚本输出的每条重复URL,复制前半段(如 https://example.com)→ 回到收藏管理器 → 顶部搜索框粘贴 → 回车 → 页面高亮所有匹配项 → 按住 Ctrl 多选 → 右键【删除】。


















