悟空浏览器需分场景结构化提取文本:阅读模式保正文、表格引擎导出CSV/Excel、OCR识别PDF/图片。三者分别解决复制漏行、表格错位、图片不可复制问题,且均绕过脚本拦截或手动命名限制。

您在悟空浏览器中打开一份政策通知、财报截图或电商比价页,需要把其中的条款原文、价格表格或联系方式快速转成可编辑文本,但复制粘贴总漏行、错位或带乱码——这时不能只靠长按复制,必须切换到结构化提取路径。
用阅读模式剥离干扰后精准复制正文
该方式适用于新闻稿、政府文件、博客文章等标准HTML排版网页,能自动过滤广告、侧边栏、浮动按钮,只留下语义清晰的段落流。
1、打开目标网页,等待页面完全静止(顶部进度条消失)。
2、点击地址栏右侧出现的书本图标→进入阅读模式。
3、页面重排完成后,长按任意一段正文→弹出菜单后点“全选”。
4、松手后立即点“复制”,系统提示“已复制X字”即表示成功。这一步比普通网页复制稳定得多,因为底层调用的是DOM文本节点直取,【不会受oncopy脚本拦截】。
对网页内嵌表格执行结构化提取
当遇到课程表、报价单、物流跟踪列表等HTML表格时,直接长按会选中不规则区域甚至跨列断裂;必须启用表格专用解析引擎。
方法一:右键菜单触发表格识别(PC端或安卓外接鼠标)
1、将鼠标悬停在表格任意单元格上→右键→选择“提取表格数据”。
2、弹出预览窗口,确认行列对齐无错位→点击“复制为CSV”。
方法二:移动端三指长按强制激活表格引擎
1、在表格区域用食指、中指、无名指同时长按约1.8秒,直到屏幕震动反馈。
2、松手后自动框选整个表格,顶部浮出工具栏→点“导出为Excel”。
3、生成的.xlsx文件默认保存至Download/Tables目录,文件名含时间戳,【无需手动命名,避免覆盖旧文件】。
从PDF或图片类网页中OCR提取文字与表格
当网页内容是扫描件PDF、海报图、验证码截图或Canvas渲染的图表时,常规复制完全失效,必须调用内置OCR模块。
第一步:确保网页已加载完成且图片处于可视区域(滚动到底部触发懒加载)。
第二步:在页面空白处长按2秒→弹出菜单→点“文字识别”。
第三步:进入裁剪界面→拖动边框精准框选含文字或表格的区域→注意避开水印、噪点和阴影边缘。
第四步:点击右下角“识别”→等待进度条走完→识别结果页自动分栏显示纯文本+表格视图。
第五步:点击表格区域右上角“复制为Markdown”→粘贴到Typora、Obsidian或微信对话框中,格式保留完整,表头与对齐不受影响。



















