OpenClaw可一键完成PDF条款提取与多网站报价抓取:支持正则匹配、结构化抽取(CSV)、页码定位三种PDF处理方式;通过BrowserClaw依URL清单采集网页表格并导出Excel;还能用自然语言驱动跨平台表单自动填写与提交。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要在一天内处理37份合同PDF并提取关键条款,同时还要从5个不同网站抓取最新报价单填入Excel——OpenClaw能自动完成这两类高频办公任务,无需写代码、不依赖网络爬虫知识、所有操作本地运行。
批量提取PDF文档中的条款文本
方法一:用read命令配合正则提取固定字段
在OpenClaw控制台输入:read *.pdf | grep -E "(甲方|乙方|违约金|生效日期)"。
这一步会遍历当前目录所有PDF,自动解码文字后匹配关键词行。注意PDF必须是可复制文本型,扫描图转PDF需先走OCR Skill预处理。
方法二:结构化抽取→存为CSV
执行:extract --pattern "甲方:(.+?);乙方:(.+?);违约金:(.+?)" *.pdf → save clauses.csv。
【pattern语法必须用英文括号包裹捕获组,中文括号会导致提取失败】生成的clauses.csv每行对应一个PDF,三列分别是甲方、乙方、违约金数值。
方法三:带页码定位的精准提取
先运行read --page 3-5 *.pdf限定只读第3至5页,再接| extract "第[零一二三四五六七八九十]+条.*?。"提取法条原文。此法适合条款集中在特定页面的合同模板。
网页信息采集:一键抓取多网站报价单
第一步:准备目标网址清单
新建文本文件urls.txt,每行一个URL,例如:https://price.a.com/listhttps://quote.b.net/api/v1/priceshttps://catalog.c.org/2026/q2。
确保这些页面已登录且有权限访问,OpenClaw不会自动处理登录态跳转。
第二步:启动BrowserClaw采集器
在控制台运行:browserclaw --input urls.txt --selector ".price-table tr" --fields "产品名称,规格,单价,库存" --output quotes.xlsx。
BrowserClaw会逐个打开网页,定位价格表格的每一行(tr),按顺序提取四列内容,自动合并到quotes.xlsx的同一张Sheet中。
第三步:处理动态加载内容
若某网站价格由JavaScript异步加载,需加--wait-for ".price-loaded"参数,让BrowserClaw等待指定CSS类出现后再抓取。不加该参数可能导致抓到空表格。
自动填写并提交多平台表单
用自然语言描述即可触发:
“把客户名单表里的第2列邮箱,填进https://reg.d.co/login页面的邮箱框,第3列姓名填进姓名框,点提交按钮”
OpenClaw会自动解析句子,定位页面元素,逐行读取Excel数据,循环执行填表→提交动作。
注意表单字段名必须与页面HTML的name或id属性一致,否则识别失败。可先用inspect https://reg.d.co/login命令查看真实字段标识。
提交完成后,结果自动记录在submit_log.json中,含每条记录的状态(success/failed)和错误快照。


















