需先完成本地网关部署、安装web-crawler等核心技能、启动agent-browser代理、配置加密凭证及结构化输入源,再编写明确锚点与策略的自然语言指令方可实现全网公开数据自动化采集。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望使用OpenClaw实现全网公开数据的自动化采集,但尚未配置基础环境或技能模块,则可能因缺少浏览器代理、反爬适配或定时调度能力而无法启动任务。以下是完成自动采集全流程的完整操作路径:
一、本地部署与网关初始化
OpenClaw需在本地终端完成一键式安装并启动网关服务,这是所有后续技能加载与指令执行的前提。未成功运行网关将导致nanobot无法注册、技能无法调用、指令无响应。
1、Windows用户以管理员身份打开PowerShell,执行:Set-ExecutionPolicy Bypass -Scope Process -Force; irm https://openclaw.ai/install-local-2026.ps1 | iex
2、macOS用户在终端中执行:curl -fsSL https://openclaw.ai/install-data-enhance-local-2026.sh | bash
3、安装完成后,系统自动启动网关并输出访问地址与端口(默认http://localhost:18789),同时提示生成Token。
4、执行openclaw token generate获取一次性访问令牌,并在浏览器中访问http://localhost:18789?token=your_token_here进入控制台。
二、安装核心采集技能模块
OpenClaw默认仅提供基础Agent框架,网页抓取、动态渲染处理、定时调度等能力需通过独立技能模块显式安装。缺失任一模块均会导致对应场景指令失败。
1、在终端中依次执行以下安装命令:clawhub install web-crawler
2、执行:clawhub install decodo-openclaw-skill
3、执行:clawhub install cron-scheduler
4、验证安装结果:运行clawhub list,确认输出中包含web-crawler、decodo-openclaw-skill、cron-scheduler三项且状态为active。
三、启用浏览器自动化代理服务
agent-browser是执行DOM解析、表单填写、滚动触发、元素等待等交互动作的底层依赖。未启动该代理时,任何含“打开”“点击”“提取”“等待”语义的指令均会报错“no browser tool available”。
1、执行安装命令:npx clawhub install agent-browser
使用 Apple MLX 通过 mflux 在本地生成图像,支持 FLUX.2 Klein 4B(快速,Apache 2.0 协议)和 Z-Image Turbo(高质量)模型
2、安装成功后,启动代理服务:npx clawhub start agent-browser
3、保持该终端窗口持续运行,不可关闭;若意外中断,需重新执行启动命令并等待日志显示“agent-browser v2026.3.31 listening on port 9222”。
4、可选增强:如需复用当前Chrome登录态(如小红书、B站等需鉴权站点),执行openclaw browser extension install,再按路径加载OpenClaw Browser Relay插件。
四、配置安全凭证与结构化输入源
硬编码账号密码存在泄露风险,且无法适配多环境切换;直接粘贴明文URL易导致指令泛化失败。应通过加密变量与外部数据源实现参数解耦与指令复用。
1、创建config.yaml文件,写入如下内容:
username: !secret zhangsan
password: !secret ${AES_ENCRYPTED_PASS}
targets:
- https://shop.a.com/list
- https://shop.b.com/items
2、在指令中引用变量:“在用户名框填 {{username}}, 密码框填 {{password}}”
3、运行时指定配置文件:openclaw nanobot execute --config config.yaml "打开{{targets.[0]}}, 等待.price元素出现"
4、如需对接飞书多维表或CSV作为动态输入源,先安装file-io技能:clawhub install file-io,再使用read_csv /path/to/urls.csv读取目标列表。
五、编写并执行多场景采集指令
OpenClaw通过自然语言解析生成动作序列,不同网页结构需匹配差异化的等待策略、提取规则与错误恢复机制。指令必须明确锚点元素、加载条件与输出格式,避免模糊表述。
1、静态页面采集指令示例:“打开https://news.example.com, 提取所有h3.title和time.pubdate文本,保存为/home/user/news_$(date +%Y%m%d).json”
2、JS懒加载页指令示例:“打开https://list.e.com, 滚动到底部, 等待.load-more按钮消失, 提取所有.product-card h2和.data-price”
3、多页并行指令示例:“并行打开{{targets}}, 等待.main-content元素全部出现, 提取每个页面的h1和span.price, 合并为CSV, 列名:标题,价格,来源URL”
4、带OCR验证码处理指令示例:“打开https://login.secure-site.com, 在用户名框填 {{username}}, 在密码框填 {{password}}, 若出现img.captcha,调用ocr-skill识别后填入验证码框,点击登录”

















