AionClaw支持本地多模态模型批量OCR,需先配置有效imageModel(如moonshot/kimi-k2.5),再通过CLI命令aionclaw extract-text --dir ./receipts/ --output receipts_result.json或图形界面拖入文件夹生成TXT,识别结果分别保存为结构化JSON或纯文本。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要用AionClaw一次性处理几十张产品截图、发票扫描件或会议白板照片,并把每张图里的文字分别转成可编辑文本——它不走云端OCR,也不依赖系统实况文本,而是调用本地多模态模型直接解析。
确认图片模型已正确配置
这一步跳过会导致后续所有图片识别失败,且无报错提示。执行命令:openclaw models status,检查输出中imageModel字段是否已设置为有效视觉模型(如moonshot/kimi-k2.5或openrouter/qwen/qwen-2.5-vl-72b-instruct:free)。若显示null或default,说明未配置图片模型。【必须先完成此步,否则批量识别将静默返回空结果】
配置方法:运行openclaw models set-image moonshot/kimi-k2.5。若主要模型偶发失败,建议再加一条回退:openclaw models image-fallbacks add openrouter/google/gemini-2.0-flash-vision:free。
用CLI命令批量提取并保存为JSON
这是最可控的批量方式,适合需保留原始文件名与识别结果映射关系的场景。
第一步:确保所有待处理图片存放在同一文件夹,例如./receipts/,格式为JPG/PNG/HEIC,无严重模糊或旋转。
第二步:在终端中执行:aionclaw extract-text --dir ./receipts/ --output receipts_result.json。该命令会逐张读取图片,调用本地视觉模型识别文字,最终合并为标准JSON数组,每项含filename和text字段。
第三步:打开receipts_result.json,验证前3条记录是否含完整文字。若某张图识别为空,大概率是该图存在反光、文字小于9pt或被水印大面积覆盖——AionClaw不会跳过错误图片,但也不会报错提醒。
通过图形界面拖入文件夹一键生成TXT
适合不想碰命令行、需要快速出文本文件的用户。启动AionClaw客户端后,直接将整个图片文件夹拖入主界面中央的虚线框内。
松手后界面右上角弹出「批量文字提取」浮层,勾选「按原文件名生成独立TXT」,点击「开始」。
进度条跑完后,系统自动在原文件夹同级目录创建_aionclaw_output/文件夹,里面每个TXT文件命名规则为[原文件名]_ocr.txt,内容为纯文本,段落换行基本对齐原文排版。
注意:此方式不支持自定义字段或结构化输出,仅输出连续文本流。若图片中含表格,会被压成一行,需后续人工分段。


















