可采用四步法高效处理发票录入:一、用ToClaw内置poocr-vatinvoice2excel技能自动识别增值税发票并导出Excel;二、接入PaddleOCR提升多格式发票识别精度,再转为标准报表;三、直连飞书多维表格实现结构化数据自动归档与附件同步;四、本地部署pdfplumber+PyPDF2离线解析PDF发票,保障数据隐私。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您需要将大量发票信息快速、准确地录入电子表格,但手动操作效率低且易出错,则可能是由于缺乏结构化识别与自动导出能力。以下是解决此问题的步骤:
一、使用ToClaw内置poocr-vatinvoice2excel技能识别并导出
该方法依赖ToClaw平台预置的OCR识别技能,专为增值税发票设计,可直接提取非空字段并生成标准Excel格式,无需额外配置模型或API。
1、启动ToClaw客户端,确保已登录企业授权账号。
2、点击主界面“新增任务”,选择技能类型为poocr-vatinvoice2excel。
3、拖入待处理的发票图片或PDF文件(支持单张或多张批量上传)。
4、点击“开始执行”,系统自动完成识别、字段校验与去重。
5、识别完成后,点击“导出Excel”,保存至指定本地路径。
二、接入PaddleOCR技能增强多格式兼容性
当遇到电子发票、手写备注或非标版式发票时,原生技能识别率可能下降。PaddleOCR技能具备更强的版面分析与文本定位能力,可覆盖更广的发票变体。
1、在ToClaw中输入指令:帮我下载PaddleOCR文档解析技能。
2、系统跳转至ClawHub技能市场,自动安装paddleocr-doc-parsing技能包。
3、前往PaddleOCR官网完成手机号验证,获取API_URL与TOKEN。
4、返回ToClaw,输入指令:用我的API_URL和TOKEN配置PaddleOCR,由系统自动写入配置。
5、上传发票PDF,选择刚配置的PaddleOCR技能执行,识别结果以JSON结构返回。
飞书多维表格AI管家 — 自动化数据清洗、批量录入、报表生成、字段管理和智能摘要。适用于操作飞书多维表格(Bitable)、批量处理数据、自动生成报表/周报、整理数据或管理表格结构。触发词:多维表格、Bitable、飞书表格、自动报表、批量录入、数据清洗、飞书数据。
6、调用内置转换模块,将JSON字段映射至Excel模板列名,生成含发票号码、开票日期、销售方名称等16项字段的标准报表。
三、对接飞书多维表格实现自动归档
对于需同步至协作平台的场景,该方案跳过本地Excel中间环节,直接将结构化发票数据写入飞书多维表格,保障数据实时性与权限可控性。
1、确认飞书团队已开通多维表格,并创建好发票台账模板,包含字段:发票号码、发票类型、开票日期、购买方统一社会信用代码、销售方名称、合计费用金额、税额、附件等。
2、在ToClaw中上传一张发票,执行PaddleOCR识别后,获取完整结构化数据。
3、输入提示词:将该信息存入飞书多维表格,字段严格对应模板定义,发票附件同步上传。
4、ToClaw自动调用飞书开放API,完成记录新建与文件上传,返回操作成功ID。
5、刷新飞书多维表格页面,确认新记录已实时呈现,附件可在线预览。
四、本地部署pdfplumber+PyPDF2组合解析PDF发票
适用于对数据隐私要求极高、禁止上传外部服务器的企业环境。该方法完全离线运行,利用PDF底层结构解析技术提取文本与坐标信息,规避OCR误识风险。
1、确保Python环境为3.9及以上,执行命令安装依赖:pip install pdfplumber PyPDF2 pandas openpyxl。
2、将发票PDF文件放入./invoices/目录,确保文件名不含中文或特殊字符。
3、运行脚本pdf_invoice_extractor.py,脚本自动遍历目录,对每份PDF调用pdfplumber提取文本块及位置坐标。
4、依据预设规则(如“发票代码”后紧跟12位数字、“价税合计”右侧为金额数值),匹配关键字段。
5、将提取结果汇总为DataFrame,按“发票号码”去重后,输出至invoice_summary.xlsx,含工作表“原始数据”与“校验日志”。

















