AgentSpace处理大批量文档提取的核心是任务拆解为可调度、可验证、可容错的小单元,需设计Router、Extractor、Validator三类协同Agent,各司其职;提示词须带强约束schema、上下文锚点及fallback机制。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

AgentSpace 中处理大批量文档信息提取,核心不是堆砌复杂提示词,而是把任务拆解为“可调度、可验证、可容错”的小单元。提示词要服务于 Agent 的分工逻辑,而不是让单个 Agent 去“读懂所有文件”。
明确角色与分工,别让一个 Agent 干所有事
大批量文档场景下,应设计至少三个协同角色:
- Router Agent:只看文件名、页数、首尾几行或 PDF 元数据,快速分类(如“合同/发票/简历/报告”),并打上结构化标签(如type:invoice, year:2024, vendor:XX公司)
- Extractor Agent:按 Router 标签接收同类文档,用固定 schema 提取(例如发票类只提invoice_no, date, amount, tax, vendor_name),不自由发挥
- Validator Agent:对 Extractor 输出做规则校验(如金额是否含¥符号、日期是否符合 YYYY-MM-DD、发票号是否非空),标出可疑项,不直接修改
Extractor 提示词必须带强约束 schema 和容错指令
避免“请提取关键信息”这类模糊表述。正确写法示例:
你是一个发票信息提取器。仅处理被标记为 type:invoice 的文档。
严格按以下 JSON Schema 输出,字段缺失填 null,不可编造:
{
"invoice_no": "字符串,可能含字母数字和短横线,如 INV-2024-001",
"date": "字符串,格式必须为 YYYY-MM-DD,从‘开票日期’或‘Date’附近提取,无则填 null",
"amount": "数字,单位为元,提取‘金额合计’或‘Total Amount’后的纯数字(去掉¥、逗号、括号)",
"tax": "数字,同 amount 规则,对应‘税额’或‘Tax’字段",
"vendor_name": "字符串,提取‘销售方名称’或‘Seller’后第一行完整名称,去空格,无则填 null"
}
若文档明显不是发票(如含‘职位:算法工程师’或‘体检报告’字样),输出 {"error": "not_invoice"}。
不解释,不补充,不输出任何额外文本。用文件 ID + 分块标识控制批量处理节奏
AgentSpace 支持传入文档 ID 和分块索引。提示词中可嵌入上下文锚点,提升稳定性:
- 在 Router 提示词中要求:“输出时带上 input_id: abc123.pdf 和 page_range: [1-2]”
- Extractor 提示词开头加一句:“当前处理的是 input_id: abc123.pdf 的第 1–2 页,请仅基于此范围提取”
- 这样即使某页 OCR 错乱,也不会污染整份文档结果,后续可单独重跑该分块
预置 fallback 和人工介入钩子
大批量中总有 2%–5% 的异构文档(扫描模糊、表格倾斜、多语言混排)。提示词末尾统一加:
若遇到以下任一情况,立即输出 {"fallback": true, "reason": "xxx"}:
- 文字识别率明显低于 60%(大量乱码、方框、 符号)
- 表格跨页且关键字段被截断
- 含中英日韩混合且无明确字段标识
系统将自动转交人工审核队列,你无需尝试猜测。


















