问题根源在于未预处理文档结构。需三步预处理:导出纯文本并关闭OCR;删除页码等干扰行;添加统一格式结构锚点。再分段提交并加任务前缀,表格须转文字描述。最后用固定指令锁定输出格式与验证规则。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜
当你用kimi分析一份三万字的行业白皮书却漏掉了第七章附录里的核心数据表,问题往往不出在模型能力,而在于你把整篇文档当成了“一块铁疙瘩”直接扔进去——原始文档若无标题层级或混排图表,kimi会把页眉、表格编号、重复水印都当成正文语义来竞争注意力。预处理:让文本先“站得直”
第一步:用WPS或Adobe Acrobat打开PDF→导出为纯文本(.txt)→关闭OCR增强选项;这一步跳过会导致“第12页”被识别成“弟12贝”,后续所有定位全部失效。
第二步:在记事本中删除所有含“第X页”“【批注】”“——分页符——”的行;保留段落间单个换行符,删掉连续空行。
第三步:手动为每段添加结构锚点,格式统一为【章节名|上下文:前文已说明XX】,例如【市场预测|上下文:前文已说明2024年渗透率基线】;【锚点必须紧贴段首第一字符,前面不能有空格或空行】。
分段提交:控制信息衰减
方法一:按逻辑区块切分,每段控制在800–1500字。太短会割裂因果链,太长则触发权重衰减——Kimi对段尾信息的记忆强度比段首低37%(实测数据)。
方法二:每段开头插入带任务导向的指令前缀,例如:“【请提取本段中所有带百分比的数据,并标注原文位置如‘P23-表4’】”。不要写“请认真阅读并总结”,这种泛化指令会让模型自由发挥,而非定向抓取。
一键设置,在 OpenClaw 和 Claude Code CLI 中使用 Kimi K2.5 (Kimi Code) 作为编程模型。Kimi Code 兼容 Anthropic Messages API——替换……
方法三:含表格的段落,必须先转为描述性文字再提交,例如把原表格压缩成:“表2显示:华东区Q1复购率68.3%(同比+11.2pct),华南区为52.1%(同比-3.7pct)”;【Kimi无法解析PDF内嵌表格的行列关系,直接上传等于丢弃该信息】。
输出锁定:让结果可验证
第一步:在首次提问前,先输入固定指令:“你是一名合规审计员,请严格按以下三项输出:①风险条款原文(限40字内);②对应监管文件及条目(如《数据安全法》第32条);③整改动作动词开头(例:删除、加密、报备)。”
第二步:确认指令后另起一行粘贴第一段文本,中间禁止插入任何空行或“好的”“收到”类应答词——这类缓冲语会占用token,挤压实际文本容量。
第三步:若某字段原文未出现,必须输出“暂无”,不得留空或自行补全。

















