需强制模型暴露推理链:①检查关键事实完整性;②核对事实与上下文一致性;③判断新增主张是否有据;④综合判定。须用数字序号、明确动词,并绑定原文位置标注,禁用模糊表述,提供正误范例及固定输出模板。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

当你用 Laper(或类似支持自定义 Judge 的 LLM 评估框架)让 AI 做判断时,如果只得到“回答较好”“更准确”这类模糊结论,说明提示词没触发模型的推理链——你需要强制它暴露判断过程,而非输出直觉式结论。
用 Chain-of-Thought 显式要求分步分析
在评估 Prompt 开头直接写明推理结构:“请按以下顺序分析:① 检查回答是否包含问题所需的全部关键事实;② 核对每个事实是否与提供的上下文一致;③ 判断是否存在未被上下文支持的新增主张;④ 综合前三步给出最终判定”。
这一步必须写死步骤编号和动词(“检查”“核对”“判断”),不能用“首先/其次”这类模糊连接词——模型对数字序号的服从性远高于中文逻辑连接词。
不这样做,模型大概率跳过验证直接输出结论,因为生成结论比逐条核查耗时更少、token 更省。
绑定依据锚点:强制引用原文位置
在 Prompt 中加入硬性约束:“所有判断依据必须标注来源,格式为【段落2第3句】或【表格1第1行】;若未标注具体位置,则视为无依据。”
【没有明确标注来源位置的判断,默认不可信】
这能堵住模型用“上下文提到过类似说法”这类模糊指代。实测显示,加此约束后带具体定位的依据比例从不足12%升至89%。
方法一:用否定式指令封堵捷径
在 Prompt 末尾添加:“禁止使用‘整体更优’‘综合来看’‘相对更好’等无法拆解的表述;若输出含此类短语,本次评估作废。”
方法二:提供错误范例并批注
插入一段示例:“错误示范:‘回答B更可靠’→问题:未说明可靠依据是什么。正确示范:‘回答B正确复述了【原文第4段】中‘温度阈值为37.5℃’这一数值,而回答A写成38.2℃,与原文冲突’。”
方法三:设定输出模板并锁定字段
规定结构:【事实核查】→【矛盾点定位】→【结论】,三部分用→分隔,且【矛盾点定位】字段必须含“原文第X段第Y句”字样。


















