测试不达标源于话术未在真实执行现场验证,需补全约束层与反馈环:定位漏执行、格式错、幻觉补全三类偏差;将模糊提示改为可执行契约;增加独立自检指令;用技能化结构替代话术堆砌。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

测试不达标,不是话术“不够好”,而是它没在真实执行现场被验证过。重点不在重写句子,而在补全缺失的约束层和反馈环。
先定位失效点,别改整段话术
打开失败用例,标出三类具体偏差:
- 漏执行:提示词写了【必须校验订单状态为“已发货”才调物流接口】,但Agent直接跳过校验调用了
- 格式错:要求输出“JSON数组,每项含id、reason、score”,结果返回了带说明文字的段落
- 幻觉补全:提到“按行业惯例”,而实际业务中根本不存在该惯例,模型自行编造规则
只针对这三处改,其余部分不动。改得越细,迭代越快。
把“提醒”换成“可执行契约”
原话术里出现“尽量”“建议”“注意”这类词,一律删掉。替换成带触发条件和动作的硬约束:
- ❌ “请尽量先确认用户是否登录” → ✅ “当输入中未包含user_id或session_token时,必须停止执行,输出{'status': 'blocked', 'reason': 'missing_auth'}”
- ❌ “建议参考最新版SOP” → ✅ “仅允许引用/src/policies/sop_v202609.md第3.1–3.4节内容,引用时须标注行号,不得超出该范围”
契约不是给模型看的,是给Harness执行时做自动拦截用的。
加一层校验话术,不是靠模型自觉
在主任务话术末尾,强制插入一段独立的自检指令:
- “完成上述操作后,请执行以下检查:① 输出是否含全部必需字段?② 是否调用了禁止工具?③ 所有数值是否在允许区间内?若任一检查失败,立即返回错误结构:{'error': 'validation_failed', 'failed_at': 'step_x', 'expected': '...', 'got': '...'}”
这个检查段不参与任务逻辑,只做兜底。它让错误显性化,便于后续用语义化测试自动捕获。
用技能化结构替代话术堆砌
如果多个测试失败集中在“选错工具”“混淆流程”,说明问题不在话术本身,而在能力组织方式:
- 把“查订单+验状态+发物流”拆成三个独立skill,每个skill定义明确的触发关键词、输入schema、失败返回码
- 系统提示词只保留调度逻辑:“收到用户请求后,仅从注册技能列表中选择一个最匹配的执行,禁止组合调用”
- 话术不再描述怎么做,只说明“要什么结果”,由skill实现保证行为一致
技能一旦定义清楚,话术修改就退居二线,迭代重心转向单技能测试与替换。


















