需用CSV格式评测数据集(字段为input,expected_output,category)配合扣子Eval插件进行自动化测试,支持单次运行、变量注入及双版本对比,并通过筛选不匹配项、归类失败模式、导出日志和手动复现定位问题。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要快速验证自己在扣子平台开发的智能体或工作流在不同输入下的响应稳定性、准确性与合规性,而不是靠人工逐条试聊几十轮再凭感觉打分。
准备评测数据集
打开本地文本编辑器,新建一个 CSV 文件,第一行为字段名:input,expected_output,category。每行一条测试用例,例如:
“帮我查今天北京天气”,“北京今日晴,气温22–30℃,空气质量良”,“工具调用”
确保 input 字段内容是真实用户可能发送的自然语言,避免使用模板化句式;expected_output 必须是明确、可比对的字符串,不能写“回答合理即可”这类模糊描述。【字段名必须严格为 input 和 expected_output,大小写敏感,否则 Eval 工具无法识别】
保存文件为 test_cases.csv,放在桌面备用。
配置扣子 Eval 插件环境
登录 coze.cn → 进入「开发平台」→ 点击左侧菜单「评测中心」→ 点击右上角「+ 新建评测任务」。
在弹窗中选择「对话评测(Eval)」模式,点击「下一步」。
上传刚才保存的 test_cases.csv 文件;系统会自动解析并显示前5行样例,确认无误后点击「继续」。
关键一步:在「目标智能体」下拉框中,必须选择你已完成部署且状态为「已上线」的 Bot 或工作流。未上线的草稿版无法被 Eval 调用,测试将全部失败。
运行批量测试并查看原始结果
方法一:基础单次运行
点击「立即运行」,等待进度条走完(通常 1–3 分钟)。完成后页面跳转至结果页,表格中每行显示 input、模型实际输出(actual_output)、是否匹配(match)、耗时(ms)四列。
方法二:带变量注入的增强运行
勾选「启用变量注入」,在弹出区域填写 JSON 格式的上下文变量,例如:{"user_location": "上海", "subscription_level": "pro"}。这能让评测更贴近真实用户场景,但注意变量名必须与你的 Bot 提示词中声明的占位符完全一致,否则会被忽略。
方法三:对比双版本效果
在「对比模式」下,先选定当前线上版作为 baseline,再从历史版本列表中挑一个旧版作为 candidate。点击运行后,系统会并行调用两个版本,生成差异热力图——红色区块代表 candidate 版本错误率显著上升的输入类型,比如“价格咨询”类问题匹配率从92%跌至67%。
定位高频失败点
第一步:在结果页顶部筛选栏,点击「匹配状态 = 不匹配」。
第二步:观察 actual_output 列,快速归类失败模式:是工具未触发(输出含“我无法联网”)、格式错乱(缺失数字/多出符号)、还是事实错误(把“杭州西湖”说成“苏州园林”)?
第三步:对同一类失败,点击右侧「导出详情」按钮,下载 Excel 报告。报告中包含完整的请求 ID、时间戳、完整上下文日志,可用于向扣子技术支持提交精准问题反馈。
第四步:复制一条典型失败的 input,粘贴到 Bot 的调试窗口中手动重放。如果此时输出正常,说明问题出在 Eval 的会话隔离机制或超时设置上,需调整评测任务中的「单次响应超时」参数(默认8秒,可提至15秒)。


















