必须控制变量发起标准化对比请求以验证WorkBuddy多模型输出质量差异,包括准备5~8条覆盖四类负载的测试样本、统一输入与参数、关闭会话记忆、批量调用并捕获响应、最后通过内置看板进行四维自动打分与统计检验。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要验证WorkBuddy中多个已接入模型在相同任务下的实际输出质量差异,必须控制变量发起标准化对比请求,避免因上下文、格式或输入扰动导致结果不可比。不能只看单次响应是否“顺眼”,而要让每个模型处理完全一致的原始输入、相同约束条件和统一评估维度。
准备标准化测试样本集
从真实业务场景中提取5~8条高代表性的指令,覆盖文本生成、逻辑推理、代码理解、多跳问答四类典型负载。例如:“将附件中的销售数据表按区域汇总Q2毛利,并用中文写出关键发现”——该句含文件依赖、数值计算、语言表达三重要求,能暴露模型在结构化理解与自然语言组织间的断层。
每条指令需配套固定输入:同一份Excel文件(命名为test_q2_sales.xlsx)、统一的温度值0.3、最大输出长度限制为384 token。所有样本保存为test_suite_v2.json,字段包含id、instruction、file_ref、params。
【必须关闭历史会话记忆】测试前在「设置→会话管理」中禁用「跨消息上下文继承」,否则模型可能复用前序响应中的假设或缩写,污染本轮独立判断。
批量调用不同模型并捕获原始响应
方法一:使用WorkBuddy CLI执行离线轮询
在终端中依次运行以下命令,每次指定唯一模型标识符:
workbuddy-cli run --model qwen2.5-72b --input test_suite_v2.json --output qwen_results.json
workbuddy-cli run --model kimi-k2-thinking --input test_suite_v2.json --output kimi_results.json
workbuddy-cli run --model glm-5-turbo --input test_suite_v2.json --output glm_results.json
注意:CLI调用默认启用严格模式,自动过滤掉含“我无法”“我不确定”等拒绝响应的条目,并标记为status: "skipped",便于后续剔除无效样本。
方法二:通过HTTP API手动构造请求(适用于未注册CLI权限的测试员)
用curl向http://127.0.0.1:23456/v1/chat/completions发送POST请求,Header中携带Authorization: Bearer
这一步操作起来很简单,直接把文件拖进去就行。但务必确认每次请求的JSON body中不包含history字段——哪怕为空数组也不行,否则会触发隐式上下文加载。
执行结构化效果比对
第一步:导入三组JSON结果至WorkBuddy内置「模型对比看板」
打开「分析中心→模型效能评估」,点击「上传响应文件」,一次性选择qwen_results.json、kimi_results.json、glm_results.json三个文件。
第二步:启用四大维度自动打分
勾选「事实准确性」(比对数值、日期、名称是否与源文件一致)、「指令遵循度」(检查是否遗漏子任务、是否擅自增删步骤)、「语言流畅性」(基于本地轻量级语法模型评分)、「安全合规性」(扫描是否输出联系方式、身份证号等敏感模板)。
第三步:导出带置信区间的结果矩阵
点击「生成对比报告」,系统输出CSV格式的score_matrix.csv,含每条样本在各维度上的0~100分,以及模型间差异的t检验p值。若某模型在“事实准确性”上p


















