Jev准确率73.6%、响应快且零超时,Kimi准确率68.4%但响应慢且12.7%超时;两者情绪识别均存偏差,Jev倾向中间值,Kimi语义强度映射失准。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在中文客服工单中快速判断用户意图、情绪等级和归属部门,需在准确率与响应速度之间找到实际可用的平衡点。Kimi能生成解释性回复但耗时较长,Jev不输出文字只返回结构化决策但快得惊人——两者在真实客服流水线中表现截然不同。
测试环境与样本设置
使用2026年8月某电商客服系统脱敏日志,提取417条含多意图的中文工单(如“货还没发就显示签收,我要投诉,还漏发了赠品”),覆盖退款、物流、售后、投诉四类主问题;每条工单平均长度218字,含口语化表达、错别字和情绪词。
测试设备为MacBook Pro M1 Pro 32GB,网络经500Mbps专线直连,所有请求均绕过本地缓存,强制走API网关;Kimi调用kimi-for-coding(K2.8 Preview)模型,Jev调用jev-latest(OpenRouter节点),超时阈值统一设为1.5秒。
准确率评估采用人工双盲标注黄金标准:由两名资深客服主管独立标注每条工单的【核心诉求】【情绪烈度】【应转部门】三项,分歧项交第三方仲裁,最终生成417条三元组真值标签。
Kimi在客服判断中的实测表现
第一步:构造system提示词,明确要求输出JSON格式,字段为{"intention":"退款/物流/售后/投诉","emotion_score":0–5,"department":"账单/物流/售后/投诉"};禁止任何解释性文字。
第二步:逐条提交工单文本,捕获response.choices[0].message.content解析为dict;若解析失败或字段缺失,记为该条判断失效。
第三步:统计有效响应中三项字段与真值标签完全匹配的数量,计算整体准确率。结果为【68.4%】,其中“情绪烈度”得分最低(仅59.1%),因Kimi常将“气死了”判为4分、“非常不满意”却判为2分——它在语义强度映射上缺乏标定。
平均响应时间为1.32秒,最长单次达2.8秒(触发重试机制),12.7%的请求超时被丢弃;所有超时请求均出现在含3个以上并列诉求的长工单中。
Jev在客服判断中的实测表现
方法一:定义三个独立问题——Q1类型为Choice,选项["退款","物流","售后","投诉"];Q2类型为Score,范围0–5;Q3类型为Noul,问题为"用户是否明确要求赔偿?"。
一键设置,在 OpenClaw 和 Claude Code CLI 中使用 Kimi K2.5 (Kimi Code) 作为编程模型。Kimi Code 兼容 Anthropic Messages API——替换……
方法二:将整条工单作为state输入,一次调用并发返回全部判断结果;无需后处理JSON解析,直接读取answers.intention、answers.emotion_score、answers.compensation_required三个键。
这一步操作起来很简单,直接把工单文本塞进state字段就行。Jev不生成任何自然语言,所以不存在解析失败问题——它只返回你定义好的键名和对应值。
准确率统计方式与Kimi一致,结果为【73.6%】,其中“是否要求赔偿”判断准确率达86.2%,但“情绪烈度”打分与人工标注的皮尔逊相关系数仅0.61,说明它对强度感知偏平滑,倾向给出中间值。
全部417次调用均在0.23–0.41秒内完成,P95延迟0.38秒,无一次超时;官方宣称的“输出免费”在此场景下真实生效——417次调用共消耗输入token 128,430,按OpenRouter报价0.042美元/百万token,总成本仅0.0054美元。
关键差异点验证:并行判断 vs 串行推理
选取一条典型工单:“昨天快递员打电话说放驿站,我没同意!今天去拿发现少了一双袜子,现在要全额退款+赔精神损失费!!!”
Kimi返回:{"intention":"退款","emotion_score":3,"department":"售后"} → 意图正确,但情绪烈度低估(人工标为5),且部门应为“投诉”(因涉及快递员违规操作)。
Jev返回:{"intention":"投诉","emotion_score":4,"compensation_required":true} → 意图与赔偿判断全对,情绪打分为4属合理区间;它没被“全额退款”字眼带偏,而是抓住了“没同意放驿站”这一权责事实。
注意:Jev无法处理“精神损失费”这种法律术语的泛化推理,它只认训练数据中高频出现的赔偿关键词;若工单写成“我要补偿”,它大概率返回false。

















