骡子快跑提供四步故障排查法:一、生成诊断快照分析进程与WebSocket异常;二、查看任务级错误日志定位根本原因;三、执行全链路健康检查验证各环节连通性;四、回滚至已验证稳定的配置快照恢复服务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用骡子快跑过程中遇到功能异常、任务中断或响应停滞等现象,系统已内置多层级可观测能力与诊断路径,可快速定位问题发生环节。以下是开展故障排查的具体操作方式:
一、启用运行时诊断快照捕获
该方法通过触发单次全栈状态采样,获取当前活跃Agent的进程树、内存堆快照、网络连接列表及最近10秒日志缓冲区,适用于突发性卡死、无响应或界面白屏等瞬态故障复现。
1、在MuleRun控制台右上角点击用户头像,选择「运维支持」→「生成诊断快照」。
2、勾选「包含系统级指标」与「捕获WebSocket帧记录」两项增强选项。
3、点击「立即执行」后等待8秒,系统自动生成snapshot_YYYYMMDD_HHMMSS.zip文件。
4、下载后解压,重点查看process_tree.txt中是否存在僵死子进程,以及ws_frames.log末尾是否出现连续ping timeout标记。
二、调取任务级结构化错误日志
该方法聚焦于某次具体失败任务的完整执行链路,日志按时间戳与模块层级归类,自动标注异常抛出位置、上游调用栈及HTTP/LLM调用原始响应体,便于识别是输入数据异常、依赖服务不可达还是模型推理超限。
1、进入「Drive」模块,点击左侧「任务历史」标签页。
2、在筛选器中设置「状态=Failed」与「时间范围=最近24小时」,定位目标任务ID。
3、点击该任务右侧「查看详情」,在弹出面板中切换至「错误溯源」子页签。
4、展开「Root Cause Analysis」区域,系统已高亮标出最可能的根本原因节点,例如“JSON解析失败:预期字段'price'缺失”或“LLM返回格式违反schema约束”。
三、执行端到端连通性验证测试
该方法模拟真实任务流路径,依次检测本地客户端、云端Runtime、知识库服务、外部API网关四段通信链路的健康状态,排除网络策略、DNS污染或证书过期等基础设施层干扰。
1、在控制台导航栏点击「Super Agent」旁的「Health Check」图标。
2、点击「启动全链路验证」按钮,系统将自动执行以下序列:
— 本地浏览器WebSocket握手延迟测量
— 向Runtime健康端点/api/v1/runtime/health发起GET请求
— 查询Knowledge索引服务/api/v1/kb/status返回码与响应体完整性
— 使用预置Token调用第三方API沙箱https://sandbox.mulerun.ai/test
3、每阶段完成后显示绿色对勾或红色叉号,若任一环节失败,点击对应项右侧「查看详情」,查看具体失败代码与建议修复动作。
四、回滚至已知稳定运行配置
该方法适用于因近期配置变更(如新插件启用、阈值调整、Knowledge更新)引发的系统性不稳定,通过原子化还原至最近一次全量校验通过的状态,实现分钟级服务恢复。
1、进入「Settings」→「版本管理」→「配置快照历史」。
2、在时间轴中找到标记为Verified & Stable的最近一条快照,其时间戳应早于问题首次出现时刻。
3、点击该快照右侧「加载并应用」,确认弹窗提示“将覆盖当前所有运行时配置,包括预警规则、插件启用状态与知识加载偏好”。
4、系统自动重启Runtime进程,约12秒后页面顶部显示“配置已回滚,服务恢复正常”。

















