需通过LoongCollector日志采集、日志服务告警规则、钉钉通知、internal-diagnostic_log心跳诊断及Prometheus表达式(Rancher环境)五步实现骡子快跑异常感知与响应。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望骡子快跑对运行过程中的异常行为进行及时感知与响应,则需依赖其底层日志采集与告警机制。骡子快跑本身不直接提供图形化告警配置界面,但可通过对接日志服务(如阿里云SLS或内置LoongCollector)实现异常行为的识别与通知。以下是具体配置方法:
一、启用LoongCollector日志采集
LoongCollector是骡子快跑默认集成的日志采集组件,负责捕获运行时日志并上报至日志服务,为后续异常识别提供数据基础。若采集器未运行或配置错误,将导致日志丢失,无法触发告警。
1、确认LoongCollector进程处于运行状态。可在容器环境中执行ps aux | grep loongcollector验证。
2、检查采集配置文件是否存在语法错误。标准路径为/usr/local/ilogtail/config.json,重点核对logstore名称、project名称与实际日志服务中的一致性。
3、验证日志是否成功写入。查看容器内/usr/local/ilogtail/loongcollector.LOG文件末尾是否有“send success”类记录。
二、配置日志服务内置告警规则
日志服务提供基于关键词、字段值或正则匹配的告警能力,适用于识别“连接超时”“认证失败”“内存溢出”等典型异常行为模式。告警规则需绑定到具体LogStore。
1、登录日志服务控制台,进入目标Project下的LogStore管理页。
2、单击LogStore名称,在右侧操作栏选择告警规则 > 创建告警规则。
3、在规则编辑区输入查询语句,例如:__topic__: mulerun_task AND "ERROR" | SELECT count(*) AS cnt GROUP BY __source__。
4、设置触发条件为cnt > 5,周期为5分钟,连续触发2次即告警。
5、保存前务必勾选启用告警选项,否则规则仅存档不生效。
三、配置钉钉通知渠道
告警信息需通过可靠通道触达责任人,钉钉机器人是最常用且低延迟的方式。通知内容应包含异常时间、来源IP、错误摘要三项核心字段,便于快速定位。
1、在钉钉群中添加自定义机器人,获取Webhook URL,并记录secret值。
2、返回日志服务控制台,进入告警管理 > 通知渠道 > 新建渠道。
3、选择类型为DingTalk,粘贴Webhook URL与secret,测试连通性。
4、创建告警规则时,在通知配置环节选择该已配置的钉钉渠道,并指定接收人标签(如@运维组)。
四、使用internal-diagnostic_log诊断心跳异常
骡子快跑任务若长时间无日志上报,可能表明Agent已崩溃或网络中断。可通过诊断日志中的心跳状态判断运行健康度,避免“静默故障”。
1、在日志服务中新建查询,输入:__topic__: logtail_status | SELECT ip, hostname, max(__time__) as last_heartbeat GROUP BY ip, hostname。
2、设定时间范围为最近30分钟,执行后观察各节点last_heartbeat时间戳是否滞后超过10分钟。
3、对滞后节点单独发起查询:__topic__: logtail_status AND ip: "192.168.1.101" | SELECT * ORDER BY __time__ DESC LIMIT 10,确认最后一次心跳携带的状态码是否为0(正常)。
4、若状态码非0或无返回结果,需立即登录对应主机检查loongcollector进程及网络连通性。
五、配置Prometheus表达式告警(适用于Rancher集成环境)
当骡子快跑部署于Rancher托管集群时,可复用Prometheus Alertmanager能力,通过指标维度监控异常。该方式适合检测资源级异常,如CPU突增、OOMKilled事件。
1、确认集群已启用监控功能,且Prometheus服务处于Running状态。
2、进入Rancher控制台,选择工具 > 告警 > 添加告警组,命名如“MuleRun-Resource-Alerts”。
3、添加新告警规则,表达式填写:container_cpu_usage_seconds_total{container=~"mulerun.*"} / on(instance, job) group_left(node) node_cpu_seconds_total{mode="idle"} * 100 > 90。
4、设置紧急程度为危险,持续时间为3分钟,通知渠道选择已配置的钉钉接收者。

















