直接用Prometheus实现Linux资源异常告警的核心是编写告警规则文件(.yml),确保Node Exporter正常采集、Prometheus加载规则、Alertmanager正确分发,不依赖Grafana插件;需先验证Node Exporter运行及指标可查、Prometheus配置抓取任务并加载规则文件;推荐规则包括节点离线(up==0持续1分钟)、CPU使用率过高(100-(avg by(instance)(irate(node_cpu_seconds_total{mode="idle"}[5m]))100)>85持续2分钟)、内存不足((node_memory_MemAvailable_bytes/node_memory_MemTotal_bytes)100<15)、磁盘空间不足(node_filesystem_avail_bytes/(node_filesystem_size_bytes-1024^3)<0.1)。

直接用 Prometheus 实现 Linux 资源异常告警,核心是写好 告警规则文件(.yml),并确保 Node Exporter 正常采集指标、Prometheus 加载规则、Alertmanager 正确接收和分发告警。不依赖 Grafana 告警插件,避免其单实例记录缺陷。
确认基础组件已就绪
告警规则再准,也得有数据支撑。先验证三件事:
- Node Exporter 在每台目标机器上运行,端口 9100 可访问,且
curl http://IP:9100/metrics | grep node_cpu_seconds_total能返回指标 - Prometheus 的
prometheus.yml中已配置抓取任务,scrape_configs包含对应job_name: 'node_exporter'和 targets - Prometheus 启动时加载了规则文件路径,例如配置中含
rule_files: ["rules.d/*.yml"],且文件权限可读
编写实用的资源告警规则
规则要贴合真实运维场景,避免“一刀切”阈值。以下为推荐配置逻辑(存为 /etc/prometheus/rules.d/linux-alerts.yml):
Linux系统管理专家,覆盖12大模块:用户权限、SSH、存储、网络、systemd、防火墙、日志监控、备份恢复、TLS证书、Ansible、容器、IaC。提供配置、验证、加固、监控、备份、自动化、故障排查、回滚闭环。关键词:useradd、sudo、sshd_config、chmod、SEL...
-
节点离线:用
up == 0判断,持续 1 分钟即告,适用于快速发现宕机或 exporter 崩溃 -
CPU 使用率过高:计算非 idle 时间占比,表达式建议用
100 - (avg by(instance)(irate(node_cpu_seconds_total{mode="idle"}[5m])) * 100) > 85,持续 2 分钟触发,避免短时峰值误报 -
内存严重不足:关注可用内存比例,
(node_memory_MemAvailable_bytes / node_memory_MemTotal_bytes) * 100 ,持续 2 分钟,比单纯看使用率更能反映真实压力 -
磁盘空间告急:区分“使用率高”和“剩余空间少”。前者用
100 * (1 - node_filesystem_avail_bytes / node_filesystem_size_bytes) > 90;后者更实用——node_filesystem_avail_bytes / 1024 / 1024 / 1024 (剩余不足 5GB),尤其对日志盘、数据盘很关键 -
根分区只读:加一条
node_filesystem_readonly{mountpoint="/"} == 1,瞬间触发,这是典型故障前兆
设置合理标签与注释
标签(labels)决定告警怎么路由,注释(annotations)决定通知内容是否可操作:
- 必须带
severity标签,如critical、warning,Alertmanager 可据此分流 - 在
annotations中加入runbook链接,指向内部排错文档;dashboard指向 Grafana 对应仪表盘,点击就能查上下文 - 用
{{ $labels.instance }}和{{ $value }}动态填充,让每条告警自带机器名和具体数值,不靠人工查
验证与调试告警是否生效
写完规则别急着上线,按步骤验证:
- 执行
promtool check rules /etc/prometheus/rules.d/linux-alerts.yml检查语法 - 重启 Prometheus 或调用
curl -X POST http://localhost:9090/-/reload热加载 - 访问
http://prometheus:9090/alerts,看规则状态是否为 “Active”,且 “State” 显示 “Pending” 或 “Firing” - 手动触发测试:临时停掉一台机器的 Node Exporter,观察是否在 1 分钟后出现
InstanceDown告警

















