高可用Graylog集群关键在于构建存储层双保险(MongoDB副本集+ES集群)、严配版本、统一状态与Nginx智能负载。需确保MongoDB带数据库名连接、ES禁用安全模块、各Graylog节点共享password_secret和root_password_sha2、Nginx配置健康检查与会话保持,并逐层验证ES绿色状态、MongoDB副本集成员状态及Graylog集群健康接口返回。

Linux 下部署 Graylog 集群实现海量日志高可用存储,关键不在“装多个 Graylog”,而在构建一个各层冗余、职责分明、版本严配的协同体系。单点故障常发生在 MongoDB 或 Elasticsearch,而不是 Graylog Server 本身。所以高可用不是堆节点,而是让存储稳、配置牢、流量通。
存储层必须双保险:MongoDB 副本集 + Elasticsearch 集群
MongoDB 不是装个服务就行,必须建副本集(至少 3 节点),否则 Graylog 配置一丢,整个集群就失联。Elasticsearch 更不能单节点跑生产环境——3 节点起步,禁用 xpack.security,显式设置 discovery.type: single-node(仅限单机测试)或 discovery.seed_hosts(集群模式),并确保 network.host 设为 0.0.0.0。
- MongoDB 连接字符串中必须带数据库名,例如 mongodb://192.168.31.211:27017,192.168.31.212:27017,192.168.31.213:27017/graylog?replicaSet=rs0
- Elasticsearch 版本要与 Graylog 大版本严格匹配:Graylog 5.x 对应 ES 7.10–7.17.9;ES 8.x 和 6.x 均不兼容
- 所有节点需配置 hosts 解析,关闭 SELinux 和防火墙对应端口(27017、9200、9300、12201、9000)
Graylog Server 节点要共享状态,不能各自为政
多个 Graylog Server 不是独立运行,而是通过共用 MongoDB 副本集读写配置、共用 Elasticsearch 集群读写索引,形成逻辑上的一体化服务。每个节点的 graylog.conf 中必须保持以下一致:
- password_secret 全局唯一且所有节点相同(用于加密敏感字段)
-
root_password_sha2 提前用
echo -n "yourpassword" | sha256sum生成并填入,否则服务启动即退出 -
rest_listen_uri 和 web_listen_uri 设为
http://0.0.0.0:9000/,确保 Nginx 能反向代理 -
elasticsearch_hosts 指向全部 ES 数据节点,如
http://es01:9200,http://es02:9200,http://es03:9200
Nginx 作负载均衡器,不只是转发流量
Nginx 是对外统一入口,承担健康检查、会话保持和请求分发三重任务。不能只做简单轮询,需配置主动健康探测,自动剔除宕机的 Graylog 节点:
- 在 upstream 块中启用 health_check,路径指向
/api/system/health - 使用 ip_hash 或 sticky cookie 保证 Web UI 操作会话不中断
- 暴露 9000 端口给用户,同时开放 12201(GELF UDP)、514(Syslog TCP/UDP)等输入端口,并映射到后端 Graylog 节点
- 建议开启 gzip 压缩和 proxy_buffering,提升大日志查询响应速度
验证不能只看页面,要逐层查状态
访问 http://your-nginx-ip:9000 能打开界面 ≠ 高可用已生效。真正可靠的状态需逐层确认:
- curl -s http://localhost:9200/_cat/health?v → 状态为 green,且 node.count ≥ 3
- mongo --eval "rs.status().members.map(m => m.stateStr)" → 所有成员显示 PRIMARY 或 SECONDARY
- curl -s http://graylog-node1:9000/api/system/health | jq '.cluster' → 返回包含全部在线 Graylog 节点 ID
- 发送一条 GELF 日志后,在任意 Graylog 节点 UI 中都能搜到,说明数据写入和索引同步正常


















