Nginx + Keepalived 双机热备落地关键在细节:网卡名与VRRP通信需一致,防火墙放行协议112;健康检查须curl真实响应而非仅查进程;weight设为-5至-10确保及时切换;主备必须NTP时间同步防脑裂。

直接上干货:Nginx + Keepalived 双机热备不是装完就高可用,真正落地时,90%的问题出在细节没对齐、检查没到位、假活没识别。下面这些坑,都是生产环境反复验证过的关键点。
网卡名与网络连通性必须严格一致
Keepalived 依赖 VRRP 组播报文通信,一旦网卡名不一致(比如主节点是 ens33,备节点是 eth0),VIP 就无法漂移;更隐蔽的是,两台机器虽能 ping 通,但 VRRP 报文被交换机 ACL 或 VLAN 隔离,导致“心跳失联”误判为主节点宕机。
- 执行 ip -br a 确认两台机器网卡名完全相同,配置中
interface字段必须精确匹配 - VRRP 使用协议号 112(非端口),防火墙需放行:
iptables -A INPUT -p vrrp -j ACCEPT(或 firewalld 中添加vrrp服务) - 生产环境建议将心跳走独立管理网段,与业务流量物理/逻辑隔离,避免拥塞引发脑裂
健康检查不能只看进程,必须验证真实响应
很多故障源于“Nginx 进程在,但 80 端口无响应”——比如配置加载失败、worker 崩溃卡死、后端全挂导致超时堆积。此时若仅用 killall -0 nginx 检查,Keepalived 会误判服务正常,VIP 不切换,用户持续报错。
- 脚本必须用
curl -I http://127.0.0.1:80 --connect-timeout 2 --max-time 3 >/dev/null实际探测 HTTP 响应 -
weight设为 -5 到 -10,确保检测失败后优先级足够低,立即触发切换 - 脚本路径在 keepalived.conf 中写绝对路径,并确认
keepalived进程有执行权限(建议加script_user root)
时间同步与脑裂防护缺一不可
主备节点时间差超过 1 秒,可能导致 VRRP 状态抖动;更危险的是,网络分区时主备同时认为对方失联,双双绑定 VIP,造成客户端请求随机失败——这就是脑裂。
- 两台机器必须启用 NTP 同步:
systemctl enable chronyd && systemctl start chronyd,并验证chronyc tracking输出偏移 - 禁用
vrrp_strict模式(它会校验所有 VRRP 规范字段,反而在某些虚拟化环境中导致心跳失败) - 配置
garp_master_delay 1和notify_master /path/to/notify.sh脚本,用于切换时清理 ARP 缓存、通知运维
配置一致性与验证动作不能跳过
看似简单的“双机配置一样”,实操中常因路径、权限、SELinux、nginx.conf 的 user 字段差异导致切换后服务起不来,用户访问 502。
- Nginx 配置文件、SSL 证书路径、静态资源目录权限(如
/usr/share/nginx/html)必须完全一致,且属主属组匹配 nginx 运行用户 - 切换前务必执行:
nginx -t(语法)、ip a | grep vip(初始状态)、curl -I http://vip(连通性) - 模拟故障时,不要只停 nginx,要分别测试:
systemctl stop nginx、reboot、断网三种场景,观察 VIP 漂移时间和服务恢复情况


















