Nginx高可用双机自动故障切换依赖Keepalived+VRRP方案,通过VIP漂移、健康检查、防脑裂机制实现秒级接管;纯upstream故障转移仅适用于后端服务容灾,不解决Nginx自身单点问题。

实现 Nginx 高可用环境下的双机自动故障切换,核心是解决单点故障问题,让流量在主节点异常时秒级接管到备用节点。关键不在于 Nginx 本身有多强,而在于它如何与外部高可用机制协同工作——目前最成熟、生产广泛采用的是 Keepalived + VRRP 方案。
用 Keepalived 管理虚拟 IP(VIP)实现主备切换
Keepalived 基于 VRRP 协议,在两台 Nginx 服务器上部署后,对外暴露一个共享的虚拟 IP(如 192.168.1.100)。客户端只访问这个 VIP,实际由当前 Master 节点响应。
- 主节点配置
state MASTER,优先级设为较高值(如 150);备节点设为state BACKUP,优先级略低(如 100) - Keepalived 每秒发送 VRRP 心跳包,一旦备节点连续收不到心跳(默认 3 秒),就触发角色切换
- 切换时,备节点立即绑定 VIP,并主动向网关发送免费 ARP(gratuitous ARP),强制更新交换机/路由器的 MAC 表,确保流量立刻转向
- 主节点恢复后,若配置了
preempt_mode,可自动抢回 VIP;否则保持备节点继续服务
结合健康检查增强切换可靠性
仅靠网络层心跳不够——Nginx 进程可能卡死但系统仍存活,VRRP 不会感知。必须叠加应用层健康检查:
- 在 Keepalived 的
vrrp_script中定义检测脚本,例如:curl -f http://127.0.0.1/healthz || exit 1 - 将该脚本绑定到
vrrp_instance,设置权重变化(如检测失败则 priority -30) - 这样即使系统在线、网络通畅,只要 Nginx 返回非 200 或超时,备节点就能降权并更快升为 Master
避免脑裂与数据一致性风险
双机切换中最危险的是“脑裂”(Split-brain):主备同时认为自己是 Master,导致 VIP 冲突或后端写入混乱。需针对性防护:
- 使用独立的心跳线(如直连网线或专用 VLAN),不依赖业务网络,降低误判概率
- 配置
authentication(如 PASS 或 AH),防止非法节点加入 VRRP 组 - 若后端是 MySQL 或文件服务,必须同步机制配合:比如主从复制 + GTID,或 rsync 定时同步 Nginx 配置与静态资源目录
- 切换脚本中加入互斥校验,例如通过检查对方 MySQL 的
Seconds_Behind_Master是否为 0,再决定是否接管写权限
轻量替代方案:纯 Nginx upstream 故障转移(适用于后端服务)
如果只是希望 Nginx 反向代理后端多个应用服务器(如 Tomcat、PHP-FPM),而非自身做负载均衡器高可用,可直接利用 Nginx 自身能力:
- 在
upstream块中配置多台后端,启用max_fails=3 fail_timeout=30s - 添加
backup标记的服务器,仅当所有非 backup 机器失败时才启用 - 配合
health_check指令(需 stream 或 http 模块支持),实现主动探测与自动摘除 - 注意:这种方式无法解决 Nginx 自身宕机问题,仅适用于“Nginx 正常,后端挂了”的场景


















