Keepalived 在网络分区时易引发双主和抖动,因其依赖 VRRP 心跳判断状态而非主动探测拓扑;应禁用 vrrp_strict、改用单播指定 unicast_peer、调大 advert_int 并启用 nopreempt,再结合 vrrp_script 健康检查实现可靠 VIP 切换。

Keepalived 在网络分区(Split-Brain)场景下,本身不具备自动仲裁能力,若配置不当,极易引发双主(两个节点同时持有 VIP)和集群抖动。它不主动探测网络拓扑完整性,而是依赖 VRRP 心跳通信是否可达来判断对端状态——一旦心跳中断,双方都可能认为对方已故障,从而各自升级为 MASTER 并绑定 VIP,造成 IP 冲突、流量错乱和业务中断。
关闭 vrrp_strict 是基础前提
该参数启用后会强制 Keepalived 严格校验 VRRP 协议合规性,但同时也禁用了关键的容错机制:比如禁止单播模式、禁止无 VIP 启动、禁止 IPv6 混用等。在网络分区时,这些限制反而会加剧异常行为。实际生产中应明确注释或删除 vrrp_strict 行,否则 Keepalived 可能因“协议不合规”直接退出,导致服务彻底不可用。
强制使用单播并指定 unicast_peer
多播(默认)在跨子网、VPC 或存在交换机 ACL 限制时极易失效,心跳包收不到不等于节点宕机,更可能是网络路径不通。改用单播可精准控制心跳目标,避免广播域干扰:
- 在
vrrp_instance块中添加unicast_src_ip和unicast_peer,明确指定本端源 IP 和对端监听 IP - 确保防火墙放行 VRRP 协议端口(IP protocol 112),而非 TCP/UDP 端口
- 避免依赖默认多播地址(如 224.0.0.18),尤其在云环境(如腾讯云 VPC)中多播不可用
调大 advert_int 并配合 nopreempt 稳住 VIP
心跳间隔(advert_int)过小(如默认 1 秒)会使 Keepalived 对短暂网络抖动过于敏感;过大则故障转移延迟升高。建议设为 2–3 秒,并搭配非抢占模式使用:
- 所有节点
state BACKUP,且主备均配置nopreempt - 仅靠
priority值决定初始 MASTER,恢复后不抢回 VIP - 即使发生分区,只要原 MASTER 未真正宕机,VIP 仍停留在原接管节点,避免来回漂移
引入外部健康检查作为辅助决策
VRRP 心跳只反映网络连通性,不代表业务可用。可在 vrrp_script 中定义脚本,检查本地服务端口、磁盘空间、甚至调用远端 API 验证上下游连通性:
- 脚本返回 0 表示健康,非 0 则降低本节点 priority(如减 20)
- 配合
track_script绑定到实例,使 VIP 切换不仅依赖心跳,还依赖真实业务状态 - 例如:检测 Nginx 是否响应 HTTP 200,或 MySQL 是否能执行
SELECT 1

















