Oracle RAC 11g中HAIP切换延迟主因是ocssd.bin每5秒轮询网卡状态且不响应netlink事件,导致主私网断开后需20–25秒才触发切换,期间心跳发向失效接口击穿misscount;需手动重启HAIP资源、预配置ARP策略、统一MTU并同步GPnP Profile。

ocssd.bin进程无法及时感知网卡状态变化
HAIP依赖CSSD(ocssd.bin)轮询底层接口状态来触发切换,但该进程在11g中默认每5秒检查一次网卡UP/DOWN,且不响应内核netlink事件。当主私网网卡物理断开时,ocssd.bin可能要等满4–5个周期才确认失效——这期间心跳包持续发向已死接口,超时累积直接击穿misscount(默认30秒),节点被驱逐而非平滑切换。
常见现象:crsctl stat res -t | grep haip显示OFFLINE前有长达20秒的INTERMEDIATE状态;ocssd.log里反复出现clssnmvDHBValidateNCopy: invalid interface但无后续动作。
- 验证方法:执行
strace -p $(pgrep ocssd) -e trace=ioctl,socket,poll 2>&1 | grep -i "eth\|bond",观察是否真在轮询备用接口 - 11g无法通过参数加速检测,必须靠外部干预:在主网卡down后手动执行
crsctl stop resource ora.cluster_interconnect.haip; crsctl start resource ora.cluster_interconnect.haip - 不要依赖
ifconfig eth1 down模拟故障——它不触发真实的链路层DOWN事件,需拔线或ethtool -s eth1 down
备用网卡未预加载HAIP地址导致ARP延迟
11g HAIP启动时只绑定当前标记为UP的接口,不会为备用网卡预分配169.254.x.x地址。当主网卡失效后,HAIP虽能接管,但需先完成ARP广播宣告新MAC+IP映射,而对端节点ARP缓存过期时间(默认30秒)未到,会继续向旧MAC发包,造成首包丢弃+TCP重传+GC等待飙升。
关键证据:tcpdump -i bond0 port 12345可见切换后前3–5秒无入向心跳包;arp -n | grep 169.254显示对端IP仍指向原MAC。
- 强制刷新ARP:切换后立即在所有节点执行
arp -d <peer_haip_ip></peer_haip_ip>(如arp -d 169.254.10.11) - 永久缓解:在
/etc/sysctl.conf加net.ipv4.conf.all.arp_ignore = 1和net.ipv4.conf.all.arp_announce = 2,让HAIP主动响应ARP请求 - 注意:11g不支持
ora.cluster_interconnect.haip资源的RESTART_ATTEMPTS属性,无法配置自动重试
MTU不一致引发UDP分片与丢包
主私网设MTU=1500,备用网卡若因驱动残留或脚本遗漏仍为默认9000,会导致HAIP发送的UDP心跳包(含Oracle私有头)超过1500字节,在主路径被分片、在备路径因MTU大而整包发出——交换机或网卡驱动对分片处理不一致,静默丢弃部分片段,表现为间歇性CRS-1611(75%心跳丢失)。
典型线索:ethtool -S eth2 | grep rx_ | grep -E "(frag|err)"显示rx_fragments非零;netstat -s | grep -A 5 "Udp:"中inErrors持续增长。
- 统一MTU是硬要求:所有私网接口(含bondX、ethX、enp0sX)必须执行
ip link set dev <ifname> mtu 1500</ifname>,不能只改ifconfig配置文件 - 验证命令:
ping -M do -s 1472 -I eth1 <peer_private_ip></peer_private_ip>(1472+28=1500),任一失败即说明链路不支持 - 11g不读取
/proc/sys/net/ipv4/ip_forward,但若该值为1,Linux会尝试转发HAIP流量,导致心跳包误路由——务必设为0
oifcfg配置未同步至GPnP Profile导致降级
11g集群启动时,ocssd.bin从GPnP Profile($GRID_HOME/gpnp/<hostname>/profiles/peer/profile.xml</hostname>)读取私网接口列表。若仅用oifcfg setif添加备用网卡但未重启HAS,或修改后未运行gpnpd刷新,CSSD仍按旧配置初始化,实际只监控主网卡,备用路径完全不可见。
错误表现:oifcfg getif显示两块网卡,但ifconfig -a | grep 169.254只看到主网卡的HAIP子接口;crsctl stat res -init -w "NAME = ora.cluster_interconnect.haip"输出中PLACEMENT字段为空。
- 强制同步:停集群后执行
crsctl stop has→rm -f $GRID_HOME/gpnp/<hostname>/profiles/peer/profile.xml</hostname>→crsctl start has,让GPnP重建Profile - 检查Profile内容:
grep -A 5 "interface" $GRID_HOME/gpnp/<hostname>/profiles/peer/profile.xml</hostname>,确认ifname和subnet与ip addr show输出严格一致 - 切记:11g的
oifcfg不校验物理网卡是否存在,填错名字(如把enp0s8写成enp0s9)会导致HAIP静默禁用,日志里几乎不报错
cluvfy comp haip自检工具,所有验证都得靠手工抓包、查日志、比对三处配置(oifcfg、ip addr、profile.xml),漏掉任何一环都会让备用网卡形同虚设。


















