私网必须使用独立网段,优先从10.0.0.0/8或172.16.0.0/12中划出未被占用的子网(如10.10.20.0/24),严禁与公网、存储网、OCR/Voting Disk所在网段重叠,更不可使用169.254.0.0/16。

私网网卡选哪个子网才不和OCR/Voting Disk冲突
私网必须用独立网段,不能和公网、存储网络重叠,更不能碰 OCR 或 Voting Disk 所在网段——否则 cssd 启动直接失败,报 CRS-4678 或 ORA-15018。
- 优先从
10.0.0.0/8或172.16.0.0/12中划出未被业务占用的子网,例如10.10.20.0/24(避开办公网段10.0.0.0/16) - 查
ocrcheck -config输出的 Device/File Name,再用df -h看挂载点对应 IP;如果是 ASM diskgroup,用asmcmd lsdg+ls -l /dev/oracleasm/disks/反推后端存储 IP - 绝对避免用
169.254.0.0/16(Link-local),RHEL 7+ 默认禁用该网段 ARP 响应,oifcfg getif可能识别不到接口
两块私网网卡怎么配才真正冗余
不能手动给两张网卡配相同静态 IP,那样会触发 ARP 冲突、心跳乱序,ora.cluster_interconnect.haip 状态常为 OFFLINE。
- 必须启用 HAIP:用
oifcfg setif -global eth2/10.10.20.0:cluster_interconnect和oifcfg setif -global eth3/10.10.20.0:cluster_interconnect显式标记两接口 - 执行后运行
oifcfg getif,应看到两行同网段、不同接口;ifconfig | grep -A2 "haip"应显示类似eth2:1或eth3:1的子接口,IP 是169.254.x.x - 重启集群前,停掉所有节点的
NetworkManager服务,它会劫持 HAIP 的 ARP 通告
Linux 层要不要做 bonding mode=1
不要。HAIP 自己管链路检测和切换,底层做 bonding 反而干扰判断逻辑——比如 bond0 状态 up,但某 slave 断开,HAIP 还往失效链路上发心跳,cvuqdisk 校验失败率飙升。
- 物理网卡保持独立,不建
bond0或teamd,让 HAIP 直管eth2和eth3 - 若硬件强制要求 bonding(如某些刀片交换机),只用
mode=1(active-backup),且必须关miimon或设为 ≥100ms,否则和 HAIP 的misscount超时机制冲突
MTU 设成 9000 为什么没效果
改了 ip link set mtu 9000 却没提速,大概率是链路某处不支持巨帧,或 Oracle 流量根本没走 UDP 大包。
- 先确认硬件支持:用
ethtool eth2查Supports jumbo frames是否为 yes;查modinfo ixgbe | grep jumbo看驱动是否启用 - 所有节点、中间交换机、直连 DAC 线缆必须端到端支持,漏一环就退化成 1500 字节帧
- 抓包验证:
tshark -i eth2 -f "udp port 12560" -T fields -e frame.len | sort -u,看是否有 >1500 的包;同时查netstat -s | grep -i "fragments",若reasm fails持续增长,说明仍有分片
HAIP 地址是临时生成的,且只服务于 CSSD 进程通信;UDP 端口 12560(或 12599)连通性、ARP 行为、MTU 一致性,这三件事缺一不可,任何一环松动都会让冗余失效。


















