必须在升级前执行crsctl set server css_critical yes并重启集群,否则19c仍沿用11g最低节点号驱逐逻辑,升级后首次脑裂大概率误驱高负载节点;需验证返回yes且CSSD日志出现非零weight stamp。

crsctl set server css_critical yes 必须在升级前执行并重启集群,否则19c仍沿用11g的最低节点号驱逐逻辑,升级后首次脑裂大概率误驱高负载节点。
升级前必须显式设置节点权重
12c起引入的权重驱逐机制在19c中默认启用,但不会自动继承旧配置。若未手动设置 CSS_CRITICAL,节点权重保持为0,脑裂时退化为11g行为——按节点编号驱逐(即node2被干掉,哪怕它承载了80%业务流量)。
- 执行
crsctl set server css_critical yes后必须重启CRS:先crsctl stop crs,再crsctl start crs - 验证是否生效:
crsctl get server css_critical返回yes且 CSSD 日志中出现weight stamp非零值 - 多节点集群中,建议仅对主业务节点设权重,避免所有节点权重相同导致回退到lowest numbered node逻辑
OCR磁盘组冗余策略要提前检查
19c对OCR/Voting Disk的IO稳定性更敏感,升级过程中若OCR磁盘组因ASM rebalance卡住或心跳丢失,会直接触发误判式脑裂。
- 确认OCR磁盘组使用NORMAL或HIGH冗余,禁用EXTERNAL;
asmcmd lsdg查看USABLE_FILE_MB是否充足(至少保留20%空闲) - 升级前停掉非必要ASM实例,避免rebalance与升级进程争抢IO资源
- 禁止在升级窗口期内执行
ALTER DISKGROUP ... DROP DISK类操作
私网心跳配置不能依赖单路径
19c默认启用更激进的网络故障检测(misscount=60),若私网仅配置单网卡或单交换机链路,升级后轻微抖动就可能被CSSD误报为“network communication missing”。
- 必须配置双私网接口(如bond0和bond1),并在
grid/install/response/gridsetup.rsp中明确指定CLUSTER_NEW_PRIVATE_NETWORK=true - 升级后立即验证:
oifcfg getif确认两个私网接口均标记为cluster_interconnect - 禁用私网上的STP协议,防止交换机端口临时阻塞导致心跳超时
升级后第一个脑裂窗口期最危险
新集群启动后前30分钟是权重机制校准期,CSSD会反复比对各节点weight stamp和cohort size,此时若恰好发生网络抖动,日志里会出现大量 clssnmrCheckSplit: Waiting for node weights,容易误驱。
- 升级完成后的30分钟内,禁止任何计划内网络割接、存储LUN刷新、防火墙策略变更
- 紧盯CSSD日志中的
clssnmvDiskKillCheck和clssnmrCheckNodeWeight行,发现stamp不一致立即人工干预 - 该阶段若真发生脑裂,优先用
crsctl stop crs -f强制停止被驱节点的CRS,而非等待自动恢复


















