跨地域主从同步需解决网络、权限、延迟、校验四大问题:主库禁公网直连并强制SSL,授权限定IP;调大slave_net_timeout等超时参数;叠加离线归档与binlog推送;GTID切换前须校验一致性。

CHANGE REPLICATION SOURCE TO 是跨地域主从同步的起点,但直接配置就跑起来,90% 会失败。真正能落地的异地热备不是“配通就行”,而是要解决网络、权限、延迟、校验四个硬伤。
主库必须禁用公网直连,且强制 SSL
常见错误现象:ERROR 2003 (HY000): Can't connect to MySQL server 或 SSL connection error;更隐蔽的是密码明文传输、中间人劫持风险。
使用场景:主库在华东,从库在华北,走公网 IP 暴露 3306 端口是高危操作。
-
require_secure_transport=ON必须写进主库my.cnf并重启,否则从库即使配了 SSL 也会被降级为非加密连接 - 从库连接时必须显式指定
--ssl-mode=REQUIRED(MySQL 8.0+)或ssl=1(5.7) - 主库授权账号的
Host不能是'%',应限定为从库出口 IP,例如'203.205.128.45'(对应华北 NAT 网关) - 若用云厂商 VPC 对等连接或专线,优先走内网路由,此时可关闭 SSL 但需确保网络 ACL 和安全组只放行对端 CIDR
从库参数必须调大,否则频繁断连
常见错误现象:Seconds_Behind_Master 持续跳变、IO_THREAD STOPPED、日志里反复出现 Lost connection to MySQL server during query。
原因:跨地域 RTT 通常 >100ms,MySQL 默认超时值(slave_net_timeout=60,net_read_timeout=30)根本不够用。
- 主库和从库都要设
slave_net_timeout=60(建议最小 60,可设 120) - 从库额外加
net_read_timeout=30和net_write_timeout=60,防止大事务传输中断 - 执行
STOP SLAVE; SET GLOBAL slave_net_timeout = 120; START SLAVE;生效,无需重启 - 验证是否生效:
SHOW VARIABLES LIKE 'slave_net_timeout';
仅靠主从复制 ≠ 容灾,必须叠加离线归档 + binlog 推送
常见错误现象:误删表后发现从库也同步删了;主库磁盘损坏,从库因网络抖动已落后 2 小时;binlog 被自动清理,无法做 PITR(时间点恢复)。
真正可用的异地热备是三层链路:主从实时同步(秒级 RPO)+ mysqldump 离线归档(防逻辑错误)+ binlog 实时推对象存储(防单点故障)。
-
mysqldump --single-transaction --routines --triggers --databases db1 db2 > backup_$(date +%Y%m%d_%H%M%S).sql,避免锁表且保留过程/触发器 - 生成校验:
sha256sum backup_*.sql > backup_*.sql.sha256,和 SQL 文件一起 rsync 到异地 - 接收端必须运行
sha256sum -c backup_*.sql.sha256,输出OK才算有效 - binlog 推送脚本需监听
SHOW BINARY LOGS输出,用rsync --append或aws s3 sync按文件粒度上传,不依赖从库 IO 线程
GTID 模式下切换前必须校验一致性
常见错误现象:主库宕机后切从库为新主,应用连上立刻报错 Table doesn't exist 或主键冲突;或者切换后数据“看起来”一致,但某张表少了几百条记录。
原因:GTID 不保证所有事务都已执行完——Retrieved_Gtid_Set 和 Executed_Gtid_Set 有 gap,而 Seconds_Behind_Master=0 只代表中继日志拉完了,不代表 SQL 线程已重放完毕。
- 切换前执行:
SELECT MASTER_POS_WAIT('mysql-bin.0000xx', 123456, 30);(传统 binlog 模式)或SELECT WAIT_UNTIL_SQL_THREADED_AFTER_GTIDS('uuid:1-100', 30);(GTID 模式) - 确认
SQL_THREAD已追平:SHOW SLAVE STATUS\G中Retrieved_Gtid_Set==Executed_Gtid_Set,且Slave_SQL_Running_State显示Slave has read all relay log - 禁止跳过 GTID 错误(如
SET GLOBAL sql_slave_skip_counter = 1),这会导致后续同步彻底不可信


















