Linux客户端应主动探测+快速响应+可控重试:通过recv返回0、send/recv错误码、SO_KEEPALIVE调优及应用层心跳识别断连;重连前须close旧socket、重置变量、避免TIME_WAIT;采用指数退避+抖动+次数限制的重连策略;非阻塞connect配合select/epoll更可靠。

Linux socket 客户端要可靠应对网络异常断开,核心不是“等断开再重连”,而是主动探测 + 快速响应 + 可控重试。关键在于识别连接失效的信号、及时清理旧资源、避免盲目重试压垮服务。
识别连接是否已断开
TCP 连接静默断开(如服务器宕机、中间网络设备中断)时,客户端往往无法立刻感知。不能只依赖 send/recv 返回值,需组合多种判断:
- recv 返回 0:对端正常关闭连接(FIN),应立即关闭本地 socket 并触发重连
- send/recv 返回 -1 且 errno 为 ECONNRESET、EPIPE、ETIMEDOUT、ENETUNREACH:明确连接异常,需断开并重试
- 启用 SO_KEEPALIVE 并调优参数:内核自动发送心跳(默认 2 小时太长),建议用 setsockopt 设置 TCP_KEEPIDLE/TCP_KEEPINTVL/TCP_KEEPCNT,例如空闲 60 秒后每 10 秒探一次,3 次无响应即判定断连
- 应用层心跳:在业务协议中加入 ping/pong 帧,超时(如 30 秒无响应)即认为连接不可用,比内核 keepalive 更灵敏、可控
重连前必须做的清理动作
重连不是简单调 connect,不清理会导致 fd 泄漏、地址被占用、状态混乱:
- 关闭旧 socket:调用 close(),确保 fd 归还系统;若使用非阻塞模式,还需检查是否处于 CONNECTING 状态再 close
- 重置 socket 变量:将 sockfd 设为 -1,清空缓冲区,重置状态机(如从 CONNECTED → DISCONNECTED)
- 避免 TIME_WAIT 占用端口:客户端通常无需 bind,让内核自动分配临时端口;若必须 bind,可设 SO_REUSEADDR(仅对 bind 有效,不影响 connect)
重连策略要兼顾稳定与友好
盲目轮询或固定间隔重试容易引发雪崩或无效等待。推荐分阶段控制:
- 首次失败后立即重试(0 延迟或 100ms),排除瞬时抖动
- 后续采用指数退避:1s → 2s → 4s → 8s → 16s,上限建议 30s
- 设置最大重试次数(如 5–10 次),超限后暂停重连或上报告警
- 加入随机抖动(±10%),防止大量客户端同步重连冲击服务器
- 连接成功后重置计数器,下次断连重新开始退避周期
非阻塞模式下重连更可控
阻塞 connect 会卡死线程,非阻塞 + select/poll/epoll 是工业级做法:
- 创建 socket 后用 fcntl 设置 O_NONBLOCK
- 调用 connect,立即返回;若 errno == EINPROGRESS,说明正在连接中
- 用 select 或 epoll_wait 监听 socket 的可写事件(connect 完成时触发)
- 事件就绪后,getsockopt 获取 SO_ERROR 判断是否连接成功
- 失败则 close 并按策略延时重试,成功则进入通信循环


















