关键在于对齐NAT网关、中间防火墙与应用层的空闲超时阈值,避免任一环节提前断连;需逐层确认上游限制(如防火墙900秒、ALB客户端15秒),将nf_conntrack_tcp_timeout_established设为≥最短值(如3600秒),并配合TCP Keep-Alive与应用层心跳(周期设为上游超时的1/3~1/2)。

关键不是“调大一个超时值”,而是让NAT网关、中间防火墙、应用层三者的时间策略彼此对齐,避免某一方先动手断连。
确认并匹配各环节空闲超时阈值
长连接被掐,往往不是NAT网关自己断的,而是被它前面的运营商NAT、企业防火墙或负载均衡器提前回收。必须逐层摸清真实限制:
- 查企业出口防火墙策略:常见TCP空闲超时为30分钟(1800秒)或15分钟(900秒),需联系网络管理员确认,或用
tcpdump抓包观察FIN包触发时机 - 查云厂商ALB/NLB/专属网关限制:例如ALB专属网关作为服务端固定600秒,作为客户端仅15秒;NLB两端都是900秒——这些值不可改,只能适配
- 查你自建NAT网关的
nf_conntrack_tcp_timeout_established:默认可能仅900秒,必须设为≥上游最短超时值(如设为3600秒)
调整Linux内核连接跟踪参数
这是你可控的核心环节。NAT网关依赖conntrack表维持会话,超时和容量不足都会导致连接无声中断:
- 延长已建立TCP连接超时:
echo 3600 > /proc/sys/net/netfilter/nf_conntrack_tcp_timeout_established,并写入/etc/sysctl.conf持久化 - UDP超时一般保持60秒即可;若用于大块自定义协议,可同步提升至300–600秒
- 扩容连接跟踪表:
echo 524288 > /proc/sys/net/netfilter/nf_conntrack_max,并设置哈希尺寸echo 65536 > /sys/module/nf_conntrack/parameters/hashsize(需为2的幂)
配合应用层心跳与Keep-Alive
光靠内核参数不够,应用必须主动“说话”,防止中间设备判定为空闲:
- 启用TCP Keep-Alive:设
net.ipv4.tcp_keepalive_time=3600(1小时后开始探测),intvl=75,probes=9,确保在中间设备超时前触发保活 - 应用层心跳周期建议设为上游最短超时的1/3~1/2:比如防火墙是1800秒,心跳就设为300–600秒;MQTT Keep Alive通常设为300秒较稳妥
- 注意:HTTP/1.1 Keep-Alive的空闲计时是从响应结束才开始,不干扰流式返回,这点常被误解
规避TIME_WAIT与端口复用风险
大并发长连接下,端口耗尽或TIME_WAIT状态误回收也会表现为“连接突然断”:
- 检查
net.ipv4.ip_local_port_range是否足够宽(推荐32768 65535),避免SNAT端口池过早枯竭 - NAT网关自身不要开启
net.ipv4.tcp_tw_reuse=1:它作为中转设备,序列号不可控,易引发报文混淆 - 如有多个EIP,可为关键业务绑定独立公网IP+端口段,隔离资源竞争

















