Nginx least_conn通过实时比较后端活跃连接数(含keepalive空闲连接)并归一化为conns/weight值,选取最小值节点转发请求;多节点相同时退至加权轮询,需配合健康检查、max_conns及合理keepalive配置才能生效。

测试多实例集群下 Nginx 的连接数均衡,核心不是测“Nginx 自身能建多少连接”,而是验证:在真实长连接场景中,各后端节点的活跃连接数是否随 least_conn + keepalive 配置动态趋近一致。重点看分布、看变化、看异常,而非单点峰值。
一、先确认连接模式是否适合测连接均衡
短连接(如 HTTP/1.0 或禁用 keepalive)下,连接瞬时建立又断开,$connection_requests 基本恒为 1,least_conn 效果等同轮询,测连接均衡无意义。必须满足以下任一条件:
- 后端服务启用 HTTP/1.1 keepalive 或 gRPC/WebSocket 等长连接协议
- Nginx upstream 显式配置了 keepalive N(如 keepalive 32)
- 压测客户端复用连接(如 wrk -H "Connection: keep-alive" 或 JMeter 启用 HTTP 采样器的 “Use KeepAlive”)
二、部署可观察的测试环境
在每台后端服务器上,统一部署轻量健康端点与连接统计能力:
- 暴露 /conn-stats 接口,返回当前 ESTABLISHED 连接数(可用
ss -tn state established | grep :8080 | wc -l实现) - Nginx access_log 中加入 $upstream_addr $connection_requests $upstream_response_time,便于分析请求落点与连接复用情况
- 开启 stub_status 模块(编译时需含 --with-http_stub_status_module),用于查看 Nginx 自身连接总数和活跃工作进程数
三、用压测工具驱动并采集连接分布
不依赖单一工具,组合使用更可靠:
- 用 wrk 启动长连接压测:
wrk -t4 -c500 -d60s --latency -H "Connection: keep-alive" http://nginx-lb/api/test(-c500 表示维持约 500 个并发连接) - 压测期间,每 5 秒并发调用所有后端的 /conn-stats 接口,记录各节点连接数序列
- 同时抓取 Nginx access_log 片段,用 awk 统计:
awk '{print $NF}' access.log | sort | uniq -c | sort -nr查看各 upstream server 被选中的频次 - 对比关键指标:各节点 ESTABLISHED 连接数标准差 / 平均值 应 ≤ 0.25;同一客户端 IP 的多次请求,$upstream_addr 应随连接复用发生自然切换,而非长期固定
四、识别失衡的典型信号
连接数不均衡往往不是算法失效,而是配置或环境干扰所致:
- 某节点连接数持续远高于其他(如 2 倍以上):检查该节点是否响应慢($upstream_response_time 显著偏高),导致连接堆积未释放
- 所有节点连接数都快速归零又暴涨:说明 keepalive 失效,客户端或后端主动断连,需检查 proxy_http_version 1.1 和 proxy_set_header Connection '' 是否配置
- error_log 出现 "upstream connection is busy":keepalive 连接池已满(如 keepalive 32 但并发连接超限),Nginx 被迫新建连接,least_conn 统计失效
- access_log 中 $connection_requests 长期为 1:连接未被复用,回归短连接逻辑,least_conn 退化


















