Nginx 的 worker_connections 不提供排队或丢弃连接的直接监控指标,其作用仅为限制单个 worker 进程最大并发连接数;真正反映连接排队或丢弃的是内核队列溢出(ListenedOverflows/ListenDrops)、accept() 失败日志、stub_status 状态及系统文件描述符等综合指标。

Nginx 的 worker_connections 本身不直接提供“排队”或“丢弃”连接的监控指标,它只是单个 worker 进程能同时处理的最大连接数(包括空闲、活跃、等待 accept 的连接)。真正反映连接是否被排队或丢弃的,是操作系统内核行为和 Nginx 日志/状态模块的间接信号。
看连接是否在内核队列中堆积(SYN Queue / Accept Queue)
当新连接到达但 Nginx worker 还没调用 accept() 取走时,连接会暂存在内核的两个队列中:
- SYN 队列(半连接队列):存放完成三次握手前的 SYN 包。溢出会导致客户端重传 SYN,最终超时失败(现象是“连接拒绝”或“Connection timed out”)。
-
Accept 队列(全连接队列):存放已完成三次握手、等待 Nginx 调用
accept()取走的连接。溢出会导致内核丢弃连接(不发 RST),客户端可能看到 “Connection refused” 或 “Connection reset by peer”。
监控方法:
- 查看
/proc/net/netstat中的ListenedOverflows和ListenDrops字段(Linux 4.1+):awk '/^TcpExt/ && /ListenDrops|ListenedOverflows/ {print}' /proc/net/netstat
若ListenedOverflows持续增长,说明 accept 队列满;ListenDrops增长则表示已丢弃连接。 - 检查
/proc/sys/net/core/somaxconn是否小于listen指令的backlog值(默认 511)。若小于,内核会截断,导致队列实际容量受限。建议设为 ≥65535,并在 Nginxlisten中显式指定backlog=65535。
查 Nginx 是否因资源耗尽拒绝新连接
Nginx 自身不会“丢弃”连接,但会在以下情况返回错误或无法响应:
-
worker_connections 耗尽:所有 worker 的连接数达上限,新的
accept()调用会失败(errno = EMFILE 或 ENFILE),此时 Nginx 记录error.log:accept() failed (24: Too many open files)
这说明系统级文件描述符(ulimit -n)或worker_connections × worker_processes总量不足。 -
无空闲 worker 进程处理新事件:高并发下 event loop 过载,表现为延迟上升、超时增多,但日志通常无直接提示。需结合
nginx_stub_status中的Accepts(总接受数)、Handled(总处理数)、Requests(总请求数)比值判断 —— 若Accepts > Handled显著且持续,说明有连接被接受但未及时处理(可能卡在读请求头等阶段)。
启用并解析关键监控数据源
必须开启以下配置才能获得有效信号:
-
开启 stub_status 模块(编译时默认包含):
location /nginx-status {
stub_status on;
allow 127.0.0.1;
deny all;
}
定期采集Active connections、accepts/handled/requests、Reading/Writing/Waiting状态,重点关注Waiting是否长期高位(说明连接建立后未发请求,占着连接)。 -
调高 error_log 级别至 warn 或 notice:
error_log /var/log/nginx/error.log warn;
确保accept() failed、connect() failed、socket() failed等关键错误不被忽略。 -
用 log_format 记录 $connection 和 $connection_requests:
可识别单个 TCP 连接复用了多少次请求(HTTP/1.1 keepalive),辅助判断是否因长连接过多导致连接数虚高。
关联系统指标做综合判断
仅看 Nginx 不够,需同步监控:
-
系统文件描述符使用率:
lsof -p $(cat /var/run/nginx.pid) | wc -l(当前 nginx 进程打开数)
对比ulimit -n和worker_connections × worker_processes,留 10–20% 余量。 -
TIME_WAIT 连接数:
ss -s | grep -i time
过多 TIME_WAIT(尤其客户端是 Nginx 作为反向代理时)会占用端口和 fd,间接影响新连接建立。 -
网络丢包与重传率(如
netstat -s | grep -i "retransmitted"):
高重传可能掩盖真实连接问题,误判为“丢弃”,实为网络层不稳定。


















