该报错本质是Nginx worker进程创建socket时因文件描述符(fd)耗尽被内核拒绝,需同步调优系统fs.file-max、用户limits.conf、systemd LimitNOFILE及nginx.conf中worker_rlimit_nofile与worker_connections四层限制。

这个报错不是 Nginx 自身故障,而是它在创建 socket 时被 Linux 内核拒绝——因为文件描述符(fd)用完了。Linux 把 socket、文件、管道都算作 fd,每个进程有上限,系统也有总池子。要彻底解决,得一层一层查清并打通:系统总容量 → 用户级限制 → 进程启动环境 → Nginx 自身配置。
先确认哪一层真卡住了
别改配置,先看数字:
- 系统总池子有多大:cat /proc/sys/fs/file-max——高并发建议 ≥ 2097152(200 万)
- Nginx 主进程实际能用多少:cat /proc/$(pidof nginx)/limits | grep "Max open files"——看 soft 和 hard 是否一致、是否达标
- 当前用了多少:lsof -p $(pidof nginx) | wc -l——接近上限就危险
- 启动 Nginx 的用户真实限制:sudo -u www-data bash -c 'ulimit -Sn; ulimit -Hn'(把 www-data 换成你实际的运行用户,如 nginx)
四层限制必须同步调高
缺一不可,否则前功尽弃:
- 系统总上限:编辑 /etc/sysctl.conf,加一行 fs.file-max = 2097152,再执行 sysctl -p
-
用户级限制:编辑 /etc/security/limits.conf,末尾加两行:
* soft nofile 65535
* hard nofile 65535
如果 Nginx 明确以 nginx 用户运行,也加上:
nginx soft nofile 65535
nginx hard nofile 65535 -
systemd 级限制(现代主流):新建 /etc/systemd/system/nginx.service.d/override.conf,写入:
[Service]
LimitNOFILE=65535
然后执行 systemctl daemon-reload && systemctl restart nginx -
Nginx 配置级:在 nginx.conf 的 main 块(http 块外、events 块同级)添加:
worker_rlimit_nofile 65535;
同时检查 events { worker_connections 65535; }——该值不能超过 worker_rlimit_nofile
验证是否真正生效
改完必须验证,不能只信配置文件:
- 重启 Nginx 后,立刻执行:cat /proc/$(pidof nginx)/limits | grep "Max open files"——输出的 soft 和 hard 应均为 65535
- 检查错误日志是否开始记录 alert 级事件:确保 error_log /var/log/nginx/error.log alert; 已配置且生效(nginx -t && nginx -s reload)
- 观察一段时间内 lsof -p $(pidof nginx) | wc -l 的峰值,是否稳定在新上限以内
别漏掉泄漏和冗余连接
调高上限只是治标。如果 fd 数持续缓慢上涨,说明有泄漏:
- 检查后端服务:数据库连接未 close、HTTP 客户端没复用、日志句柄没释放
- 启用 keepalive 减少反复建连:keepalive_timeout 60;
keepalive_requests 100;(放在 http 块) - 用 lsof -p $(pidof nginx) -iTCP 看哪些远端 IP 占了大量连接,排查异常客户端或爬虫


















