Nginx因系统文件句柄耗尽导致epoll停摆,需分层排查并同步调优系统、用户、systemd及Nginx四级fd限制,同时堵住日志、upstream连接和open_file_cache泄漏源,并为epoll预留10%–30%安全余量。

当 Nginx 因系统文件句柄耗尽导致 epoll 模型“全面停摆”——表现为新连接拒绝、请求超时、worker 进程僵死甚至 silent crash——这不是单点配置问题,而是资源链断裂的连锁反应。核心在于:epoll 本身不创建句柄,但它依赖每个 socket、日志文件、缓存文件等都占用一个 fd;一旦系统 fd 耗尽,epoll_wait() 就会直接失败,Nginx 失去事件轮询能力,整个 I/O 模型实质瘫痪。
先确认是不是真“满”,而不是假警报
别急着改配置,先分层验证真实水位:
- 看系统全局:执行 cat /proc/sys/fs/file-nr,重点盯第二列(当前已分配且活跃的 fd 数),若接近第三列(file-max),说明系统级真的快满了
- 看 Nginx 进程:运行 cat /proc/$(pgrep nginx | head -n1)/limits | grep "Max open files",确认 Soft Limit 是否被卡在 1024 或 4096 这类低值
- 看实时占用:用 lsof -p $(pgrep nginx | head -n1) | wc -l 查单个 worker 实际打开数,再对比 limits 中的 soft limit —— 如果接近或等于,就是瓶颈所在
四层限制必须同步调通,缺一不可
Linux 文件句柄是“层层授权”机制,任何一层卡住,上层再大也没用:
- 系统级:编辑 /etc/sysctl.conf,设 fs.file-max = 2097152(200 万),执行 sysctl -p 生效;注意不能超过 /proc/sys/fs/nr_open,否则静默失败
-
用户级:修改 /etc/security/limits.conf,加两行:
* soft nofile 1048576
* hard nofile 1048576
确保 /etc/pam.d/common-session 包含 session required pam_limits.so,且 Nginx 必须由 login shell 启动(su 或 bash -c 不生效) -
systemd 级(最常被忽略):如果用 systemctl 管理 Nginx,limits.conf 完全无效。需编辑 /usr/lib/systemd/system/nginx.service,在 [Service] 下加:
LimitNOFILE=1048576
然后 systemctl daemon-reload && systemctl restart nginx -
Nginx 进程级:在 nginx.conf 的 main 块中设:
worker_rlimit_nofile 1048576;
并确保 worker_connections ≤ worker_rlimit_nofile / worker_processes(例如 8 个 worker,每个最多设 131072)
堵住泄漏源,否则调再大也撑不过几小时
句柄数持续上涨 ≠ 配置不够,大概率是没释放:
- 检查日志句柄泄漏:用 lsof -p $(pgrep nginx) | awk '$8 ~ /^REG/ {print $9}' | sort | uniq -c | sort -nr | head -5,看是否大量未滚动的 access.log/error.log 占着不放;启用 logrotate 并配 copytruncate 或发送 USR1 信号重开日志
-
检查 upstream 连接泄漏:若没配 keepalive,每个请求都会新建 TCP 连接,TIME_WAIT + socket buffer 双重吃 fd。务必在 upstream 块中加:
keepalive 200;
proxy_http_version 1.1;
proxy_set_header Connection ''; - 检查 open_file_cache 泄漏:若设了 open_file_cache max=10000 inactive=300s,但静态资源极多且访问随机,cache 会不断膨胀。建议设 inactive=30s(短生命周期场景)+ open_file_cache_valid 60s,并开启 open_file_cache_errors on 加速失效项清理
给 epoll 留出安全余量,别顶格设
epoll 本身也要占 fd(每个 epoll 实例一个),且 kernel 内部有管理开销。所以所有层级的上限值之间要留余地:
- systemd LimitNOFILE 和 worker_rlimit_nofile 设为 1048576(100 万),但实际 worker_connections × worker_processes 控制在 70–80 万以内
- 避免把 file-max 设到 nr_open 临界值,留 10% 缓冲(如 nr_open=2097152,则 file-max 设 1887436)
- 上线后持续观察:每 5 分钟跑一次 cat /proc/$(pgrep nginx | head -n1)/limits | grep "Max open files" 和 lsof -p ... | wc -l,画趋势图——稳定波动才可信,缓慢爬升就是泄漏


















