关键在于Nginx日志轮转需通过状态确认与信号协同完成fd切换:先发USR1通知master再逐个通知worker,用lsof轮询验证各worker的fd已切换至新日志(仅剩1个),配合flock加锁防并发冲突,跳过空日志并校验inode变更,推荐使用logrotate配合sharedscripts和postrotate实现可靠轮转。

关键在于让 Nginx 所有 worker 进程在旧日志被移动后、新日志开始写入前,完成文件描述符(fd)的切换——不能靠“等时间”,而要靠状态确认和信号协同。
确保 USR1 信号真正生效后再操作
发 kill -USR1 只是通知 master,master 再逐个通知 worker。高并发下部分 worker 可能延迟响应,导致仍往旧文件(已被 mv)写入。必须验证 fd 是否已释放:
- 用 lsof -p $PID | grep 'access.log' 检查该 worker 进程打开的日志文件数量;初始为 2(旧 + 新),待回落到 1(仅新)再继续后续步骤
- 避免简单 sleep 1,改用轮询:每 0.2 秒检查一次,超时 5 秒则告警并中止
- 脚本中需遍历所有 worker PID(ps -o pid= -C nginx --no-headers | grep -v $(cat /var/run/nginx.pid)),逐个校验
用 flock 加锁防止并发切割冲突
多个 cron 实例或手动执行脚本同时运行,会触发多次 mv 和 USR1,极易造成 fd 状态混乱:
- 在脚本开头加 flock -n /tmp/nginx-logrotate.lock,获取失败则直接退出
- 锁文件路径统一固定,且不随日期变化,避免不同脚本实例互不感知
- 锁持有期间禁止任何对日志文件的 mv、cp、rm 操作
跳过空日志 + 校验 inode 变更
空日志无需切割,强行操作反而增加竞争风险;同时需确认新日志是否真的新建(而非复用旧 inode):
- 执行 stat -c '%s %i' /var/log/nginx/access.log,若大小为 0 则跳过整套流程
- 切割完成后立即检查新日志的 inode:ls -i /var/log/nginx/access.log,应与上一轮完全不同;若相同,说明 logrotate 错用了 copytruncate,必须禁用
- 配置中显式声明 create 0644 nginx adm,确保新文件权限正确,避免因权限问题导致写入静默失败
推荐用 logrotate 配合 sharedscripts + postrotate
自己写脚本易遗漏细节,logrotate 内置机制更可靠:
- 配置中必须含 sharedscripts:确保 postrotate 只执行一次,而非每个文件各执行一遍
- postrotate 段内先检查 pid 文件存在性与进程状态,再发 USR1;可加入 lsof 轮询逻辑
- 启用 dateext 和 dateformat -%Y%m%d-%H%M%S,避免同名覆盖;禁用 copytruncate(它会丢缓冲数据)


















