Nginx proxy_cache在压测下磁盘IOPS锁死,本质是MISS流量引发高频小文件随机读,击穿磁盘处理能力;需通过减少穿透、内存化缓存、优化存储结构等手段治理。

proxy_cache 在高性能压测下出现磁盘 IOPS 瞬间锁死,本质是缓存未命中流量触发高频小文件随机读,叠加文件系统、内核 IO 调度与硬件响应能力不足,导致队列积压、延迟飙升、设备利用率饱和。这不是“IO 多”,而是“IO 形态错”——高 r/s + 小 avgrq-sz + 高 await 的组合击穿了磁盘处理能力边界。
盯住 iostat -x 的关键信号组合
运行 iostat -dx /dev/sdX 1(替换为实际 cache 所在盘),持续观察以下指标是否同步恶化:
- r/s > 300 且 rkB/s
- avgrq-sz 长期低于 32(即平均请求
- await 持续 > 20ms(HDD)或 > 2ms(NVMe),且 avgqu-sz > 4
- %util 接近或达到 100%,同时 svctm 明显升高(说明设备真忙,不是单纯排队)
优先切断未命中路径的磁盘冲击
proxy_cache 的压力主因是 MISS 流量直接打到磁盘小文件。缓解不靠“加磁盘”,而靠“减穿透”:
安全更新和维护 CLI Proxy API(CPA)部署与配置。用于 CPA 镜像升级、配置变更、认证目录兼容修复、上线验证与回滚。适用于用户提到“CPA 更新/升级/配置改了/容器重建/回滚”等场景。
- 在 upstream 块中配置 proxy_cache_use_stale error timeout updating http_500 http_502 http_503 http_504,避免后端故障时大量新请求涌向磁盘
- 启用 proxy_cache_lock on 并设 proxy_cache_lock_timeout 5s,对同一 key 的并发 MISS 请求只放行一个回源,其余等待,大幅降低磁盘打开/读取小文件频次
- 结合 $upstream_cache_status 日志,统计 MISS 突增时段,检查对应 URI 是否存在缓存键设计缺陷(如带时间戳、用户 ID 等不可缓存参数)
把热数据从磁盘搬到内存层
即使不能全量内存化,也要让最常读的小文件绕过磁盘:
- 将 proxy_temp_path 和 proxy_cache_path 都指向 /dev/shm/nginx_cache(tmpfs 内存文件系统),并确保 shmmax 和 shmall 内核参数足够(例如:vm.shmmax = 8589934592)
- 设置 proxy_buffers 16 512k + proxy_busy_buffers_size 2m,提升响应体在内存中暂存能力,减少临时文件落盘
- 禁用 proxy_buffering off(除非业务强要求流式响应),否则每个响应都可能生成临时磁盘文件
重构缓存存储结构,降低单次 IO 开销
Nginx 默认的多级 hash 目录虽防碰撞,但在高并发下引发大量目录遍历和 inode 查找。优化方向是“扁平+预分配”:
- 将 levels=1:2 改为 levels=2(仅一级子目录),配合更大 keys_zone(如 256m),减少路径深度
- 使用 proxy_cache_path ... use_temp_path=off,强制缓存写入与索引共用同一路径,避免额外 rename 和元数据操作
- 若使用 XFS 文件系统,挂载时添加 noatime,inode64,logbufs=8,logbsize=256k 参数,降低日志和访问时间更新开销
不复杂但容易忽略:IOPS 锁死往往不是配置没调够,而是某条路径(比如 MISS 回源)在高压下突然放大了底层 IO 模式缺陷。先稳住 %util 和 await,再逐步释放缓存容量和内存缓冲,比盲目堆 SSD 更有效。


















