Nginx缓存容错机制核心是后端不可用时返回可用旧内容,依赖proxy_cache_use_stale指令协同:需精准配置http_500-504等触发条件,忽略干扰响应头,稳定cache_key,预热关键资源,并配合upstream容错形成双保险。

构建 Nginx 缓存容错机制,核心目标不是让缓存“永远新鲜”,而是确保后端不可用时,用户仍能获得可用、可信的旧内容。它依赖三类协同动作:主动稳住缓存、被动兜住失败、提前备好底牌。
让过期缓存也能安全返回
关键指令是 proxy_cache_use_stale。默认情况下,一旦缓存过期,Nginx 会立刻回源;若此时后端宕机,就直接报错。启用该指令后,可在特定故障下继续提供已缓存的内容:
- 添加配置:proxy_cache_use_stale error timeout updating http_500 http_502 http_503 http_504;
- 其中 updating 很重要——当缓存即将过期、Nginx 正在后台异步刷新时,新请求仍可拿到旧内容,避免“更新窗口期”空白;
- error/timeout 覆盖连接中断与超时;http_5xx 覆盖源站服务崩溃场景;
- 注意:它不改变缓存本身的过期时间(由 proxy_cache_valid 控制),只放宽“什么情况下允许用过期内容”。
切断上游干扰,锁定缓存有效性
很多缓存失效,其实来自后端响应头的干扰。例如 PHP 或 Java 应用常返回 Cache-Control: no-cache 或 Expires: past,会强制覆盖 Nginx 的缓存策略。
- 用 proxy_ignore_headers Cache-Control Expires Set-Cookie; 主动忽略这些头字段;
- 固定缓存键,避免会话污染:proxy_cache_key "$scheme$host$request_uri";(去掉 $cookie、$args 等易变因子);
- 对政策页、FAQ、公示文件等低频更新资源,设长有效期:proxy_cache_valid 200 206 7d;
预热+刷新+健康检查闭环管理
纯靠用户访问触发缓存,断网时很可能关键页面根本没被缓存过。必须主动干预:
- 定时预热:每天凌晨用脚本批量请求首页、政策库、高频事项页,确保核心资源始终在缓存中;
- 发布即刷新:后台发布新公告后,同步调用 proxy_cache_purge 清除对应 URL 缓存,下次访问即加载新版(需启用 ngx_cache_purge 模块);
- 本地健康检查:配合 health_check 或自定义探活脚本,一旦发现源站异常,可提前触发预热或告警,而非坐等用户报错。
搭配 upstream 容错形成双保险
缓存容错解决的是“有内容可返回”,而 upstream 容错解决的是“回源失败怎么办”。两者叠加才完整:
- 在 upstream 中设置多个源站,并启用 max_fails=2 fail_timeout=30s 实现自动摘除;
- 加一个 backup 节点作为最后防线,比如指向静态降级页或只读归档服务;
- 用 error_page 502 503 504 /offline.html; 提供离线友好提示,避免裸错页。


















