Nginx upstream超时与重试需分层配置、协同生效:proxy_connect_timeout设3–5秒,proxy_send_timeout设5–10秒,proxy_read_timeout设为后端平均耗时2–4倍;重试须配合proxy_next_upstream指定触发条件(如timeout/502/503/504)、proxy_next_upstream_tries≤3、proxy_next_upstream_timeout≈proxy_read_timeout×2;upstream至少两节点并配置max_fails/fail_timeout实现健康标记;日志中upstream_tries≥2且upstream_addr含多IP即验证重试生效。

在 upstream 配置中设置合理的连接超时与重试次数,核心是让 Nginx 能快速识别故障、及时切换节点,又不因过度重试拖慢响应或压垮后端。这不是调几个数字的事,而是各阶段超时、重试逻辑、节点健康状态三者必须对齐。
超时参数要分层设,且彼此匹配
单次请求的生命周期分三个关键阶段,每个阶段都需独立控制:
- proxy_connect_timeout:建立 TCP 连接的上限,建议设为 3–5 秒。超过即判定“连不上”,触发重试。设太长会让用户卡在握手阶段;设太短可能误判高延迟但可用的节点。
- proxy_send_timeout:从开始发请求体到发完的上限,一般 5–10 秒。适用于大文件上传或长请求体场景,普通 API 可设 5s。
- proxy_read_timeout:发送完后等待后端返回响应头的上限(不是整个响应),这是最关键的超时项。若后端接口平均耗时 2 秒,建议设 5–8 秒;设太短会把正常慢接口当失败,频繁重试;设太长则用户白等,且占用 worker 连接。
重试次数不能孤立设置,必须配合触发条件和总时限
只写 proxy_next_upstream_tries 3 没用,它只在满足 proxy_next_upstream 条件时才生效:
- 必须显式开启重试触发条件,例如:
proxy_next_upstream error timeout http_502 http_503 http_504;
默认只响应error和timeout,5xx 错误需手动加进去。 - proxy_next_upstream_tries 表示总尝试次数(含首次),生产环境推荐设为 3:首次 + 最多再试 2 次,覆盖瞬时抖动,避免雪崩。
-
proxy_next_upstream_timeout 是从第一次请求发出起算的总耗时上限,建议设为
proxy_read_timeout × 2左右(如 read_timeout=5s,则 timeout=10s)。它确保即使 tries 没用完,超时也立刻终止,防止慢节点拖垮整体。
upstream 节点必须至少两个,且带健康标记
没有备用节点,重试就是空谈:
- upstream 至少定义两台 server,例如:
upstream backend {<br> server 10.0.1.10:8080 max_fails=2 fail_timeout=30s;<br> server 10.0.1.11:8080 max_fails=2 fail_timeout=30s;<br>} -
max_fails=2 fail_timeout=30s表示:连续 2 次被proxy_next_upstream判定为失败(超时/502 等)后,该节点 30 秒内不再参与轮询——这避免反复打坏节点,提升重试效率。 - 注意:
proxy_next_upstream_tries 3不代表一定能试满 3 次。如果只有 2 台节点,最多只试这 2 台;若第 1 台超时、第 2 台返回 504,那就直接返回 504,不会“凑够 3 次”。
日志里可验证是否真在重试
加一条自定义日志格式,能直观看到重试行为是否生效:
- 在 http 块中定义:
log_format upstream_log '$remote_addr - $remote_user [$time_local] "$request" $status $body_bytes_sent ' '"$http_referer" "$http_user_agent" upstream_tries=$upstream_tries upstream_addr=$upstream_addr'; - 在 location 中启用:
access_log /var/log/nginx/upstream.log upstream_log; - 观察日志:
若upstream_tries=1,说明没触发重试;
若出现upstream_tries=2或3,且upstream_addr里有多个 IP:PORT(如10.0.1.10:8080, 10.0.1.11:8080),就说明重试已走通。


















