Thanos Query跨多数据中心去重关键在于external_labels一致性声明、--query.replica-label显式对齐及Sidecar gRPC Store API正确暴露;缺一即导致数据翻倍或错乱。

Thanos Query 实现跨多数据中心 Prometheus 联合查询去重,关键不在于 Query 本身“自动识别重复”,而在于整套链路中 external_labels 的一致性声明 + --query.replica-label 的显式对齐 + Sidecar 的 gRPC Store API 正确暴露。漏掉任一环,去重就失效,查出来的数据会翻倍或错乱。
external_labels 必须按数据中心+副本维度唯一且稳定
这是去重的语义基础。Prometheus 自身不理解“哪个是副本”,全靠标签告诉 Thanos Query:“这些数据来自同一逻辑源,只是不同实例”。
- 每个数据中心分配一个全局唯一的
cluster标签,比如cluster: "dc-shanghai"或cluster: "dc-frankfurt",不能用 IP、hostname 等动态值 - 同一数据中心内多个 Prometheus 副本,
cluster值必须完全一致,但必须添加replica标签区分,如replica: "0"和replica: "1" - 该配置必须写死在
prometheus.yml的global.external_labels下,Sidecar 启动时才会注入到元数据中;仅靠环境变量或启动参数传递无效 - 验证方式:调用
curl http://<prometheus-ip>:9090/api/v1/status/config</prometheus-ip>,确认返回里有你设的external_labels
Thanos Query 启动时必须指定 --query.replica-label=replica
Query 不会默认按 replica 去重,必须显式告诉它:“请把所有带 replica 标签的 series 当作可去重副本”。否则即使数据带 replica="0" 和 replica="1",Query 也当它们是两套独立指标。
- 命令中必须包含
--query.replica-label=replica(注意值是字符串"replica",不是标签内容) - 如果误写成
--query.replica-label="0"或漏掉该参数,去重逻辑完全不触发 - 若你用的是其他标签名(比如
prometheus_replica),那这里就得对应写成--query.replica-label=prometheus_replica - 多个 replica 标签?Thanos 只支持单个 label 作为去重依据,别试图叠加
Sidecar 必须启用 Store API 且网络可达
Query 是通过 gRPC 调 Sidecar 的 thanos.store.v1.Store 接口拉取实时数据的。HTTP 接口(如 /federate)不参与去重流程,也不被 Query 使用。
- Sidecar 启动命令必须含
--grpc-address=:10901(默认端口),且宿主机/容器网络策略要放行该端口的 TCP 流量 - Prometheus 启动时需加
--web.enable-admin-api --web.enable-lifecycle,否则 Sidecar 无法 reload 配置或读取 WAL - 验证方法:
grpcurl -plaintext <sidecar-host>:10901 list</sidecar-host>应返回thanos.store.v1.Store;curl http://<sidecar-host>:10901/metrics</sidecar-host>应返回指标且含thanos_sidecar_store_synced_blocks_total - 跨数据中心场景下,若 Sidecar 暴露在公网,务必启用 TLS 或加认证代理,gRPC 明文传输无加密
去重只发生在 Query 层,不影响原始存储和告警
很多人误以为开了去重,Alertmanager 就不会重复告警。事实是:告警由各 Prometheus 本地计算并推送给 Alertmanager,Query 的去重对告警路径零影响。
- 去重仅作用于 Query 收到的查询请求(如 Grafana 查
rate(http_requests_total[5m])),返回结果中相同时间序列只保留一份 - 如果两个 Prometheus 副本采集时间略有偏移(比如相差 200ms),Query 会基于
max_source_resolution自动对齐时间窗口,但不会插值或补点 - 若某副本短暂离线,Query 仍会从其余副本取数,但 gap 期间无数据 —— 这是“高可用”不是“数据修复”
- 真正要防告警重复,得在 Alertmanager 配置
group_by和group_wait,或让 Ruler 组件统一计算告警规则
最容易被忽略的是:external_labels 写错位置(比如写在 scrape_config 里而非 global 下),或者 Query 参数拼写错误(--query.replica-label 少了 query. 前缀)。这两个点一旦出错,现象都是数据成倍增长,但日志里几乎不报错,只能靠手动比对 label 值排查。

















