通过Apache访问日志估算并发用户数,核心是统计同一时间窗口内活跃请求数量,需将日志时间戳标准化为秒级时间戳,按秒聚合请求数得瞬时RPS,再乘以平均响应时间得近似并发数。

通过 Apache 访问日志估算并发用户数,核心是统计在**同一时间窗口内活跃的请求数量**,而不是简单求总请求数或 IP 数。关键在于定义“并发”——通常指在某个极短时间粒度(如 1 秒)内,有至少一个请求正在被处理(即日志中记录了该时间戳的请求)。Apache 日志本身不直接记录请求持续时间,所以标准做法是基于请求到达时间(%t)做滑动时间窗口统计。
提取并标准化时间戳
Apache 默认日志格式中的时间字段(如 [10/Jan/2024:14:23:05 +0800])需转为可排序、可计算的格式(如 Unix 时间戳或 ISO 8601)。推荐先用 awk 或 perl 提取并转换:
- 用
awk提取原始时间并简化:awk '{gsub(/[|/|:/," ",$4); print $4,$5}' access.log | awk '{print $1"-"$2"-"$3" "$4}' - 更可靠的方式是用
date -d转成秒级时间戳(适合小到中等日志量):awk '{print $4}' access.log | sed 's/[//; s/:/ /; s/// /g' | while read d m y H M S z; do date -d "$y-$m-$d $H:$M:$S" +%s 2>/dev/null; done
按秒聚合请求数(基础并发近似)
将每条请求归入其到达的**整秒时刻**,再统计每秒请求数。该数值可视为该秒内的“瞬时并发请求数”下限(因未考虑请求耗时,但对多数 Web 场景已具参考价值):
Apache Superset 是一个广泛采用的开源 BI 平台,用于 SQL 探索、图表构建和仪表板交付。当代理需要查询仓库数据、组装仪表板或使用成熟的分析界面解释指标而不是临时笔记本代码时,此技能非常有用。
- 命令示例(Linux):
awk '{match($4, /\[([^:]+):([^:]+):([^:]+):([^\]]+)/, a); print a[1] "-" a[2] "-" a[3] " " a[4] ":" a[5] ":" a[6]}' access.log | xargs -I{} date -d "{}" +%s 2>/dev/null | sort | uniq -c | sort -nr | head -20 - 输出形如:
142 1704877385→ 表示时间戳 1704877385(即 2024-01-10 14:23:05)有 142 个请求到达
估算真实并发(考虑平均响应时间)
若已知应用平均响应时间(例如 200ms),可将“并发用户数”近似为:
(每秒请求数 RPS) × (平均响应时间秒数)
- 例如:某秒有 50 个请求到达,平均响应耗时 0.2 秒 → 并发连接 ≈ 50 × 0.2 = 10
- 获取平均响应时间:从日志中提取
%D(微秒)或%T(秒),用awk '{sum+=$NF} END{print sum/NR}'计算(需确保日志含响应时间字段,如LogFormat "%h %l %u %t "%r" %>s %b "%{Referer}i" "%{User-Agent}i" %D" combined) - 注意:此法假设请求均匀到达且服务无排队,适用于轻负载;高负载下需结合服务器指标(如
mod_status的BusyWorkers)交叉验证
用工具提升效率(大日志场景)
单靠 shell 处理 GB 级日志较慢。推荐轻量方案:
-
goaccess:实时分析,支持按小时/分钟维度看请求峰值,间接反映并发压力:
goaccess access.log --log-format=COMBINED --time-format='%d/%b/%Y:%H:%M:%S %z' --date-format='%d/%b/%Y' -
pv + awk + sort 流式处理(避免内存溢出):
pv access.log | awk '{...}' | sort -S 2G | uniq -c | sort -nr - 导入 SQLite 或 ClickHouse 建表(time INT, path TEXT, resp_time INT),用 SQL 按秒分组聚合,适合长期监控

















