答案是使用BufferedReader逐行读取Nginx日志并用预编译正则匹配,提取IP、时间、请求行、状态码等字段;需处理“-”占位符、编码、截断等边界情况,并二次解析request字段获取方法、路径和协议。

用 BufferedReader 读取 Nginx 访问日志时,核心是「逐行读取 + 正则匹配」,关键在于日志格式固定、正则需覆盖常见字段(如 IP、时间、请求行、状态码、大小等),且要处理转义和分组捕获。
明确 Nginx 日志默认格式并写对应正则
Nginx 默认 log_format 是:log_format main '$remote_addr - $remote_user [$time_local] "$request" $status $body_bytes_sent "$http_referer" "$http_user_agent" "$http_x_forwarded_for"';
对应典型日志行示例:192.168.1.100 - - [10/Jan/2024:14:23:15 +0800] "GET /api/user?id=123 HTTP/1.1" 200 1245 "https://example.com/" "Mozilla/5.0 (Macintosh)" "-"
推荐使用带命名组的正则(Java 7+ 支持),更易维护:
String pattern = "^([^\s]+) - ([^\s]+) \[([^[\]]+)\] "([^"]+)" (\d+) (\d+|-) "([^"]*)" "([^"]*)" "([^"]*)"$";
</font><p>各组含义:<br>
• <code>$1</code> → remote_addr(客户端 IP)<br>
• <code>$2</code> → remote_user(通常为 "-")<br>
• <code>$3</code> → time_local(原始时间字符串)<br>
• <code>$4</code> → request(如 <code>GET /api/user?id=123 HTTP/1.1</code>)<br>
• <code>$5</code> → status(状态码)<br>
• <code>$6</code> → body_bytes_sent(响应体字节数,可能为 "-")<br>
• <code>$7</code> → http_referer<br>
• <code>$8</code> → http_user_agent<br>
• <code>$9</code> → http_x_forwarded_for</p><H3>用 BufferedReader 逐行读取并匹配</H3><p>不要一次性加载全部日志(大文件易 OOM),用 <code>readLine()</code> 流式处理:</p><ul><li>用 <code>try-with-resources</code> 自动关闭流</li><li>每行调用 <code>Pattern.matcher(line).find()</code> 判断是否匹配</li><li>匹配成功后用 <code>matcher.group("name")</code> 或 <code>matcher.group(1)</code> 提取字段</li><li>对可能为空或 "-" 的字段(如 <code>body_bytes_sent</code>)做空值/占位符判断</li></ul><p>示例代码片段:</p><p><span>立即学习</span>“<a href="https://pan.quark.cn/s/c1c2c2ed740f" style="text-decoration: underline !important; color: blue; font-weight: bolder;" rel="nofollow" target="_blank">Java免费学习笔记(深入)</a></a>”;</p><div class="aritcle_card flexRow">
<div class="artcardd flexRow">
<a class="aritcle_card_img" href="/xiazai/skill7377" title="Java Maven Secondary Analysis"><img
src="https://img.php.cn/upload/skill/000/000/081/179144831942131.jpg" alt="Java Maven Secondary Analysis" onerror="this.onerror='';this.src='/static/lhimages/moren/morentu.png'" ></a>
<div class="aritcle_card_info flexColumn">
<a href="/xiazai/skill7377" title="Java Maven Secondary Analysis">Java Maven Secondary Analysis</a>
<p>分析ZIP压缩包或GitLab仓库中的Java Maven项目,确定二次开发范围、类数量、模块分布及生产相关指标。</p>
</div>
<a href="/xiazai/skill7377" title="Java Maven Secondary Analysis" class="aritcle_card_btn flexRow flexcenter"><b></b><span>下载</span> </a>
</div>
</div><font color="gray"><pre class="brush:php;toolbar:false;">
Pattern p = Pattern.compile(pattern);
try (BufferedReader reader = Files.newBufferedReader(Paths.get("access.log"))) {
String line;
while ((line = reader.readLine()) != null) {
Matcher m = p.matcher(line);
if (m.find()) {
String ip = m.group(1);
String time = m.group(3);
String request = m.group(4);
int status = Integer.parseInt(m.group(5));
String sizeStr = m.group(6);
long size = "-".equals(sizeStr) ? 0 : Long.parseLong(sizeStr);
// 后续处理...
}
}
}
提取 request 字段中的 HTTP 方法、路径、协议
group(4) 是完整请求行(如 "GET /api/user?id=123 HTTP/1.1"),需二次解析:
- 用简单空格分割(注意:路径含空格时会出错,但标准 HTTP 请求路径不含空格)
- 更稳妥方式是再套一个正则:
"^(\w+)\s+([^\s]+)\s+HTTP/(\d\.\d)$" - 若需解析 query 参数(如
id=123),可用java.net.URLDecoder.decode()+ 手动拆分,或引入URLEncodedUtils(Apache HttpClient)
例如:
String req = m.group(4);
Matcher reqM = Pattern.compile("^(\w+)\s+([^\s]+)\s+HTTP/(\d\.\d)$").matcher(req);
if (reqM.find()) {
String method = reqM.group(1); // GET
String path = reqM.group(2); // /api/user?id=123
String proto = reqM.group(3); // 1.1
}
注意边界情况与性能优化
真实日志中常有干扰项,需防御性处理:
- 日志行可能被截断、含非 UTF-8 字符(建议指定 charset:
Files.newBufferedReader(path, StandardCharsets.UTF_8)) - 某些字段含引号或空格(如 User-Agent 中的括号、版本号),当前正则已用
[^"]*容错 - 高吞吐场景下,预编译
Pattern(避免重复编译),复用Matcher实例(调用matcher.reset(line)) - 若需时间解析,用
DateTimeFormatter处理group(3)(格式如dd/MMM/yyyy:HH:mm:ss Z)
不复杂但容易忽略。

















