发布于2026-07-13 阅读(0)
扫一扫,手机访问
整体思路与准备

做Nginx日志分析,最忌讳的就是拿到文件直接开干,没有章法。正确的打开方式,是先把目标定下来。通常来说,不外乎流量分析、错误排查、性能监控和安全隐患这几个核心方向。把这些大方向梳理清楚了,后续的操作才能有的放矢,沉淀下来的分析流程和报表才有复用价值。
当然,光有目标还不够,日志本身的质量得跟上。Nginx的日志格式完全可以自定义,建议在配置文件中统一设置,把那些最常用的字段都加进去。 更进一步,如果希望后续能被ELK这类系统高效解析,直接输出JSON格式是最明智的选择。这里给出一段典型配置,可以作为参考:
log_format main '$remote_addr - $remote_user [$time_local] ''"$request" $status $body_bytes_sent ''"$http_referer" "$http_user_agent" "$http_x_forwarded_for"';
access_log /var/log/nginx/access.log main;
error_log /var/log/nginx/error.log;
log_format json_analytics escape=json '{'
'"msec":"$msec","connection":"$connection",'
'"request_id":"$request_id","request":"$request",'
'"status":$status,"body_bytes_sent":$body_bytes_sent,'
'"http_referer":"$http_referer","http_user_agent":"$http_user_agent",'
'"remote_addr":"$remote_addr","http_x_forwarded_for":"$http_x_forwarded_for"'
'}';
access_log /var/log/nginx/access_json.log json_analytics;
简单说明一下:访问日志(access.log)是行为分析和性能监控的核心依据;错误日志(error.log)则专门用来定位那些4xx、5xx错误。至于JSON格式,一旦在ELK或Loki这类系统中流转,解析和聚合会变得异常顺手。
解析与字段提取
接下来,我们进入数据提取环节。这里有两种主流思路:一种适合临时排查,靠命令行快速出结果;另一种更规范,适合长期复用。
命令行快速解析(临时排查利器)
临时想看个数据,不想搭环境?直接用awk和sort就足够了。比如,快速看状态码分布:
awk '{print $9}' access.log | sort | uniq -c | sort -nr
再比如,统计Top IP、Top URL,或者按时间段切片:
# Top 10 IP
awk '{print $1}' access.log | sort | uniq -c | sort -nr | head -10
# Top 10 URL(按请求行第7列,适配常见combined格式)
awk '{print $7}' access.log | sort | uniq -c | sort -nr | head -10
# 某时间段的请求数(示例:07/Apr/2017:04-05 点)
grep "07/Apr/2017:0[4-5]" access.log | wc -l
这些命令虽然原始,但在没专用平台的情况下,确实是快速定位问题的好手段。
结构化解析(长线复用的基础)
如果日志格式复杂、场景多变,那么GROK模式就派上用场了。它能用正则把日志里散乱的字段一一解析出来,变成清晰的“字段名-值”对。下面是个示意性的GROK规则:
e_regex("content",
r'(?P\S+) - - \[(?P[^\]]+)\] '
r'"(?P\S+) (?P\S+) (?P\S+)" '
r'(?P\d+) (?P\d+) '
r'"(?P[^"]*)" "(?P[^"]*)"')
实际上,GROK模式库本身就很丰富,学习成本低,对于快速上手解析多变日志非常友好。如果遇到特别复杂的格式,再配合正则也不迟。
常见分析场景与命令示例
思路和方法都准备好了,那在实际运维中,我们会遇到哪些典型的场景?
错误与异常定位
拿到一堆4xx、5xx的报警,第一反应肯定是快速筛选。最直接的手段就是按状态码计数,看看哪些是重点:
# 查看全部 404
grep " 404 " access.log | head
# 各状态码计数
awk '{print $9}' access.log | sort | uniq -c | sort -nr
# Top 10 404 路径
awk '$9==404 {print $7}' access.log | sort | uniq -c | sort -nr | head -10
如果监控发来告警,“最近10分钟5xx飙高”?不用慌,一行命令就能快速验证:
# 最近10分钟 5xx 数量
tail -n 100000 access.log | grep "$(date -d '10 minutes ago' '+%d/%b/%Y:%H:%M')" | awk '$9>=500 {count++} END {print count+0}'
流量与用户行为
想看看谁在频繁访问,哪些页面最受欢迎,或者用户从哪跳转过来的?只需要把对应的列拎出来做个降序排序:
# Top IP
awk '{print $1}' access.log | sort | uniq -c | sort -nr | head
# Top URL
awk '{print $7}' access.log | sort | uniq -c | sort -nr | head
# Top Referer / UA(按列位置或解析后字段)
性能与可用性
如果日志里记录了请求耗时(比如 $request_time 或 $upstream_response_time),那就能精确定位慢请求:
# 假设第10列为 $request_time(单位秒)
awk '$10 > 1.0 {print $7,$10}' access.log | sort -k2 -nr | head
此外,观察502、503这类网关错误的集中时间段和来源IP,往往能帮你反向推断出上游服务或网关的瓶颈所在。
可视化与长期化
临时用命令行查一下没问题,但日常运维不能全靠手搓命令。从长期来看,一定要让数据“可视化”,并纳入统一的观测体系。
快速可视化报表:GoAccess
如果只想快速生成一份看得过去的报表,GoAccess是首选。它能直接解析Nginx日志,并生成实时HTML报告:
# 终端实时
goaccess /var/log/nginx/access.log -f /var/log/nginx/access.log --log-format=COMBINED --real-time-html --ws-url=0.0.0.0:7890
# 导出静态HTML报告
goaccess /var/log/nginx/access.log -o /var/www/html/report.html --log-format=COMBINED
集中化与可观测平台
更成体系的做法,是搭建集中式观测平台。比较主流的方案有两类:
别忘了运维配套
最后提醒一句:日志文件如果不做切割,迟早会变成“巨无霸”,拖垮分析效率。务必引入 logrotate 等工具,定期切割和归档,保证平台的稳定运行。
下一篇:怎样通过Nginx日志做性能调优
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8