发布于2026-07-18 阅读(0)
扫一扫,手机访问
用 Node.js 日志监控系统状态的可落地方案

聊起系统状态监控,日志是最直接也最可靠的入口。很多人以为日志就是“打印点信息”,但在生产环境里,日志其实是一条完整的数据管道,从采集、传输、存储到分析、告警,每个环节都需要精心设计。
先说日志采集这一层。应用内部应该用结构化日志库——比如 Winston、Pino、Bunyan——统一输出 JSON 格式的日志。为什么要结构化的?因为后面做检索、过滤、聚合都依赖字段名,纯文本日志在规模上来之后基本不可用。
采集完怎么处理?需要把日志发送到集中式系统,比如 ELK Stack(Elasticsearch + Logstash + Kibana),或者 Graylog、Fluentd。这样跨服务的日志就能聚合到一起,想查哪个接口、哪个用户的链路都方便。
实时观察层面,开发运维人员可以用 tail -f 或者 PM2 的 logs 命令快速看当前输出;更正式的做法是在 Kibana 或 Grafana 里配置阈值告警——比如错误率突然飙升、响应时间异常,系统自己就会通知你。
除了日志本身,指标数据也很关键。暴露一个 /metrics 端点,配合 Prometheus + Grafana 做时序指标仪表盘,很多问题在数值趋势上就能提前发现。
最后是运行和轮转。PM2 负责守护进程并管理日志输出;logrotate 或者 winston-daily-rotate-file 做日志切分和归档,避免磁盘被写爆。
用 Winston 输出 JSON 日志,区分 error 和 combined 两类文件,后续检索和告警都方便。
// logger.js
const winston = require('winston');
const { combine, timestamp, json } = winston.format;
const logger = winston.createLogger({
level: 'info',
format: combine(timestamp(), json()),
transports: [
new winston.transports.File({ filename: 'error.log', level: 'error' }),
new winston.transports.File({ filename: 'combined.log' }),
new winston.transports.Console({ format: winston.format.simple() })
]
});
module.exports = logger;
业务代码中打点也很自然:
const logger = require('./logger');
logger.info('user login', { userId: 'u123', ip: '1.2.3.4' });
logger.error('db connect failed', { err: err.message, retry: true });
提供 /health 和 /status 端点,结合 os 模块输出关键运行信息。探针和快速排障都靠它。
// health.js
const express = require('express');
const os = require('os');
const logger = require('./logger');
const app = express();
app.get('/health', (req, res) => {
const health = { status: 'UP', uptime: process.uptime() };
logger.info('health check', health);
res.json(health);
});
app.get('/status', (req, res) => {
const mem = os.freemem() / os.totalmem();
const status = {
freeMemPct: (mem * 100).toFixed(2) + '%',
totalMem: (os.totalmem() / 1024 / 1024 / 1024).toFixed(2) + ' GB',
cpuCount: os.cpus().length,
systemUptime: os.uptime()
};
logger.info('status snapshot', status);
res.json(status);
});
app.listen(3000, () => logger.info('Server listening on 3000'));
用 prom-client 暴露 /metrics,配合 Prometheus + Grafana 展示请求率、延迟、活跃请求等指标。
// metrics.js
const client = require('prom-client');
const httpRequestDuration = new client.Histogram({
name: 'http_request_duration_seconds',
help: 'Duration of HTTP requests in seconds',
labelNames: ['method', 'status']
});
const activeRequests = new client.Gauge({
name: 'active_requests',
help: 'Number of active HTTP requests'
});
function metricsMiddleware(req, res, next) {
const end = httpRequestDuration.startTimer();
activeRequests.inc();
res.on('finish', () => {
end({ method: req.method, status: res.statusCode });
activeRequests.dec();
});
next();
}
app.get('/metrics', async (req, res) => {
res.set('Content-Type', client.register.contentType);
res.end(await client.register.metrics());
});
PM2 启动并守护进程,实时查看日志:
npm i -g pm2
pm2 start app.js --name my-app
pm2 logs my-app # 实时查看
pm2 monit # 资源监控
Linux 系统上用 logrotate 做日志轮转:
# /etc/logrotate.d/myapp
/path/to/logs/*.log {
daily
missingok
rotate 7
compress
notifempty
create 0640 node node
}
日志告警:在 Kibana 里配置规则,当 error.log 条目数在设定窗口内超过阈值,或者匹配到关键错误模式时,触发通知。通知渠道可以是邮件、企业微信、钉钉、PagerDuty、Opsgenie。
指标告警:在 Prometheus 里配置规则,比如 5xx 比例、P95 延迟、活跃请求异常等,通过 Alertmanager 路由到对应通知渠道。
可视化:Grafana 仪表盘覆盖请求率、错误率、P50/P95/P99 延迟、内存与 CPU 使用、活跃请求等核心面板。一张图看全貌,比翻日志高效得多。
结构化与级别:统一 JSON 日志,合理使用 debug/info/warn/error,生产环境不要过度打点,否则成本高、干扰多。
采样与脱敏:高频调试日志做采样;password、token、phone 等敏感字段必须脱敏后再写入,这是基本功。
异步与性能:采用异步或批量写入,避免日志阻塞主线程;高频路径上减少昂贵的序列化操作。
上下文与追踪:日志里带上 trace_id、span_id、request_id,全链路串联才顺畅。
可靠传输:集中式日志通道要有重试和缓冲能力,避免瞬时故障导致日志丢失。
容量与保留:按日或按大小切分,设置合理的保留周期和冷热分层,控制存储成本。
安全合规:限制日志访问权限,敏感数据绝不能写入可被未授权访问的存储中。
说到底,日志监控不是“写了就行”,而是一套系统工程。把上面这些环节走通,Node.js 应用的状态才能看得清、管得住。
上一篇:Numpy数组拆分的实现步骤
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
售后无忧
立即购买>office旗舰店
正版软件
正版软件
正版软件
正版软件
正版软件
1
2
3
7
8