Node.js在Linux上的错误处理策略

先说一个核心判断:错误处理不是锦上添花,而是Node.js应用的底线工程。尤其在Linux环境下,进程稳定性、资源回收、日志持久化,每一项都直接关系到服务能否扛住生产流量。下面从全局兜底到防御性编程,拆解一套完整的错误处理策略。
1. 全局错误捕获:兜底未处理异常
全局错误处理器是防止Node.js进程因未处理错误崩溃的最后防线。需要监听两个核心事件:
uncaughtException:捕获未被try-catch或.catch()处理的同步/异步异常——比如代码逻辑错误、未捕获的Promise拒绝。处理时除了记录详细错误日志(堆栈信息必须包含),还要根据业务决定是否重启进程,避免无限崩溃。unhandledRejection:捕获未被处理的Promise拒绝,比如Promise.reject()后面没接.catch()。这里建议记录拒绝原因(reason)和关联的Promise对象,能帮助定位异步代码中的问题。示例代码:
process.on('uncaughtException', (error) => {
console.error('未捕获异常:', error.stack);
// 记录日志后,可选择优雅退出或重启(需配合进程管理工具)
process.exit(1); // 生产环境建议用pm2等工具重启
});
process.on('unhandledRejection', (reason, promise) => {
console.error('未处理Promise拒绝:', reason, 'Promise:', promise);
});
2. 模块级错误处理:精准捕获模块内错误
模块级错误处理需要同步与异步场景分开应对:
- 同步错误:用
try-catch包裹可能抛出异常的代码,比如文件读取、数据库查询。try { const data = fs.readFileSync('/path/to/file.txt', 'utf8'); } catch (error) { console.error('文件读取失败:', error.message); } - 异步错误:
- 回调函数:将错误作为第一个参数处理,这是Node.js的回调惯例。
fs.readFile('/path/to/file.txt', 'utf8', (err, data) => { if (err) { console.error('文件读取失败:', err.message); return; } console.log(data); }); - Promise:使用
.catch()捕获拒绝,或者async/await配合try-catch——后者更易读。async function fetchData() { try { const response = await axios.get('https://api.example.com/data'); console.log(response.data); } catch (error) { console.error('API请求失败:', error.response?.status || error.message); } }
- 回调函数:将错误作为第一个参数处理,这是Node.js的回调惯例。
3. 日志记录:结构化与持久化
日志是错误排查的核心依据,要遵循结构化、分级、轮转三个原则:
- 使用专业日志库:推荐Winston(功能全面)或Pino(高性能),支持多传输方式(文件、控制台、远程服务器)和格式化(JSON、时间戳)。示例(Winston配置):
const winston = require('winston'); const logger = winston.createLogger({ level: 'error', // 生产环境仅记录error及以上级别 format: winston.format.combine( winston.format.timestamp(), winston.format.json() // 结构化日志便于ELK分析 ), transports: [ new winston.transports.File({ filename: 'logs/error.log' }), // 错误日志单独存储 new winston.transports.Console({ format: winston.format.simple() }) // 控制台输出简化格式 ] }); - 日志轮转:避免日志文件过大占用磁盘空间。可以通过
winston-daily-rotate-file插件(Winston扩展)或Linux系统工具logrotate实现。示例(logrotate配置,/etc/logrotate.d/nodejs):/path/to/app.log { daily rotate 7 compress missingok notifempty copytruncate }
4. 监控与报警:实时感知错误
监控是提前发现错误的关键,需要结合进程状态与错误指标:
- 进程管理工具:使用PM2或nodemon监控Node.js进程,配置崩溃自动重启(PM2的
--restart参数)。pm2 start app.js --name "my-app" --restart-delay=3000 # 崩溃后3秒重启 - APM工具:集成New Relic、Datadog或Sentry,实时监控应用性能(如响应时间、错误率),并在错误发生时发送报警(邮件、信息、Slack)。示例(Sentry初始化):
const Sentry = require('@sentry/node'); Sentry.init({ dsn: 'YOUR_DSN_HERE' }); // 配置Sentry项目地址
5. 容错与恢复:提升系统鲁棒性
通过设计降低错误对系统的影响:
- 负载均衡:使用Nginx或HAProxy分散请求到多个Node.js实例,避免单点故障。
- 集群模式:利用Node.js的
cluster模块启动多个工作进程(共享端口),提高可用性。示例(集群模式):const cluster = require('cluster'); const os = require('os'); if (cluster.isMaster) { const numCPUs = os.cpus().length; for (let i = 0; i < numCPUs; i++) { cluster.fork(); // 启动子进程 } cluster.on('exit', (worker) => { console.log(`Worker ${worker.process.pid} died, restarting...`); cluster.fork(); // 子进程崩溃后重启 }); } else { require('./app'); // 子进程执行应用逻辑 }
6. 代码质量与测试:预防错误发生
从源头减少错误:
- 静态代码分析:使用ESLint检查代码风格与潜在问题——比如未定义变量、未处理的Promise。
- 自动化测试:
- 单元测试:用Jest或Mocha测试单个函数/模块。
- 集成测试:用Supertest测试API接口。
- 端到端测试:用Cypress模拟用户操作。
- 依赖管理:定期更新依赖(
npm outdated),使用npm audit修复安全漏洞,避免依赖冲突。
7. 资源管理:避免资源泄漏
资源泄漏(比如文件描述符、数据库连接)会导致进程崩溃,需要正确释放:
- 文件描述符:使用
fs.close()关闭打开的文件,或用stream.destroy()销毁流。 - 数据库连接:使用连接池(如
pg-poolfor PostgreSQL),并在应用退出时关闭连接。const { Pool } = require('pg'); const pool = new Pool({ connectionString: 'YOUR_DB_URL' }); // 使用连接 pool.query('SELECT * FROM users', (err, res) => { if (err) throw err; console.log(res.rows); pool.end(); // 关闭连接池 }); - 定时器与事件监听器:及时清除不再需要的定时器(
clearTimeout/clearInterval)和事件监听器(removeListener),避免内存泄漏。