配置高可用性,说白了就是让应用在服务器宕机、网络波动甚至机房断电时还能照样提供服务。在CentOS上搭建Node.js应用的高可用环境,涉及多个层面的协同——从负载均衡到进程管理,再到数据库和存储的冗余设计。下面逐一拆解,把关键步骤和思路过一遍。

1. 使用负载均衡器
负载均衡器相当于一个交通指挥员,把用户请求均匀分发给后端的多个Node.js实例。这样即使某个实例挂了,流量也会自动绕开它,业务不中断。
安装和配置Nginx作为负载均衡器
安装Nginx,这一步很简单:
sudo yum install epel-releasesudo yum install nginx配置Nginx,编辑主配置文件或自定义配置文件(比如
/etc/nginx/conf.d/default.conf),加上一个upstream块,把后端Node.js实例的地址和端口列进去:http { upstream node_app { server 192.168.1.1:3000; server 192.168.1.2:3000; server 192.168.1.3:3000; } server { listen 80; location / { proxy_pass http://node_app; proxy_set_header Host $host; proxy_set_header X-Real-IP $remote_addr; proxy_set_header X-Forwarded-For $proxy_add_x_forwarded_for; proxy_set_header X-Forwarded-Proto $scheme; } } }重启Nginx让配置生效:
sudo systemctl restart nginx
2. 使用集群模式
Node.js默认是单线程的,但现代服务器CPU通常有多个核心。利用内置的cluster模块,可以一举启动多个Worker进程,每个进程独占一个核心,同时监听同一个端口。这样不仅提升了吞吐量,还增加了容错能力——一个Worker崩溃了,Master可以立刻fork一个新的顶上。
示例代码
const cluster = require('cluster');
const http = require('http');
const numCPUs = require('os').cpus().length;
if (cluster.isMaster) {
console.log(`Master ${process.pid} is running`);
// Fork workers.
for (let i = 0; i < numCPUs; i++) {
cluster.fork();
}
cluster.on('exit', (worker, code, signal) => {
console.log(`worker ${worker.process.pid} died`);
});
} else {
// Workers can share any TCP connection
// In this case it is an HTTP server
http.createServer((req, res) => {
res.writeHead(200);
res.end('hello worldn');
}).listen(3000);
console.log(`Worker ${process.pid} started`);
}
3. 使用进程管理器
光靠集群模式还不够——万一整个Node.js进程因为内存泄漏或未捕获异常挂掉,集群模式本身也没法自动恢复。这时候就需要一个进程管理器,比如PM2。它负责启动应用、监控进程状态,并在崩溃后自动重启。顺便还能帮你管理日志、做零停机部署。
安装PM2
sudo npm install pm2 -g
启动应用
pm2 start app.js --name my-app
监控和管理
pm2 list
pm2 logs
pm2 monit
4. 配置健康检查
负载均衡器虽然能分发流量,但它怎么知道后端某个实例是不是还活着?答案就是健康检查。在Node.js应用里暴露一个专门的状态接口,比如/health,返回一个简单的JSON(例如{ status: 'UP' })。Nginx或其他负载均衡器会定期向这个接口发送请求,如果连续几次没响应,就把该实例从池子里踢出去,直到它恢复正常。
示例健康检查端点
const express = require('express');
const app = express();
app.get('/health', (req, res) => {
res.json({ status: 'UP' });
});
app.listen(3000);
5. 数据库和存储的高可用性
应用本身高可用了,但数据层如果单点故障,一切都白搭。数据库方面,MySQL可以用主从复制或组复制,MongoDB可以用副本集(Replica Set),Redis可以用哨兵模式或集群模式。关键原则是:每次写操作至少同步到两个节点,读操作可以分散到多个从节点。存储方面,可以考虑分布式文件系统或云存储服务。
6. 网络和防火墙配置
防火墙规则不要过于严苛,否则负载均衡器到后端实例的流量可能被阻断,健康检查也会失败。确保Nginx所在的端口(比如80/443)对外开放,后端Node.js实例的端口(比如3000)只对内网开放,并且负载均衡器能访问到它们。另外,iptables或firewalld的配置要仔细检查,避免不必要的丢包。
7. 备份和恢复策略
高可用不等于零数据丢失。定期备份应用代码、配置文件和数据库,把备份存储到异地或云存储上。同时制定详细的恢复流程——比如从备份重建实例、切换DNS、验证数据一致性等。最好能定期演练,确保真出问题时团队不至于手忙脚乱。
以上这些步骤组合起来,基本可以在CentOS上搭出一个可靠的高可用Node.js环境。当然,实际场景中可能还需要考虑SSL证书管理、日志集中存储、监控告警、自动扩缩容等更细化的内容。但先把基础打牢,后面的优化才有意义。