在Ubuntu上做JSP应用监控,这事儿说难不难,但要想真把性能问题“看透”,还是得有一套章法。很多时候,我们盯着某个指标觉得没问题,结果线上还是出了状况——其实就是监控体系有盲区。今天咱们就把它拆开聊聊,从工具、步骤到填坑,争取一条线走通。

一、监控体系与工具
先说顶层设计。监控不是扔一堆工具上去就完事,而是得从最底层往上看透。一个有效的监控体系,通常得覆盖这么几个层面:
- 系统层:这是最底层的“体检”。用
top/htop看CPU和负载,free -m看内存,df -h看磁盘,iftop看网络带宽与连接——这些命令足够快速定位资源瓶颈。 - 容器层(Tomcat/Jetty):中间件是跟应用直接打交道的。多翻翻
logs/catalina.out、localhost*.log、error.log,重点关注异常堆栈、启动耗时、访问异常,以及部署回滚的线索。 - JVM层:这里是性能调优的主战场。VisualVM、Ja va Mission Control(JMC)用来做CPU采样、内存和线程分析;如果需要更精细的诊断和告警,可以上JProfiler、New Relic或Datadog。
- 压测与容量:Apache JMeter构造并发场景,输出响应时间、吞吐量、错误率——这是验证优化效果、摸清容量上限的必备手段。
- 自动化与告警:别指望人工巡检。用Shell/Python定期采集指标和日志,入库或写到日志平台,设置阈值后自动触发邮件、信息或企业微信/钉钉告警,形成闭环。
二、快速上手步骤
工具齐了,别急着上手就调优。先从这几个步骤走一遍,把基线建出来。
- 安装与接入:装好常用观测工具:
sudo apt update && sudo apt install -y htop iotop iftop。JDK自带了jconsole,可以直接运行后连接目标JVM。Tomcat那边,把应用部署到/opt/tomcat/webapps,启动后注意看catalina.out里的启动状态和监听端口。 - 建立基线指标:基线就是你判断“是否异常”的参照系。
- 系统基线:记录CPU空闲、内存可用、磁盘使用率、网络带宽在平稳时段的数值——这就是后续告警阈值的起点。
- 业务基线:用JMeter跑一遍典型业务链路(登录→查询→下单),记录p95/p99响应时间、TPS、错误率,作为性能回归和容量评估的标尺。
- 日志与异常巡检:实时跟踪可以用
tail -f catalina.out和logs/localhost.*.log,重点关注OutOfMemoryError、Full GC频繁、连接池耗尽、慢查询这类关键字。 - JVM诊断连接:本地直接用
jconsole连接localhost的端口/服务。远程的话,需要在Tomcat的catalina.sh里开启JMX(设置JMX端口和认证),然后用VisualVM/JMC远程连过去。 - 压测与复测:在JMeter里创建线程组和HTTP请求(协议/主机/端口/路径),添加聚合报告和图形结果监听器。逐步提升并发数,观察系统层和JVM层的指标如何联动变化——这才是找出瓶颈的正路。
三、关键指标与采集方法
指标一大堆,要抓重点。下面这个表把主流的几个维度都列了出来,方便对照着建告警策略:
| 维度 | 关键指标 | 采集方式/工具 | 典型告警阈值示例 |
|---|---|---|---|
| 系统资源 | CPU利用率、Load a vg | top/htop、sar | CPU>80%持续5分钟 |
| 内存 | 可用内存、Swap使用 | free -m、vmstat | 可用内存<10%或Swap持续增长 |
| 磁盘 | 使用率、IOPS/延迟 | df -h、iotop | 使用率>85% |
| 网络 | 带宽占用、重传率 | iftop、nload | 带宽>80%或重传率升高 |
| Tomcat | 线程池使用、请求耗时 | server.xml、访问日志、JMX | 线程池用尽、错误率升高 |
| JVM | Heap/Meta/Direct、GC次数与停顿 | VisualVM/JMC、JMX | Full GC频繁、Old区持续增长 |
| 业务 | p95/p99、TPS、错误率 | JMeter、应用埋点 | p95>2s或错误率>1% |
- Tomcat线程与连接器要点:重点关注
maxThreads、minSpareThreads、acceptCount和connectionTimeout——这几个参数直接影响并发承载和排队行为。 - JVM参数要点:设置好
-Xms/-Xmx(初始/最大堆),选合适的GC(比如G1 GC),目的是避免频繁Full GC和长停顿。
四、常见瓶颈与优化建议
最后这节是实战总结。碰到性能问题,通常可以从这几个方向破局:
- 代码与页面:减少JSP里的Ja va脚本,优先用JSTL/EL。启用JSP预编译,关闭开发期的自动重载——编译开销比你想象的要大。
- 数据访问:优化SQL和索引,尽量别在JSP里直连数据库。合理利用缓存(页面级、数据级、请求级)来降低后端压力。
- 静态资源:合并并压缩CSS/JS,用CDN分发,能有效减少首屏时间。
- 并发与连接:在
server.xml里调优maxThreads和acceptCount;在/etc/default/tomcat9里设置JA VA_OPTS(如-Xms/-Xmx/-XX:+UseG1GC);如果单实例扛不住,用Nginx做负载均衡扩展实例数。 - 监控闭环:把系统、JVM、业务指标和日志统一汇入时序库和日志平台,配置动态阈值,设置多渠道告警。最终要形成“发现→定位→验证→回归”的持续改进链路。