Ja va程序在Ubuntu上突然崩溃,日志里只有一行退出码,连个堆栈都没留下?别急着拍桌子,先按这套思路来排查,大概率能抓住真凶。

一 快速判断崩溃类型
崩溃的第一现场,往往藏在两个地方:JVM自身生成的日志,以及系统日志。先看看当前目录下有没有 hs_err_pid 文件,这个文件以 # A fatal error has been detected by the Ja va Runtime Environment: 开头,里面会明确告诉你是什么信号导致的——常见的有 SIGSEGV(本地代码或JVM本身的bug)、SIGABRT(断言失败、库冲突或被外部终止)、EXCEPTION_STACK_OVERFLOW(栈溢出)。这是判断JVM自身崩溃的第一手证据,比任何玄学都靠谱。
然后翻翻系统日志。Ubuntu上优先看 /var/log/syslog,有些老环境会写进 /var/log/messages。如果看到 killed by SIGKILL 或 SIGABRT,多半是OOM Killer(内存不足)或外部信号干的。要是应用一声不吭就退出了,而且没有 hs_err 文件,那就得从应用自身的日志和标准输出/错误输出入手(下一节会细说)。
二 定位步骤与命令清单
拿到进程PID是第一件事。用 jps -l 或 ps -ef | grep ja va 就能找到。然后分几路并行排查:
- 应用日志与标准输出/错误:实时跟踪试试
tail -f /proc/和/fd/1 tail -f /proc/,那些未捕获的异常、/fd/2 System.exit()调用,很可能就藏在里面。 - 线程与内存在线诊断:
jstack抓线程快照,多采样几次对比看有没有死锁或阻塞;jstat -gc看GC情况,jmap -histo看对象统计;必要时jmap -dump:format=b,file=heap.hprof生成堆转储。 - 系统层面资源与信号:
top/htop看CPU和内存,free -m看内存余量,df -h看磁盘,vmstat 1看换页和IO。然后grep -i "killed|ja va" /var/log/syslog搜一下相关日志。 - 堆转储分析:拿到
.hprof文件后,用Eclipse MAT打开,重点找泄漏对象和GC Roots路径,往往一针见血。
三 常见场景与对应处理
不同的崩溃表现,对应着不同的根因和修复手段。下面列几个高频场景:
- OOM Killer 终止进程(syslog出现killed by SIGKILL)
现象:系统内存紧张,Ja va进程被强制结束。
处理:要么加物理内存或换页空间,要么降低-Xmx,同时优化对象生命周期。建议开启Heap Dump并分析,另外检查容器或虚拟机的内存配额是否够用。 - JVM自身崩溃(生成hs_err_pid.log,多为SIGSEGV/EXCEPTION_ACCESS_VIOLATION)
现象:JVM遇到不可恢复的错误,直接挂了。
处理:优先升级到稳定的JDK版本;排查本地库(JNI、第三方so/dll)的兼容性和编译架构;如果用了JNI,用gdb加调试符号定位;在可控环境复现,尽量最小化用例。 - 栈溢出(EXCEPTION_STACK_OVERFLOW)
现象:递归太深或局部变量把栈撑爆了。
处理:增大栈大小-Xss;或者把递归改成迭代;大对象可以拆分或批量处理。 - 应用静默退出但无hs_err
现象:没有JVM致命日志,进程直接消失。
处理:先检查应用日志级别和输出路径,用/proc/捕获实时输出;用/fd/1|2 jstack抓现场线程;审查代码里是否调用了System.exit(),或者启动脚本超时被kill。 - 依赖与版本问题(如UnsupportedClassVersionError/NoClassDefFoundError)
现象:编译和运行JDK版本不一致,或者缺少依赖(比如Ja vaFX)。
处理:统一JDK版本;在Ubuntu上安装所需依赖(比如sudo apt-get install openjfx);正确设置JA VA_HOME、PATH、CLASSPATH;必要时重新编译。
四 最小可用诊断配置与一键命令示例
与其等到崩溃后再手忙脚乱,不如提前把诊断装备配好。推荐在启动参数中加上这些:
- 内存与转储:
-Xms512m -Xmx2g(根据机器内存调整)-XX:+HeapDumpOnOutOfMemoryError -XX:HeapDumpPath=/var/log/myapp/heap.hprof-XX:ErrorFile=/var/log/myapp/hs_err_pid%p.log
- 日志框架:把Log4j/Logback的级别调到DEBUG或INFO,并输出到文件,方便事后回溯。
另外,准备一个一键排查脚本,省得每次手工敲一堆命令。保存为 diagnose.sh,加上执行权限就能用:
#!/usr/bin/env bash
APP_JAR="your-app.jar"
PID=$(jps -l | grep "$APP_JAR" | awk '{print $1}')
if [ -z "$PID" ]; then
echo "未找到 Ja va 进程:$APP_JAR"
exit 1
fi
echo "=== 系统日志(最近20行,含 killed/ja va) ==="
grep -i "killed\|ja va" /var/log/syslog | tail -n 20
echo "=== 应用标准输出/错误输出 ==="
tail -n 200 /proc/$PID/fd/1 /proc/$PID/fd/2 2>/dev/null
echo "=== 线程快照(jstack) ==="
jstack -l $PID
echo "=== 堆摘要(jmap) ==="
jmap -histo $PID | head -n 30
echo "=== GC 概况(jstat) ==="
jstat -gc $PID
记得提前把 /var/log/myapp/ 目录的权限和磁盘空间准备好,确保 hs_err 和Heap Dump能正常写入。这样下次再崩溃,至少手里有粮,心里不慌。