Linux系统崩溃分析教程:kdump与crash使用详解
有志者,事竟成!如果你在学习文章,那么本文《Linux系统崩溃分析:kdump与crash使用教程》,就很适合你!文章讲解的知识点主要包括,若是你对本文感兴趣,或者是想搞懂其中某个知识点,就请你继续往下看吧~
首先确认kdump已启用:检查crashkernel参数、kdump服务状态及/var/crash空间;再进入最新崩溃目录,用cat查看dmesg.定位panic/Oops线索;最后用crash工具结合vmlinux解析dump.获取调用栈等深层信息。

如果您遇到Linux系统意外重启或内核崩溃,但未及时捕获现场,则需依赖kdump机制生成的崩溃转储文件进行回溯分析。以下是查看系统崩溃信息的具体操作路径与方法:
一、确认kdump服务是否已启用并正常运行
只有kdump服务处于激活状态且内存预留成功,系统崩溃后才能生成有效转储。该步骤用于验证基础环境是否就绪。
1、检查内核启动参数中是否包含crashkernel配置:
执行命令 grep crashkernel /proc/cmdline,若输出含 crashkernel=auto 或类似 crashkernel=256M@16M 字样,表示已预留崩溃内核内存。
2、检查kdump服务当前运行状态:
执行命令 systemctl status kdump,确认输出中显示 active (running) 且无 failed 提示。
3、检查kdump配置的存储目录是否存在且空间充足:
查看 /etc/kdump.conf 中 path 指定的目录(默认为 /var/crash),再用 df -h /var/crash 确认挂载点剩余空间不少于2GB。
二、定位并识别崩溃日志文件
/var/crash 目录下按时间戳组织子目录,每个子目录对应一次崩溃事件,其中包含多种关键诊断文件,需区分其用途与可读性。
1、进入最新崩溃时间戳子目录:
执行命令 ls -t /var/crash | head -n1 获取最新目录名,再执行 cd /var/crash/$(ls -t /var/crash | head -n1) 进入该目录。
2、列出目录内核心文件:
执行命令 ls dmesg.* dump.* linux-image-*.crash,确认存在三类文件:dmesg.XXXX(文本格式)、dump.XXXX(二进制vmcore)、linux-image-*.crash(结构化报告)。
3、快速查看崩溃前内核日志快照:
执行命令 cat dmesg.* | tail -n 50,重点查找末尾是否含 Kernel panic - not syncing、Oops 或 Call Trace: 等直接致因线索。
三、使用crash工具解析vmcore内存转储
vmcore是崩溃瞬间的完整物理内存镜像,必须配合对应内核版本的vmlinux调试符号文件才能解析,crash提供交互式命令提取进程、堆栈、日志等深层状态。
1、安装crash工具及对应debuginfo包:
在RHEL/CentOS上执行 yum install crash kernel-debuginfo-$(uname -r);在Debian/Ubuntu上执行 apt install crash linux-image-$(uname -r)-dbgsym。
2、确认vmlinux文件路径:
执行命令 find /usr/lib/debug/lib/modules/$(uname -r) -name "vmlinux" 2>/dev/null,获取完整路径(如 /usr/lib/debug/lib/modules/6.12.28/vmlinux)。
3、启动crash分析会话:
执行命令 crash /path/to/vmlinux /var/crash/$(ls -t /var/crash | head -n1)/dump.*,替换路径为实际查得值,进入crash交互界面。
4、在crash提示符下执行关键诊断命令:
输入 log 查看内核环形缓冲区原始日志;输入 bt -a 显示所有CPU的崩溃时调用栈;输入 ps | grep -E "(D|Z)" 检查是否存在不可中断睡眠或僵尸进程。
四、直接解析dmesg快照文件
dmesg.XXXX 文件是纯文本格式,无需额外工具即可直接阅读,内容覆盖崩溃前数秒的硬件检测、驱动加载、内存分配及错误触发全过程,是最快捷的初筛手段。
1、提取崩溃前后200行日志:
执行命令 awk '/Kernel panic|Oops|Call Trace|BUG:/ {line=NR} END {for(i=line-10;i,高亮显示关键错误行及其上下文。
2、过滤重复硬件报错信息:
执行命令 grep -E "(error|fail|warn|temperature|timeout|reset)" dmesg.* | sort | uniq -c | sort -nr | head -n10,统计高频硬件异常关键词及出现次数。
3、检查内存管理相关线索:
执行命令 grep -A5 -B5 "Out of memory\|oom_kill_process\|page allocation failure" dmesg.*,定位是否由内存耗尽引发OOM Killer强制终止进程。
五、检查系统级崩溃日志与启动记录
除kdump专属日志外,系统本身还保留多层日志痕迹,可用于交叉验证崩溃时间点、服务状态及硬件事件,尤其适用于kdump未触发或vmcore损坏场景。
1、查询最近一次系统启动后的内核日志:
执行命令 dmesg -T | grep -E "(panic|oops|error|fail|warning)" | tail -n 20,-T 参数启用本地时间戳,便于比对业务日志时间。
2、检索systemd日志中崩溃时段记录:
执行命令 journalctl --since "1 hour ago" | grep -i -E "(panic|crash|kdump|reboot|shutdown)",确认kdump是否成功捕获、是否发生非预期重启。
3、检查硬件固件与电源事件:
执行命令 journalctl -k | grep -i -E "(acpi|firmware|power|thermal|nmi)" | tail -n 15,排查ACPI表异常、固件bug、过热关机或NMI中断风暴等底层问题。
到这里,我们也就讲完了《Linux系统崩溃分析教程:kdump与crash使用详解》的内容了。个人认为,基础知识的学习和巩固,是为了更好的将其运用到项目中,欢迎关注golang学习网公众号,带你了解更多关于的知识点!
PHPcount函数使用教程及统计实例
- 上一篇
- PHPcount函数使用教程及统计实例
- 下一篇
- WPS演示母版设置统一风格技巧
-
- 文章 · linux | 1小时前 | Linux · systemd Restart RestartMode 依赖单元
- systemd RestartMode 怎么减少依赖单元连锁失败
- 239浏览 收藏
-
- 文章 · linux | 4小时前 | 定时任务 · Linux · 运维 · Cron OnCalendar Persistent systemd timer systemd-analyze calendar
- systemd timer 替代 cron 的日历表达式配置
- 364浏览 收藏
-
- 文章 · linux | 8小时前 | Linux · 内存管理 · Linux 内存限制 cgroup v2 memory.events
- cgroup v2 限制服务内存并观察回收事件
- 494浏览 收藏
-
- 文章 · linux | 1天前 | Linux · mount namespace unshare Linux挂载隔离
- mount namespace 隔离临时挂载的操作边界
- 462浏览 收藏
-
- 文章 · linux | 2天前 | Linux · 运维 · GNU tar 增量归档 listed-incremental exclude-from CACHEDIR.TAG
- tar 增量归档排除缓存目录的参数组合
- 324浏览 收藏
-
- 文章 · linux | 5天前 | Linux · 运维 · 日志排查 · journalctl 启动日志 Boot ID --list-boots systemd日志导出
- journalctl 按启动会话筛选并导出日志
- 369浏览 收藏
-
- 文章 · linux | 5天前 | Linux · Linux防火墙 nftables verdict map 多端口策略
- nftables verdict map 组织多端口策略的规则设计
- 475浏览 收藏
-
- 文章 · linux | 5天前 | 权限控制 · 服务管理 · systemd socket激活 systemd.socket ListenStream Accept
- systemd socket 激活服务的依赖与监听配置
- 229浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 324次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 378次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 375次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 338次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 164次使用
-
- Linux vmstat 如何分辨内存抖动与磁盘等待:si、so、wa 与复测顺序
- 2026-08-30 501浏览
-
- Linux搭建vsftpdFTP服务器教程
- 2026-04-30 501浏览
-
- Shell脚本安装教程:.sh一键安装指南
- 2026-03-16 501浏览
-
- Linux清空文件内容的几种方法
- 2025-12-01 501浏览
-
- Linux命令行下载文件技巧
- 2025-11-23 501浏览

