Linux 服务为什么会被 OOM 杀掉:MemoryMax、日志证据与恢复边界
线上 Linux 服务突然退出,systemctl status 只留下一个“进程被杀”的结果时,先别急着把 MemoryMax 调大。要判断是不是 systemd 单元自己的 cgroup 触发了 OOM,至少要把单元配置、memory.events 计数和同一时间段的 journal 日志对上;如果是 systemd-oomd,还要看它记录的压力或 swap 原因。
MemoryMax是硬上限,达到后回收无法降下来时,cgroup 内可能触发 OOM。memory.events里的max、oom、oom_kill要结合时间和单元路径判断,不能只看一个计数。- 先用
MemoryHigh观察峰值和回收压力,再决定是否调整MemoryMax,避免盲目放大上限。 - 恢复动作必须包含服务状态、峰值、日志和回滚配置四项验收。
先分清是硬限制还是整机内存压力
同样是服务退出,来源可能完全不同:单元的 cgroup 达到 MemoryMax,整机可用内存耗尽,或者 systemd-oomd 根据 memory pressure 主动选择了某个 cgroup。三者的处理顺序不一样。
| 证据 | 更可能说明什么 | 下一步 |
|---|---|---|
memory.events 的 oom_kill 增长 | 该 cgroup 内发生过 OOM kill | 对照 memory.max、峰值和服务日志 |
只看到 high 增长 | 进程被限流并承受直接回收压力 | 检查峰值、分配速率和是否应降载 |
| oomd 日志出现 memory-pressure | 用户态 OOM 管理器做了选择 | 看关联 slice、swap 和压力阈值 |
判断时保留故障发生前后的时间窗口。计数器是累计值,单独读到一个非零数字,只能说明历史上发生过事件。
用 systemctl 和 cgroup 文件把证据串起来
先读取单元当前的资源配置和状态,再找到它对应的 control group。下面的命令只读配置和统计,不会重启服务:
unit=order-worker.service
systemctl show "$unit" \
-p ControlGroup -p MemoryAccounting -p MemoryHigh -p MemoryMax \
-p ManagedOOMMemoryPressure -p ActiveState -p SubState
systemctl status "$unit" --no-pager
systemctl show "$unit" -p ControlGroup --value
如果输出的 ControlGroup 是 /system.slice/order-worker.service,在 cgroup v2 挂载点下读取对应目录。生产环境不要把路径硬编码成另一台机器的层级,先用 findmnt -T /sys/fs/cgroup 确认挂载方式。
cg=/sys/fs/cgroup/system.slice/order-worker.service
printf '%s\n' '--- limits ---'
cat "$cg/memory.current" "$cg/memory.peak" "$cg/memory.high" "$cg/memory.max"
printf '%s\n' '--- events ---'
cat "$cg/memory.events"
printf '%s\n' '--- local events ---'
cat "$cg/memory.events.local"

最有价值的组合通常是:memory.peak 接近或达到 memory.max,同时 memory.events 的 max、oom 或 oom_kill 在故障后增加。若只看到 high 增加,说明服务经历了高水位回收,不足以证明已经被 OOM 杀掉。
把 journalctl 时间线和 OOM 来源对上
接着查单元日志与内核日志。不要只搜索“killed”,因为不同发行版和 systemd 版本的表述可能不同:
unit=order-worker.service
systemctl show "$unit" -p ExecMainCode -p ExecMainStatus -p Result
journalctl -u "$unit" --since "10 min ago" --no-pager
journalctl -k --since "10 min ago" --no-pager \
| rg -i 'out of memory|oom-kill|killed process|memory cgroup'
journalctl -u systemd-oomd --since "10 min ago" --no-pager
如果内核日志指出某个 memory cgroup 内的进程被杀,并且单元的事件计数同步增长,可以把根因收敛到该 cgroup。若只有 systemd-oomd 日志,看到 memory-pressure 或 memory-used,则要继续检查 oomd 管理的层级,不要把它写成内核直接触发的 MemoryMax。
先观察 MemoryHigh,再决定是否改 MemoryMax
MemoryHigh 更适合作为观察和降压边界:超过它会让进程承受更强的回收压力,但本身不会触发 OOM killer。硬上限 MemoryMax 则是最后一道边界,设置过低会把正常的缓存峰值变成服务退出。
# 先建立可回滚的 drop-in,不直接改发行版原文件
sudo systemctl edit order-worker.service
[Service]
MemoryAccounting=yes
MemoryHigh=768M
MemoryMax=1G
保存后执行:
sudo systemctl daemon-reload
sudo systemctl restart order-worker.service
systemctl show order-worker.service -p MemoryHigh -p MemoryMax -p ControlGroup
systemctl is-active order-worker.service
这次重启本身会改变业务状态,所以应安排在可接受窗口。验收不能只看 active:至少观察一段真实负载,记录 memory.current、memory.peak 和 memory.events 的变化,并确认请求或任务队列没有持续堆积。

四个容易误判的恢复边界
单元的 MemoryMax 不等于整机总内存
它限制的是单元及其子孙 cgroup 的记账范围。提高它之前,要确认上层 slice、容器或宿主机还有可用余量,否则只是把问题从服务边界推到更大的范围。
累计事件不能代替故障时间线
memory.events 是计数器。修复前后各保存一次,并把读取时间写进值班记录,才能判断本次重启是否又产生了新的 oom_kill。
只重启服务可能掩盖泄漏
重启能清空进程内存,却不会解决持续增长的缓存、批量读取或未释放资源。用 memory.peak 和应用自己的指标观察增长速度,必要时再回到堆、缓存和请求并发排查。
回滚要回到 drop-in 文件
如果新限制导致启动失败或延迟明显升高,删除对应的 /etc/systemd/system/order-worker.service.d/ drop-in,执行 daemon-reload 后再按原配置启动。不要只在命令行临时改值,临时值很容易让下一次重启恢复成另一套配置。
相关问题
MemoryHigh 超限会直接杀进程吗?
不会。它主要触发更强的回收和限流;如果随后仍触碰硬边界或整机发生 OOM,才可能出现进程被杀。
为什么 memory.events 的 oom_kill 没增长但服务退出了?
可能是服务自身退出、被管理员停止、依赖失败,或 systemd-oomd 在另一个层级做了处理。应同时看 Result、内核日志和 oomd 日志,不能只凭服务退出状态下结论。
调大 MemoryMax 前最少看哪些指标?
至少看 memory.peak、memory.current、memory.events,再结合请求并发、缓存大小和宿主机余量。没有峰值和时间线,调参只是把故障推迟。
总结
Linux 服务的 OOM 排查要先建立证据链:单元配置确定边界,cgroup 文件确认峰值和事件,journalctl 区分内核 OOM 与 systemd-oomd,最后用可回滚的 drop-in 做小步调整。把 MemoryHigh 当观察线、把 MemoryMax 当硬边界,恢复后继续看峰值和事件计数,才不会把一次重启误当成问题解决。
Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验
- 上一篇
- Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验
- 下一篇
- Go maps.DeleteFunc 怎么安全删掉不合格键:遍历语义、判定副作用与并发边界
-
- 文章 · linux | 15小时前 | linux运维 · Linux 日志清理 磁盘空间 journalctl systemd-journald
- journalctl vacuum-size 清理日志的保留策略
- 328浏览 收藏
-
- 文章 · linux | 16小时前 |
- OpenSSH ControlMaster 复用连接的失效原因
- 278浏览 收藏
-
- 文章 · linux | 17小时前 |
- systemd OnCalendar 处理带时区的定时任务
- 453浏览 收藏
-
- 文章 · linux | 21小时前 | 容器 · Linux · Linux mount namespace 挂载传播 bind mount shared mount
- mount namespace 中绑定挂载的传播属性
- 342浏览 收藏
-
- 文章 · linux | 22小时前 |
- ip rule 与多路由表实现策略路由
- 406浏览 收藏
-
- 文章 · linux | 1天前 |
- nftables 动态集合维护临时封禁地址
- 248浏览 收藏
-
- 文章 · linux | 1天前 | Linux · journalctl Linux日志 journald systemd-journald Storage=persistent
- journald Storage=persistent 保留重启前日志
- 147浏览 收藏
-
- 文章 · linux | 1天前 |
- systemd watchdog 监测服务心跳的配置方法
- 482浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 417次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 496次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 504次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 453次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 281次使用
-
- Go HTTP 客户端超时实战:别让默认 Client 拖垮 goroutine
- 2026-06-04 205浏览
-
- Go HTTP 响应体忘记关闭:连接占用与 Goroutine 增长的排查修复
- 2026-07-13 201浏览
-
- Go JSON 严格解码上线后请求变 400:DisallowUnknownFields 的兼容性故障复盘
- 2026-07-26 174浏览
-
- Go iter.Pull 怎么安全消费迭代器:停止时机、资源释放与 goroutine 泄漏排查
- 2026-08-26 423浏览
-
- Go net/http 的 ConnState 如何识别连接泄漏:状态转移、计数采样与回收验证
- 2026-08-27 311浏览

