当前位置:首页 > 文章列表 > 文章 > linux > Linux 服务为什么会被 OOM 杀掉:MemoryMax、日志证据与恢复边界

Linux 服务为什么会被 OOM 杀掉:MemoryMax、日志证据与恢复边界

来源:17golang原创 2026-08-26 18:22:31 0浏览 收藏

线上 Linux 服务突然退出,systemctl status 只留下一个“进程被杀”的结果时,先别急着把 MemoryMax 调大。要判断是不是 systemd 单元自己的 cgroup 触发了 OOM,至少要把单元配置、memory.events 计数和同一时间段的 journal 日志对上;如果是 systemd-oomd,还要看它记录的压力或 swap 原因。

要点速览
  • MemoryMax 是硬上限,达到后回收无法降下来时,cgroup 内可能触发 OOM。
  • memory.events 里的 max、oom、oom_kill 要结合时间和单元路径判断,不能只看一个计数。
  • 先用 MemoryHigh 观察峰值和回收压力,再决定是否调整 MemoryMax,避免盲目放大上限。
  • 恢复动作必须包含服务状态、峰值、日志和回滚配置四项验收。

先分清是硬限制还是整机内存压力

同样是服务退出,来源可能完全不同:单元的 cgroup 达到 MemoryMax,整机可用内存耗尽,或者 systemd-oomd 根据 memory pressure 主动选择了某个 cgroup。三者的处理顺序不一样。

证据更可能说明什么下一步
memory.events 的 oom_kill 增长该 cgroup 内发生过 OOM kill对照 memory.max、峰值和服务日志
只看到 high 增长进程被限流并承受直接回收压力检查峰值、分配速率和是否应降载
oomd 日志出现 memory-pressure用户态 OOM 管理器做了选择看关联 slice、swap 和压力阈值

判断时保留故障发生前后的时间窗口。计数器是累计值,单独读到一个非零数字,只能说明历史上发生过事件。

用 systemctl 和 cgroup 文件把证据串起来

先读取单元当前的资源配置和状态,再找到它对应的 control group。下面的命令只读配置和统计,不会重启服务:

unit=order-worker.service
systemctl show "$unit" \
  -p ControlGroup -p MemoryAccounting -p MemoryHigh -p MemoryMax \
  -p ManagedOOMMemoryPressure -p ActiveState -p SubState
systemctl status "$unit" --no-pager
systemctl show "$unit" -p ControlGroup --value

如果输出的 ControlGroup 是 /system.slice/order-worker.service,在 cgroup v2 挂载点下读取对应目录。生产环境不要把路径硬编码成另一台机器的层级,先用 findmnt -T /sys/fs/cgroup 确认挂载方式。

cg=/sys/fs/cgroup/system.slice/order-worker.service
printf '%s\n' '--- limits ---'
cat "$cg/memory.current" "$cg/memory.peak" "$cg/memory.high" "$cg/memory.max"
printf '%s\n' '--- events ---'
cat "$cg/memory.events"
printf '%s\n' '--- local events ---'
cat "$cg/memory.events.local"
Linux systemd 服务 MemoryMax 与 cgroup memory.events 的 OOM 证据对应关系

最有价值的组合通常是:memory.peak 接近或达到 memory.max,同时 memory.events 的 max、oom 或 oom_kill 在故障后增加。若只看到 high 增加,说明服务经历了高水位回收,不足以证明已经被 OOM 杀掉。

把 journalctl 时间线和 OOM 来源对上

接着查单元日志与内核日志。不要只搜索“killed”,因为不同发行版和 systemd 版本的表述可能不同:

unit=order-worker.service
systemctl show "$unit" -p ExecMainCode -p ExecMainStatus -p Result
journalctl -u "$unit" --since "10 min ago" --no-pager
journalctl -k --since "10 min ago" --no-pager \
  | rg -i 'out of memory|oom-kill|killed process|memory cgroup'
journalctl -u systemd-oomd --since "10 min ago" --no-pager

如果内核日志指出某个 memory cgroup 内的进程被杀,并且单元的事件计数同步增长,可以把根因收敛到该 cgroup。若只有 systemd-oomd 日志,看到 memory-pressure 或 memory-used,则要继续检查 oomd 管理的层级,不要把它写成内核直接触发的 MemoryMax。

先观察 MemoryHigh,再决定是否改 MemoryMax

MemoryHigh 更适合作为观察和降压边界:超过它会让进程承受更强的回收压力,但本身不会触发 OOM killer。硬上限 MemoryMax 则是最后一道边界,设置过低会把正常的缓存峰值变成服务退出。

# 先建立可回滚的 drop-in,不直接改发行版原文件
sudo systemctl edit order-worker.service

[Service]
MemoryAccounting=yes
MemoryHigh=768M
MemoryMax=1G

保存后执行:

sudo systemctl daemon-reload
sudo systemctl restart order-worker.service
systemctl show order-worker.service -p MemoryHigh -p MemoryMax -p ControlGroup
systemctl is-active order-worker.service

这次重启本身会改变业务状态,所以应安排在可接受窗口。验收不能只看 active:至少观察一段真实负载,记录 memory.current、memory.peak 和 memory.events 的变化,并确认请求或任务队列没有持续堆积。

Linux systemd 服务从 MemoryHigh 观察到 MemoryMax 调整后的恢复与回滚检查

四个容易误判的恢复边界

单元的 MemoryMax 不等于整机总内存

它限制的是单元及其子孙 cgroup 的记账范围。提高它之前,要确认上层 slice、容器或宿主机还有可用余量,否则只是把问题从服务边界推到更大的范围。

累计事件不能代替故障时间线

memory.events 是计数器。修复前后各保存一次,并把读取时间写进值班记录,才能判断本次重启是否又产生了新的 oom_kill。

只重启服务可能掩盖泄漏

重启能清空进程内存,却不会解决持续增长的缓存、批量读取或未释放资源。用 memory.peak 和应用自己的指标观察增长速度,必要时再回到堆、缓存和请求并发排查。

回滚要回到 drop-in 文件

如果新限制导致启动失败或延迟明显升高,删除对应的 /etc/systemd/system/order-worker.service.d/ drop-in,执行 daemon-reload 后再按原配置启动。不要只在命令行临时改值,临时值很容易让下一次重启恢复成另一套配置。

相关问题

MemoryHigh 超限会直接杀进程吗?

不会。它主要触发更强的回收和限流;如果随后仍触碰硬边界或整机发生 OOM,才可能出现进程被杀。

为什么 memory.events 的 oom_kill 没增长但服务退出了?

可能是服务自身退出、被管理员停止、依赖失败,或 systemd-oomd 在另一个层级做了处理。应同时看 Result、内核日志和 oomd 日志,不能只凭服务退出状态下结论。

调大 MemoryMax 前最少看哪些指标?

至少看 memory.peak、memory.current、memory.events,再结合请求并发、缓存大小和宿主机余量。没有峰值和时间线,调参只是把故障推迟。

总结

Linux 服务的 OOM 排查要先建立证据链:单元配置确定边界,cgroup 文件确认峰值和事件,journalctl 区分内核 OOM 与 systemd-oomd,最后用可回滚的 drop-in 做小步调整。把 MemoryHigh 当观察线、把 MemoryMax 当硬边界,恢复后继续看峰值和事件计数,才不会把一次重启误当成问题解决。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验
上一篇
Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验
Go maps.DeleteFunc 怎么安全删掉不合格键:遍历语义、判定副作用与并发边界
下一篇
Go maps.DeleteFunc 怎么安全删掉不合格键:遍历语义、判定副作用与并发边界
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    417次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    496次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    504次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    453次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    281次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码