当前位置:首页 > 文章列表 > 文章 > linux > Linux 服务为什么会被 OOM 杀掉:MemoryMax、日志证据与恢复边界

Linux 服务为什么会被 OOM 杀掉:MemoryMax、日志证据与恢复边界

来源:17golang原创 2026-08-26 18:22:31 0浏览 收藏

线上 Linux 服务突然退出,systemctl status 只留下一个“进程被杀”的结果时,先别急着把 MemoryMax 调大。要判断是不是 systemd 单元自己的 cgroup 触发了 OOM,至少要把单元配置、memory.events 计数和同一时间段的 journal 日志对上;如果是 systemd-oomd,还要看它记录的压力或 swap 原因。

要点速览
  • MemoryMax 是硬上限,达到后回收无法降下来时,cgroup 内可能触发 OOM。
  • memory.events 里的 maxoomoom_kill 要结合时间和单元路径判断,不能只看一个计数。
  • 先用 MemoryHigh 观察峰值和回收压力,再决定是否调整 MemoryMax,避免盲目放大上限。
  • 恢复动作必须包含服务状态、峰值、日志和回滚配置四项验收。

先分清是硬限制还是整机内存压力

同样是服务退出,来源可能完全不同:单元的 cgroup 达到 MemoryMax,整机可用内存耗尽,或者 systemd-oomd 根据 memory pressure 主动选择了某个 cgroup。三者的处理顺序不一样。

证据更可能说明什么下一步
memory.eventsoom_kill 增长该 cgroup 内发生过 OOM kill对照 memory.max、峰值和服务日志
只看到 high 增长进程被限流并承受直接回收压力检查峰值、分配速率和是否应降载
oomd 日志出现 memory-pressure用户态 OOM 管理器做了选择看关联 slice、swap 和压力阈值

判断时保留故障发生前后的时间窗口。计数器是累计值,单独读到一个非零数字,只能说明历史上发生过事件。

用 systemctl 和 cgroup 文件把证据串起来

先读取单元当前的资源配置和状态,再找到它对应的 control group。下面的命令只读配置和统计,不会重启服务:

unit=order-worker.service
systemctl show "$unit" \
  -p ControlGroup -p MemoryAccounting -p MemoryHigh -p MemoryMax \
  -p ManagedOOMMemoryPressure -p ActiveState -p SubState
systemctl status "$unit" --no-pager
systemctl show "$unit" -p ControlGroup --value

如果输出的 ControlGroup/system.slice/order-worker.service,在 cgroup v2 挂载点下读取对应目录。生产环境不要把路径硬编码成另一台机器的层级,先用 findmnt -T /sys/fs/cgroup 确认挂载方式。

cg=/sys/fs/cgroup/system.slice/order-worker.service
printf '%s\n' '--- limits ---'
cat "$cg/memory.current" "$cg/memory.peak" "$cg/memory.high" "$cg/memory.max"
printf '%s\n' '--- events ---'
cat "$cg/memory.events"
printf '%s\n' '--- local events ---'
cat "$cg/memory.events.local"
Linux systemd 服务 MemoryMax 与 cgroup memory.events 的 OOM 证据对应关系

最有价值的组合通常是:memory.peak 接近或达到 memory.max,同时 memory.eventsmaxoomoom_kill 在故障后增加。若只看到 high 增加,说明服务经历了高水位回收,不足以证明已经被 OOM 杀掉。

把 journalctl 时间线和 OOM 来源对上

接着查单元日志与内核日志。不要只搜索“killed”,因为不同发行版和 systemd 版本的表述可能不同:

unit=order-worker.service
systemctl show "$unit" -p ExecMainCode -p ExecMainStatus -p Result
journalctl -u "$unit" --since "10 min ago" --no-pager
journalctl -k --since "10 min ago" --no-pager \
  | rg -i 'out of memory|oom-kill|killed process|memory cgroup'
journalctl -u systemd-oomd --since "10 min ago" --no-pager

如果内核日志指出某个 memory cgroup 内的进程被杀,并且单元的事件计数同步增长,可以把根因收敛到该 cgroup。若只有 systemd-oomd 日志,看到 memory-pressurememory-used,则要继续检查 oomd 管理的层级,不要把它写成内核直接触发的 MemoryMax

先观察 MemoryHigh,再决定是否改 MemoryMax

MemoryHigh 更适合作为观察和降压边界:超过它会让进程承受更强的回收压力,但本身不会触发 OOM killer。硬上限 MemoryMax 则是最后一道边界,设置过低会把正常的缓存峰值变成服务退出。

# 先建立可回滚的 drop-in,不直接改发行版原文件
sudo systemctl edit order-worker.service

[Service]
MemoryAccounting=yes
MemoryHigh=768M
MemoryMax=1G

保存后执行:

sudo systemctl daemon-reload
sudo systemctl restart order-worker.service
systemctl show order-worker.service -p MemoryHigh -p MemoryMax -p ControlGroup
systemctl is-active order-worker.service

这次重启本身会改变业务状态,所以应安排在可接受窗口。验收不能只看 active:至少观察一段真实负载,记录 memory.currentmemory.peakmemory.events 的变化,并确认请求或任务队列没有持续堆积。

Linux systemd 服务从 MemoryHigh 观察到 MemoryMax 调整后的恢复与回滚检查

四个容易误判的恢复边界

单元的 MemoryMax 不等于整机总内存

它限制的是单元及其子孙 cgroup 的记账范围。提高它之前,要确认上层 slice、容器或宿主机还有可用余量,否则只是把问题从服务边界推到更大的范围。

累计事件不能代替故障时间线

memory.events 是计数器。修复前后各保存一次,并把读取时间写进值班记录,才能判断本次重启是否又产生了新的 oom_kill

只重启服务可能掩盖泄漏

重启能清空进程内存,却不会解决持续增长的缓存、批量读取或未释放资源。用 memory.peak 和应用自己的指标观察增长速度,必要时再回到堆、缓存和请求并发排查。

回滚要回到 drop-in 文件

如果新限制导致启动失败或延迟明显升高,删除对应的 /etc/systemd/system/order-worker.service.d/ drop-in,执行 daemon-reload 后再按原配置启动。不要只在命令行临时改值,临时值很容易让下一次重启恢复成另一套配置。

相关问题

MemoryHigh 超限会直接杀进程吗?

不会。它主要触发更强的回收和限流;如果随后仍触碰硬边界或整机发生 OOM,才可能出现进程被杀。

为什么 memory.events 的 oom_kill 没增长但服务退出了?

可能是服务自身退出、被管理员停止、依赖失败,或 systemd-oomd 在另一个层级做了处理。应同时看 Result、内核日志和 oomd 日志,不能只凭服务退出状态下结论。

调大 MemoryMax 前最少看哪些指标?

至少看 memory.peakmemory.currentmemory.events,再结合请求并发、缓存大小和宿主机余量。没有峰值和时间线,调参只是把故障推迟。

总结

Linux 服务的 OOM 排查要先建立证据链:单元配置确定边界,cgroup 文件确认峰值和事件,journalctl 区分内核 OOM 与 systemd-oomd,最后用可回滚的 drop-in 做小步调整。把 MemoryHigh 当观察线、把 MemoryMax 当硬边界,恢复后继续看峰值和事件计数,才不会把一次重启误当成问题解决。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验
上一篇
Python sqlite3 Connection serialize 怎么导出数据库快照:备份窗口、内存占用与恢复校验
Go maps.DeleteFunc 怎么安全删掉不合格键:遍历语义、判定副作用与并发边界
下一篇
Go maps.DeleteFunc 怎么安全删掉不合格键:遍历语义、判定副作用与并发边界
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • ljg-skills -
    ljg-skills
    ljg-skills 是李继刚开源的 AI 技能与提示词集合,面向大模型使用者整理了一批可复用的 prompt、角色设定和任务技能模板,适合用于学习提示词设计、搭建个人 AI 工作流和沉淀团队常用智能体能力。
    5289次使用
  • MELO音乐 - AI 音乐生成平台,支持多模态创作能力
    MELO音乐
    MELO音乐是一站式AI视频与音乐制作助手,对标suno, udio的高品质体验。提供伴奏生成、原创写词、无损导出、哼唱识曲、混音变声等全套音频与短视频编辑工具。无论是流行Kpop、电音说唱、民谣古风、摇滚儿歌还是商用轻音乐,MELO为你免费谱曲,轻松做同款!
    4800次使用
  • UniScribe - AI 免费在线音视频转文字平台
    UniScribe
    UniScribe 是一款 AI 音视频转文字与内容整理工具,支持上传音频、视频文件或粘贴 YouTube 链接,自动生成转写文本、摘要、思维导图和关键问题,并支持多格式导出,适合会议记录、课程学习、访谈整理和内容创作复盘。
    4746次使用
  • 剧云 - 免费 AI 智能中文剧本创作平台
    剧云
    剧云是专业中文剧本创作平台,安全稳定运行十余年,集成AI编剧、剧本医生审核、人物小传、剧情关系图、大纲编写、多人协作、Word导入导出、版权管控功能,数据安全防护,轻松高效创作剧本。
    5010次使用
  • 万象有声 - AI 一站式有声内容创作平台
    万象有声
    万象有声,一个专为有声创作者打造的新一代智能有声内容创作平台。平台提供专业的智能拆章、智能画本编辑、AI配音、AI生成音效、后期制作、智能对轨、智能审听等有声创作全流程工具,可以帮助创作者高效、低成本创作出引人入胜的有声作品。立即体验,让有声书制作更简单!
    4952次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码