当前位置:首页 > 文章列表 > 文章 > linux > Linux 磁盘满了但 du 找不到大文件:deleted 文件占用空间怎么排查

Linux 磁盘满了但 du 找不到大文件:deleted 文件占用空间怎么排查

来源:17golang原创 2026-07-07 18:04:23 0浏览 收藏

线上机器弹出根分区使用率告警,第一反应通常是找大日志:df -h 一看使用率已经到98%,可 du -sh /* 扫完整个文件夹层级却对不上数值,所有可见文件加起来远没到告警标出的占用大小。这种情况别急着删更多文件,先排查「已经从文件夹里删除,但仍然被进程持有句柄」的文件。Linux 里文件从文件夹列表里消失,不代表磁盘空间会立刻释放;只要还有进程握着对应的文件句柄,占用的空间就不会被回收。

要点速览

  • df 统计的是文件系统真实整体占用,du 只统计当前文件夹层级下的可见文件,两者统计口径不一样。
  • df 满了但 du 统计出的总占用不大,优先查被删除但仍被进程占用的文件。
  • lsof +L1 可以列出硬链接数小于 1 的已打开文件,常用于定位被占用的未释放 deleted 日志。
  • 释放空间前先确认 PID 和对应服务归属,优先重启关联服务,不要盲目杀掉关键业务进程。

先确认 df 告警的是哪个挂载点

排查磁盘满问题,第一步不是直接跑 du 扫全盘文件夹,而是先确认到底哪个文件系统挂载点满了。很多服务器有单独的 /data、/var、容器专属挂载路径或者独立数据盘,查错挂载点会浪费大量排查时间。

df -h
df -ih

df -h 看块容量使用率,df -ih 看 inode 占用率。容量满和 inode 满是两类完全不同的问题,最终表现都可能是「新文件写不进去」。如果块容量还有剩余但 inode 已经100%,就要去查大量零散小文件;如果块容量已经接近100%,再继续往下排查文件夹或进程的占用。

对比 du 统计结果:文件夹统计数值为什么对不上

确认出问题的挂载点以后,再单独针对这个挂载点做文件夹占用统计。比如根分区满了,可以先扫根路径下的一级子文件夹;如果是 /var 分区满了,就只扫 /var 路径下的内容,不要把其他挂载点的占用混进统计结果里。

du -xhd1 /
du -xhd1 /var | sort -h

-x 的作用是限定统计范围留在当前文件系统内,避免统计过程中跳转到其他挂载点。这里如果发现 du 统计出来的所有文件夹总占用,明显小于 df 显示的已用容量,比如 df 显示已经用了 80G,但所有可见文件夹加起来只有 45G,就要把排查方向转向被标记为 deleted 的已删文件和进程持有的文件句柄。

Linux df 显示磁盘满但 du 不大时用 lsof +L1 定位 deleted 文件

用 lsof +L1 定位 deleted 文件

能直接把这类场景定位清楚的常用命令是 lsof +L1。它会列出所有硬链接数小于 1、但仍然被进程打开的文件,输出结果里会直接看到 deleted 标记。

lsof +L1
lsof +L1 | sort -k7 -n

重点看输出里的三列内容:进程名、PID、文件大小。比如某个 Java 服务、Nginx 工作进程或者自研后端进程,还持有着一个已经从文件夹里删除的 access.log,这个文件现在在文件夹里已经完全看不到,du 统计的时候自然扫不到它,但对应的磁盘空间还被文件系统持续占用。

检查项 命令 判断方式
块容量是否真的满 df -h 确认具体出问题的挂载点和当前使用率
inode 是否耗尽 df -ih inode 占用100%时优先排查大量零散小文件
可见文件夹总占用 du -xhd1 /path 对比文件夹统计总量是否接近 df 显示的已用值
已删除未释放文件 lsof +L1 核对 deleted、PID 和对应文件的大小

释放空间前先确认 PID 对应的服务归属

找到占用 deleted 文件的 PID 以后,不要马上 kill -9 操作。先确认这个进程属于哪个业务服务、有没有配置守护进程、是否支持安全重启。生产环境里,重启一个普通日志采集服务和杀掉正在运行的数据库主进程,风险级别完全不同。

ps -fp 1234
readlink /proc/1234/exe
ls -l /proc/1234/fd | grep deleted

如果确认是普通业务服务持有已经删除的旧日志,优先用对应服务的管理命令重启,让它重新生成并打开新的日志文件。systemd 管理的服务可以用 systemctl restart app.service 操作;如果是 Nginx 这类本身支持平滑重载的服务,优先使用它自带的 reload 或者 reopen 日志指令来释放旧句柄。

Linux 用 lsof 找到 deleted 文件后确认 PID 重启服务并验证空间恢复

反向验证:空间是不是真的成功回收

服务重启或者旧文件句柄释放完成以后,再执行一遍 df 查看结果。如果这些 deleted 文件就是占满磁盘的根因,使用率会立刻下降。这里建议顺手核对业务服务的新日志是否可以正常写入,避免空间恢复之后,服务日志再也无法生成写入的次生问题。

df -h
lsof +L1
journalctl -u app.service -n 50 --no-pager

如果 lsof +L1 的输出里还有大体积的 deleted 项,说明仍有进程没有释放对应句柄;如果所有 deleted 项已经消失但磁盘占用还是满的,再回头走 du 和 inode 检查流程,继续排查真实文件夹占用、容器 overlay 层、过期日志轮转文件或者系统快照残留。

后续运维清单:避免同类问题反复出现

  • 大体积日志文件不要直接手工 rm 删除,优先走标准日志切割流程,再触发服务 reload 释放旧句柄。
  • 给关键分区配置容量和 inode 双指标告警,不要只监控单一使用率指标。
  • 检查日志轮转配置里的 copytruncate、postrotate、重载命令是否匹配当前运行的服务类型。
  • 容器环境排查要同时核查宿主机路径、容器内存储路径和 overlay 层的实际占用。
  • 处理完磁盘满故障之后,把关联的 PID、被占用文件名、释放方式和恢复前后的容量数值记录下来,方便后续同类问题快速排查。

常见问题

为什么 rm 删除大日志文件以后 df 显示的使用率还是满的?

大概率是还有进程保持着这个日志文件的打开状态。文件在文件夹里的条目已经被删掉了,但进程持有的文件句柄没有关闭,对应的磁盘空间不会立刻归还给文件系统。

能不能直接清空 /proc/PID/fd 路径下的 deleted 文件?

不建议随手做这类操作。更稳妥的方式是先确认对应服务的业务归属,评估影响后再重启服务或者触发服务重新打开新日志。对关键进程的 fd 做修改前要先做好风险评估。

du 和 df 统计出来的占用数值永远都应该一致吗?

不一定。两者统计口径本来就不同,跨挂载点统计、权限限制、deleted 未释放文件、隐藏文件夹和文件系统预留空间都会造成数值差异。

容器内部看到磁盘满,也能用这套方法排查吗?

可以先用相同的思路走一遍排查流程,但还要额外核查宿主机的 overlay 占用、容器标准输出日志和数据卷挂载情况。容器内看到的存储路径,未必就是宿主机上真正占用磁盘空间的对应位置。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go HTTP 请求体为什么只能读一次:io.ReadAll 后绑定参数为空怎么排查Go HTTP 请求体为什么只能读一次:io.ReadAll 后绑定参数为空怎么排查
上一篇
Go HTTP 请求体为什么只能读一次:io.ReadAll 后绑定参数为空怎么排查
Redis 热点 key 过期后数据库被打满:缓存击穿怎么排查和修复
下一篇
Redis 热点 key 过期后数据库被打满:缓存击穿怎么排查和修复
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • PubMedQA数据集详解:生物医学问答基准、功能与应用指南
    PubMedQA
    深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
    384次使用
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    462次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    473次使用
  • 斯坦福HELM:大语言模型Holistic Evaluation整体评估框架详解
    HELM
    深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
    410次使用
  • MMBench详解:多模态大模型基准测试、功能特点与使用指南
    MMBench
    MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
    237次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议 和 隐私政策
返回登录
  • 重置密码