cgroup v2 io.max怎么配置或排查
给 Linux 工作负载做磁盘限速时,cgroup v2 的 io.max 是直接入口:它按块设备的主次设备号,为一个非 root cgroup 设置读写 BPS 或 IOPS 上限。写入后 I/O 会在达到上限时被延迟,短时突发仍可能出现,所以不要只看一次吞吐就判断配置失败。
排查顺序很固定:先确认目标进程属于哪个 cgroup,再确认设备的MAJ:MIN,最后把同一个设备号同时对照io.max、io.stat和io.pressure。三者对不上,调大数字也不会解决问题。
io.max是绝对 BPS/IOPS 限制,io.weight是同级工作负载之间的相对权重,两者用途不同。- 配置行的第一个字段必须是设备
MAJ:MIN,四个限速键分别是rbps、wbps、riops、wiops。 - 读回配置只证明规则写进去了;还要用
io.stat和 PSI 判断统计对象、压力和业务影响。
先分清 io.max 和 io.weight 的控制目标
如果需求是“这个备份任务写盘不能超过某个速度”,选 io.max;如果需求是“多个 cgroup 竞争同一设备时,让某个服务获得更高比例”,才考虑 io.weight。前者是绝对上限,后者是相对分配,不能用权重推算出固定 MB/s。
| 接口 | 控制方式 | 适合回答的问题 |
|---|---|---|
io.max | 按设备限制 BPS 或 IOPS | 这个 cgroup 最多读写多快、每秒多少次 I/O? |
io.weight | 在同级 cgroup 间按比例分配 | 设备繁忙时,谁应得到更多 I/O 时间? |
io.stat | 只读统计 | 这个 cgroup 实际对哪些设备产生了多少读写? |
io.max 位于非 root cgroup。它的限制可以在父级资源不足时与其他限制叠加,配置值也不等于设备一定能达到的物理性能。对于带缓存的写入,还要留意应用完成写入与底层 writeback 发生的时间差。
先确认 cgroup 层级和块设备,再写入 io.max
下面示例把工作负载放到 demo-io,把 8:16 当作待替换的设备号。这个数字只是格式示例,现场必须从 lsblk 的输出中确认,不能凭磁盘名称猜测。
# 确认当前是 cgroup v2,并检查父级是否能提供 io 控制器
CG_ROOT=/sys/fs/cgroup
CG="$CG_ROOT/demo-io"
test -f "$CG_ROOT/cgroup.controllers" || { echo "未找到 cgroup v2 根目录"; exit 1; }
grep -qw io "$CG_ROOT/cgroup.controllers" || { echo "当前内核未提供 io 控制器"; exit 1; }
# 只有父级已启用 io 时,子 cgroup 才会出现 io.max
grep -qw io "$CG_ROOT/cgroup.subtree_control" || \
printf '+io\n' | sudo tee "$CG_ROOT/cgroup.subtree_control" >/dev/null
sudo mkdir -p "$CG"
test -f "$CG/io.max" || { echo "io.max 尚未出现在目标 cgroup"; exit 1; }
# 用 lsblk 找到实际 MAJ:MIN;8:16 只是下面命令的占位示例
lsblk -o NAME,MAJ:MIN,MOUNTPOINTS
DEV=8:16
# 读 2 MiB/s、写 1 MiB/s,并把随机 I/O 次数限制为每秒 120 次
printf '%s rbps=2097152 wbps=1048576 riops=120\n' "$DEV" | \
sudo tee "$CG/io.max" >/dev/null
cat "$CG/io.max"
这里最容易漏掉的是层级关系:io 出现在根目录的 cgroup.controllers,只说明它可用;真正把控制能力分发给子 cgroup,还要看父目录的 cgroup.subtree_control。如果系统由 systemd 管理服务,手工写入也可能在 unit 重载或重启时被上层资源配置覆盖。

用 io.stat 和 io.pressure 判断限制是否落在正确对象
写入成功后先读回 io.max,再读同一 cgroup 的统计。io.stat 的行也以 MAJ:MIN 为键;如果它没有出现你刚配置的设备号,优先怀疑进程没有走这块设备、设备号写错,或统计发生在后代 cgroup。
# 检查目标 PID 的 cgroup 归属,PID 和路径都要替换成现场值
PID=12345
grep '0::' "/proc/$PID/cgroup"
grep -q "0::/demo-io" "/proc/$PID/cgroup" || {
echo "目标进程不在 demo-io,先修正归属再测 I/O"
exit 1
}
# 读回实际限制,确认设备号和四个方向字段没有写错
cat /sys/fs/cgroup/demo-io/io.max
# 统计 cgroup 对各个块设备的读写字节数、I/O 次数和丢弃量
cat /sys/fs/cgroup/demo-io/io.stat
# 看工作负载是否因为 I/O 等待而形成压力;只读不修改配置
cat /sys/fs/cgroup/demo-io/io.pressure
可以按三种结果分流。第一,io.max 与 io.stat 都包含同一 MAJ:MIN,而压力在限速后上升,说明规则至少落到了正确的统计对象;接下来要判断阈值是否太低。第二,io.max 有规则但 io.stat 没有同号,说明设备路径或进程归属不对。第三,统计持续增长但 PSI 没明显变化,可能是负载仍未触碰上限,或者 I/O 被页缓存吸收,不能只凭单次测试下结论。
解除某一个方向的限制时,把该键写成 max,不要覆盖整行。例如只取消写 IOPS:printf '%s wiops=max\n' "$DEV" | sudo tee "$CG/io.max"。修改后再次读回整行,确认其他方向的限制仍在。

常见问题
为什么写了 io.max 但速度没有立刻降下来?
内核文档说明达到 BPS 或 IOPS 限制后 I/O 会被延迟,同时允许临时突发。再加上页缓存和测试窗口过短,瞬时吞吐不一定等于长期限制,应该拉长观察时间并对照 io.stat。
io.max 可以写 2M、1G 这样的单位吗?
内核接口字段按数值解释,建议把字节数或每秒 I/O 次数换算成整数后写入。上层工具可能接受带单位的配置,但不能把上层语法直接当作 io.max 文件格式。
读回 io.max 正确,为什么业务仍然卡顿?
先确认进程实际属于目标 cgroup,并确认它访问的设备号与规则行一致;如果两者都正确,再检查阈值是否过低、是否与父级限制叠加,以及 systemd 是否会覆盖手工改动。
调参时建议先记录未限速时的 io.stat 和 io.pressure,再一次只改一个方向。这样能把“规则没有命中”和“规则命中了但额度不合适”分开,后续迁移到 systemd 或容器编排配置时也更容易复现。
Lovart Brand Kit配额够用吗?按客户数量选择方案
- 上一篇
- Lovart Brand Kit配额够用吗?按客户数量选择方案
- 下一篇
- Go channelrange 出错时怎么查等待不退
-
- 文章 · linux | 2小时前 | cgroup cgroup v2 memory.high Linux 内存限制
- cgroup v2 memory.high怎么配置或排查
- 420浏览 收藏
-
- 文章 · linux | 3小时前 | Linux · systemd · EnvironmentFile ·
- systemd EnvironmentFile 多行变量如何保留空格与换行
- 186浏览 收藏
-
- 文章 · linux | 4小时前 |
- systemd socket activation怎么配置或排查
- 245浏览 收藏
-
- 文章 · linux | 9小时前 |
- Linux ss 看不到监听端口时先查哪个 namespace
- 492浏览 收藏
-
- 文章 · linux | 11小时前 | Linux · 运维排障 · tmpfs · df tmpfs Linux临时文件系统
- Linux tmpfs 满了但磁盘空间还有为什么
- 204浏览 收藏
-
- 文章 · linux | 15小时前 | Linux · systemd · 运维排障 · systemd journalctl Linux日志 journald
- journald 如何按服务和启动批次筛选日志
- 371浏览 收藏
-
- 文章 · linux | 17小时前 |
- systemd timer OnCalendar 如何避免重复触发
- 144浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 110次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 26次使用
-
- OpenCompass
- OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
- 44次使用
-
- AGI-Eval
- AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
- 25次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 264次使用
-
- Linux vmstat 如何分辨内存抖动与磁盘等待:si、so、wa 与复测顺序
- 2026-08-30 501浏览
-
- Linux搭建vsftpdFTP服务器教程
- 2026-04-30 501浏览
-
- Shell脚本安装教程:.sh一键安装指南
- 2026-03-16 501浏览
-
- Linux清空文件内容的几种方法
- 2025-12-01 501浏览
-
- Linux命令行下载文件技巧
- 2025-11-23 501浏览

