io_uring 注册缓冲区降低小文件 I/O 开销
在 Linux 上反复读取许多小文件时,io_uring 的普通读请求除了等待设备,还要反复处理用户缓冲区的检查、页面固定和内核映射。注册缓冲区的思路是把这部分准备工作提前做一次,后续使用 READ_FIXED 或 WRITE_FIXED 按索引复用已经登记的内存。它更适合“小、频繁、复用同一批缓冲区”的工作负载,并不是所有 I/O 都会因此变快。
官方资料:https://man7.org/linux/man-pages/man2/io_uring_register.2.html
最小路径可以概括为:分配匿名缓冲区,调用io_uring_register_buffers注册,再用io_uring_prep_read_fixed或io_uring_prep_write_fixed提交请求。完成队列中的cqe->res直接给出传输字节数或负的错误码。
先理解注册缓冲区减少了哪一段开销
普通读请求会把用户态地址和长度交给内核,内核需要确认这段内存可访问,并为 I/O 准备相应的页面引用与映射。注册缓冲区后,内核会长期持有这块内存的引用并建立映射,随后固定读写可以跳过每次 I/O 的重复准备工作。

这里的“固定”不是把文件固定在内存里,而是固定用户提供的缓冲区。文件描述符仍然要正常打开,读请求也仍然会受到文件偏移、权限和设备吞吐的影响。收益主要来自每次 I/O 的内存准备成本被摊平。
准备一块可以长期复用的匿名内存
IORING_REGISTER_BUFFERS 接受一组 struct iovec。常见实现使用 malloc 或匿名 mmap 得到内存;当前接口不接受文件映射内存。每个缓冲区还存在单块大小限制,实际项目应同时考虑进程的锁定内存额度和整个机器的资源余量。
// 这段代码只负责准备一块可复用的匿名缓冲区
void *buffer = NULL;
struct iovec iov;
// 4096 字节对齐便于兼容后续可能使用的直接 I/O 场景
int ret = posix_memalign(&buffer, 4096, 4096);
if (ret != 0) {
// posix_memalign 返回的是错误号,不是负 errno
fprintf(stderr, "分配缓冲区失败: %s\n", strerror(ret));
return 1;
}
memset(buffer, 0, 4096);
iov.iov_base = buffer;
iov.iov_len = 4096;
// 注册后,iov 数组可以释放,但 buffer 必须保持有效并且内容可复用
ret = io_uring_register_buffers(&ring, &iov, 1);
if (ret
iov 只是注册时的描述数组,注册完成后可以回收;真正的 buffer 不能提前释放,也不能在请求仍在使用时交给别的用途。多个缓冲区会按数组顺序获得从零开始的索引,后续 SQE 的 buf_index 就是这个索引。
用 READ_FIXED 读取小文件
注册完成后,不能继续使用普通的 io_uring_prep_read 来表达“使用注册缓冲区”。应改用固定版本,并保证传入的地址与长度完全落在注册项范围内。下面的最小示例读取一个文件的前 4096 字节,注册表中只有一个缓冲区,所以索引是 0。
// 假设 ring 已初始化,buffer 已按上节注册,fd 是已打开的小文件
struct io_uring_sqe *sqe = io_uring_get_sqe(&ring);
if (sqe == NULL) {
// 没有可用 SQE 时,应先提交或等待,而不是继续写空指针
fprintf(stderr, "获取 SQE 失败\n");
goto cleanup;
}
// 只读取注册项中的前 4096 字节,最后一个参数 0 对应第一个注册缓冲区
io_uring_prep_read_fixed(sqe, fd, buffer, 4096, 0, 0);
sqe->user_data = 1;
int submitted = io_uring_submit(&ring);
if (submitted res res));
} else {
// 正数表示实际读取的字节数,小文件可能出现短读
printf("读取 %d 字节\n", cqe->res);
}
io_uring_cqe_seen(&ring, cqe);
cleanup:
// 先确保请求完成,再释放注册表和底层内存
io_uring_unregister_buffers(&ring);
free(buffer);
这个例子有两个容易忽略的点。第一,buffer 和 4096 必须落在索引为 0 的注册区域里,不能把另一个地址误传给固定读。第二,cqe->res 是实际 I/O 结果:负值是负错误码,非负值是读取字节数,短读不能被当作 API 失败。
处理注册失败和生命周期
注册缓冲区会锁定或长期引用用户内存,因此失败时先看资源限制,而不是反复调用同一注册接口。可以检查当前 shell 的锁定内存额度:
# 查看当前 shell 允许锁定的内存额度,单位通常是 KiB ulimit -l # 仅对当前 shell 临时放宽限制;生产环境应通过系统配置或服务资源声明管理 ulimit -l unlimited
返回 -ENOMEM 时,常见原因包括可用锁定内存不足或内核资源不足;返回 -EBUSY 可能表示 ring 已经有同类资源注册。注册缓冲区前还要检查数组数量是否为零、单个缓冲区是否过大,以及是否把文件映射内存当成普通匿名内存传入。
更新缓冲区时,旧请求还在飞行中就直接改写或释放内存会破坏生命周期。简单做法是等待相关 CQE 完成后再注销;需要动态更新时,再根据目标内核和 liburing 版本考虑 IORING_REGISTER_BUFFERS_UPDATE 等接口。关闭 ring 时系统会清理注册资源,但显式注销能让释放时机更清楚。
判断什么时候值得使用

可以先用下面的判断表做选型:
| 场景 | 建议 | 原因 |
|---|---|---|
| 大量小文件、反复复用固定大小缓冲区 | 优先尝试注册缓冲区 | 一次注册成本可以摊到很多次 I/O |
| 单次大文件顺序读写 | 先比较普通读写 | 映射准备成本相对总传输时间可能很小 |
| 每个请求都需要不同大小、不同地址的缓冲区 | 谨慎使用 | 频繁注销、重新注册会抵消复用收益 |
| 服务已经使用 provided buffer ring | 区分两套机制 | 提供缓冲区环与固定缓冲区不是同一个接口,不能混为一谈 |
因此,注册缓冲区更像是 I/O 热路径的资源布局选择,而不是一个打开就必然有效的加速开关。先确认缓冲区是否能长期复用,再估算锁定内存预算,最后把普通读请求替换为固定版本,收益才有机会稳定出现。
常见问题
注册成功后为什么还要传 buffer 指针?
固定读写接口仍需要给出本次操作的地址和长度,但这段范围必须落在对应的注册项中;buf_index 用来选择注册项,不是替代地址参数。
注册缓冲区能直接用于文件映射内存吗?
当前通用注册接口要求匿名、非文件后备内存。使用 malloc 或匿名 mmap 更符合接口约束,不要把普通文件映射区域直接当作注册缓冲区。
为什么读小文件时没有明显收益?
如果请求数量很少、设备延迟占主要部分,或者缓冲区频繁变化,节省的内存准备成本可能被其他开销淹没。固定缓冲区的优势集中在高频、可复用的小 I/O。
固定缓冲区与 provided buffer ring 有什么区别?
固定缓冲区由应用预先注册一组长期可用内存,并通过索引做固定读写;provided buffer ring 更偏向把一组可供接收操作选择的缓冲区交给 ring 管理。两者是不同机制,接口和适用的请求类型也不同。
encoding/csv 跳过注释行与空行的读取配置
- 上一篇
- encoding/csv 跳过注释行与空行的读取配置
- 下一篇
- zip 文件名编码异常时的读取策略
-
- 文章 · linux | 2小时前 | 容器 · Linux · Linux mount namespace 挂载传播 bind mount shared mount
- mount namespace 中绑定挂载的传播属性
- 342浏览 收藏
-
- 文章 · linux | 4小时前 |
- ip rule 与多路由表实现策略路由
- 406浏览 收藏
-
- 文章 · linux | 5小时前 |
- nftables 动态集合维护临时封禁地址
- 248浏览 收藏
-
- 文章 · linux | 8小时前 | Linux · journalctl Linux日志 journald systemd-journald Storage=persistent
- journald Storage=persistent 保留重启前日志
- 147浏览 收藏
-
- 文章 · linux | 10小时前 |
- systemd watchdog 监测服务心跳的配置方法
- 482浏览 收藏
-
- 文章 · linux | 22小时前 |
- Linux zram 写回如何在内存与磁盘间平衡
- 373浏览 收藏
-
- 文章 · linux | 1天前 |
- Linux Landlock 怎样限制普通进程访问文件目录
- 151浏览 收藏
-
- 文章 · linux | 1天前 |
- Linux dm-verity 如何校验只读根文件系统
- 190浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 408次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 485次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 494次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 443次使用
-
- MMBench
- MMBench是由上海人工智能实验室等机构联合推出的多模态基准测试平台,提供细粒度能力评估、大规模数据集及VLMEvalKit工具。本文详细介绍其核心功能、安装使用方法及应用场景,助力开发者全面评估多模态模型性能。
- 269次使用
-
- Java AsynchronousFileChannel 写入完成前关闭通道会怎样
- 2026-09-14 385浏览
-
- Linux io_uring 多队列提交怎么核对:SQPOLL、提交批次与空转 CPU 边界
- 2026-08-25 484浏览
-
- Linux io_uring 怎么取消尚未完成的请求
- 2026-10-05 395浏览
-
- Linux io_uring 固定缓冲区适合什么 IO 场景
- 2026-10-09 220浏览

