Linux epoll ET 模式为什么容易漏事件
服务端明明收到了一次 EPOLLIN,代码也成功读出了一部分数据,随后循环返回 EAGAIN,但客户端剩下的数据却迟迟没有进入下一次处理。这个现象通常不是 epoll 丢事件,而是把 ET(边沿触发)误当成了“每次有数据都提醒”。
ET 的安全写法是:fd 设置为非阻塞;收到事件后持续读或写,直到返回
EAGAIN/EWOULDBLOCK。只读一次就回到epoll_wait,剩余数据可能没有新的边沿变化,自然不会再次提醒。
EPOLLET关注可读状态的变化,不承诺每次read都对应一次通知。EAGAIN在非阻塞 fd 上表示当前读尽,不是数据丢失。read返回 0 要关闭连接,EINTR要重试,其他错误要清理并记录。- 读到
EAGAIN仍可能造成单连接霸占 CPU,生产代码还要设置公平预算。
先还原现场:为什么剩余数据不再提醒
假设 socket 缓冲区里来了 2 KB,第一次 epoll_wait 返回可读,程序只取走 1 KB。ET 记录的是“不可读变为可读”这一变化;剩下的 1 KB 没有再次经历同样的状态变化,所以后续等待可能阻塞。LT 则会因为缓冲区仍可读而继续报告,这正是两者最容易混淆的地方。

非阻塞和持续读取必须成对出现
ET 处理时如果 fd 仍是阻塞模式,第一次 recv 取完现有数据后可能继续等待下一批数据,一个连接就能卡住整个事件循环。因此监听 fd 用 accept4 设置 SOCK_NONBLOCK,连接 fd 也要保持非阻塞。
for (;;) {
ssize_t n = recv(fd, buf, sizeof buf, 0);
if (n > 0) {
/* 消费本次读到的数据;真实项目应交给协议解析器。 */
feed_parser(buf, (size_t)n);
continue; // ET 要继续读,直到内核明确说暂时读尽
}
if (n == 0) {
/* 对端有序关闭,先移出 epoll 再释放连接状态。 */
close_connection(epfd, fd);
break;
}
if (errno == EINTR) {
/* 信号中断不代表连接异常,直接重试本次读取。 */
continue;
}
if (errno == EAGAIN || errno == EWOULDBLOCK) {
/* 非阻塞读到当前边界,回到事件循环等待下一次变化。 */
break;
}
/* 其他 errno 是真实 I/O 错误,记录后清理 fd。 */
log_socket_error(fd, errno);
close_connection(epfd, fd);
break;
}
这里的关键不是“循环次数多”,而是把 EAGAIN 当作本轮读操作的结束信号。没有这个边界,程序要么只读半包,要么在非阻塞循环里误报错误。

recv 结果,帮助核对 EAGAIN、EOF、EINTR 与真实错误的处理职责。读到 EAGAIN 后,如何判断到底有没有漏事件
先看应用层是否保存了半包。TCP 是字节流,一次 recv 返回小于请求长度并不等于一条消息完整结束;协议解析器应把数据追加到连接缓冲区,按长度字段或分隔符拆包。若解析器只处理本次返回值,剩余半包会被误诊为 epoll 漏事件。
| 现象 | 实际含义 | 复查动作 |
|---|---|---|
recv=-1 且 EAGAIN | 当前内核缓冲区读尽 | 保留连接状态,回到 epoll_wait |
recv=0 | 对端有序关闭 | 移除 fd、释放解析缓冲区 |
| 反复只读到半包 | 协议边界尚未满足 | 检查累计缓冲区和拆包条件 |
| 某连接长期占满循环 | 出现 ET 饥饿风险 | 增加单轮字节/次数预算与就绪队列 |
排查时同时记录 fd、每轮读取字节数、errno 和协议缓冲区长度。只看到“事件来了”或“返回 EAGAIN”其中一项,证据还不完整。
常见问题:ET 代码最容易错在哪里
读到 EAGAIN 后要不要再次 epoll_ctl?
通常不需要。只要 fd 仍注册且关注 EPOLLIN|EPOLLET,就回到 epoll_wait;新的数据到达会形成新的可读变化。
为什么 ET 一定要设置 O_NONBLOCK?
因为你无法预先知道下一次数据何时到达。阻塞读会把事件循环卡在单个 fd 上,非阻塞读才能用 EAGAIN 明确结束本轮工作。
循环读到 EAGAIN 还是会卡住怎么办?
检查是否真的设置了非阻塞,以及循环里是否混入了阻塞的协议处理或同步写。对高流量连接增加单轮预算,并把未完成 fd 放回就绪队列。
EPOLLONESHOT 能解决漏事件吗?
它解决的是多线程或多 worker 重复处理同一 fd 的问题,不会替代 ET 的读尽逻辑。使用后每轮处理完成还必须用 EPOLL_CTL_MOD 重新 arm。
复查清单
上线前按这个顺序复查:连接 fd 是否为非阻塞;EPOLLIN 分支是否循环到 EAGAIN;EOF、EINTR 和其他错误是否分开处理;协议缓冲区是否支持半包;单连接是否有公平预算。满足这些条件后,ET 的“漏事件”大多会还原成一次错误的读取边界,而不是内核异常。
Go database/sql NullString 如何区分空字符串和 NULL
- 上一篇
- Go database/sql NullString 如何区分空字符串和 NULL
- 下一篇
- Go 泛型编译报 cannot infer type 如何补充类型参数
-
- 文章 · linux | 2小时前 | Linux · 运维排障 · tmpfs · df tmpfs Linux临时文件系统
- Linux tmpfs 满了但磁盘空间还有为什么
- 204浏览 收藏
-
- 文章 · linux | 6小时前 | Linux · systemd · 运维排障 · systemd journalctl Linux日志 journald
- journald 如何按服务和启动批次筛选日志
- 371浏览 收藏
-
- 文章 · linux | 8小时前 |
- systemd timer OnCalendar 如何避免重复触发
- 144浏览 收藏
-
- 文章 · linux | 9小时前 |
- systemd service Restart=always 为什么导致失败循环
- 167浏览 收藏
-
- 文章 · linux | 1天前 |
- Linux cgroup v2 memory.max 如何判断进程被限制
- 216浏览 收藏
-
- 文章 · linux | 1天前 | Linux · 日志管理 · 运维排障 · 文件描述符 logrotate copytruncate 日志轮替 postrotate
- Linux logrotate rotate 后应用仍写旧文件怎么办
- 285浏览 收藏
-
- 文章 · linux | 1天前 |
- Linux ulimit -n 调高后仍报 too many open files
- 275浏览 收藏
-
- 文章 · linux | 1天前 | Linux · 文件系统 · 挂载 · 运维排障 · 工作目录 bind mount Linux mount --bind umount target is busy EBUSY
- Linux mount --bind 解除挂载时为什么要先离开工作目录
- 476浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 107次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 22次使用
-
- OpenCompass
- OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
- 34次使用
-
- AGI-Eval
- AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
- 23次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 260次使用
-
- 深入了解Golang网络编程Net包的使用
- 2023-01-23 215浏览
-
- 详解golang执行Linuxshell命令完整场景下的使用方法
- 2023-01-07 426浏览
-
- go程序部署到linux上运行的实现方法
- 2023-01-02 387浏览
-
- Linux系统下Go语言开发环境搭建
- 2023-01-07 242浏览
-
- 使用golang获取linux上文件的访问/创建/修改时间
- 2022-12-31 238浏览

