Redis AOF理解重写期间的磁盘与延迟的实现方法
Redis AOF 重写的核心不是把旧文件原地压缩,而是根据当前内存数据生成一份更短的基线,同时继续接收客户端写入。磁盘空间在这段时间短暂增加、写延迟出现波峰,并不一定代表数据损坏;更常见的原因是 fork、Copy-on-Write、临时文件和 fsync 叠加。处理时应先看重写状态与磁盘余量,再调整触发阈值和同步策略。
- 重写期间旧基线仍可保障恢复,新 base 准备好后才通过清单切换。
- 延迟主要来自 fork 的内存页复制压力、AOF 写入与 fsync 竞争,以及磁盘空间不足后的阻塞。
appendfsync决定耐久性窗口,自动重写阈值决定重写频率,两者应分开评估。
AOF 重写到底在磁盘上做了什么
AOF 会记录改变数据集的写命令。一个计数器被自增很多次,日志里可能有很多条命令,但恢复当前值并不需要保留每一次中间变化。BGREWRITEAOF 会让后台子进程按当前数据集写出最短的重建序列;自动重写则在 AOF 达到配置条件时触发。
Redis 7.0 起,AOF 使用多部分布局:最多一个 base 文件、若干 incremental 文件,以及描述文件集合的 manifest。重写时父进程打开新的增量文件接住实时写入,子进程生成新的 base;完成后通过临时 manifest 原子切换。这个过程解释了为什么不能只盯着一个旧的 appendonly.aof 文件判断空间。

磁盘增长和延迟抖动分别从哪里来
重写初期通常需要同时容纳旧文件、新 base、增量写入和临时元数据,因此磁盘使用率可能先升后降。子进程由 fork 创建,父子进程共享页面;当主进程继续修改数据时,操作系统会发生 Copy-on-Write,内存压力也可能传导到延迟。写入量越大、数据结构越复杂,重写阶段越需要预留余量。
fsync 是另一条延迟链路。appendfsync always 把耐久性放在首位,但每批写入都可能等待同步;everysec 通常是平衡选项;no 把刷新交给操作系统,性能和数据丢失窗口都更依赖主机。不要只看到延迟升高就把 fsync 关闭,先确认是否是磁盘带宽、fork 或内存回收在成为瓶颈。

用配置把重写频率和数据安全分开处理
配置时先明确业务能接受的丢失窗口,再决定 appendfsync。自动重写阈值则回答另一个问题:日志相对上次重写增长到什么程度,才值得付出一次后台重写成本。示例只展示思路,数值应结合磁盘余量、写入速率和恢复时间压测。
# 先选择可接受的数据丢失窗口,再决定 fsync 频率
appendonly yes
appendfsync everysec
# AOF 相对上次重写增长达到 100% 且超过 64 MB 时触发
auto-aof-rewrite-percentage 100
auto-aof-rewrite-min-size 64mb
# 重写期磁盘紧张时可暂时关闭自动触发,处理完成后恢复
# auto-aof-rewrite-percentage 0
如果重写与 RDB 快照同时争用磁盘,Redis 会避免两个后台持久化任务并行执行,显式请求的重写可能进入 scheduled 状态。生产环境不要用频繁手工执行 BGREWRITEAOF 来“压缩一下”,应让增长比例、最小规模和可用空间共同决定时机。
用 INFO persistence 判断重写是否真的影响服务
排查时把一次观察拆成开始前、进行中和完成后三个时间点,至少记录磁盘可用空间、实例内存、写入速率和下面这些字段:
| 字段 | 关注点 | 判断 |
|---|---|---|
aof_rewrite_in_progress | 是否正在重写 | 为 1 时结合磁盘与延迟观察 |
aof_rewrite_scheduled | 是否等待 RDB 完成 | 持续为 1 说明后台任务有排队 |
aof_current_rewrite_time_sec | 本次耗时 | 与历史正常值比较,不单看绝对值 |
aof_last_bgrewrite_status | 上次结果 | 非 ok 时先查日志与磁盘 |
aof_last_cow_size | Copy-on-Write 规模 | 偏大时检查写入峰值和内存余量 |
# 只读取持久化区,便于把重写状态与延迟采样对齐
redis-cli INFO persistence | grep -E 'aof_(rewrite|last_bgrewrite|last_cow)'
# 手工触发前先确认没有正在运行的持久化子进程
redis-cli BGREWRITEAOF
观察到延迟抖动时,先区分“重写正在进行”和“上次重写失败”。前者通常需要等任务完成或降低写入压力;后者要检查权限、空间、文件系统和进程日志,不能靠重复触发解决。
常见问题
重写期间磁盘空间为什么会突然变大?
因为旧基线、新 base、实时增量和临时清单可能同时存在。空间规划至少要覆盖一次重写峰值,不要只按最终 AOF 大小预留。
把 appendfsync 改成 no 能彻底消除延迟吗?
不能。它只减少 fsync 等待,fork、Copy-on-Write、磁盘写带宽和内存压力仍可能造成抖动,而且故障时的数据丢失窗口更难控制。
如何确认重写已完成?
使用 INFO persistence 查看 aof_rewrite_in_progress=0、aof_rewrite_scheduled=0,并确认 aof_last_bgrewrite_status=ok,再结合磁盘使用率回落判断。
实际运行中,AOF 重写更像一次需要容量预算的后台迁移:先保证旧数据仍可恢复,再观察新基线的生成速度,最后按业务对耐久性和延迟的取舍调整策略。这样比盲目关闭重写或 fsync 更容易保住服务稳定性。
Go encoding/csv处理字段数量变化的行的错误策略
- 上一篇
- Go encoding/csv处理字段数量变化的行的错误策略
- 下一篇
- LibTV无限画布不生效怎么办?常见原因和排查方法
-
- 数据库 · Redis | 3天前 |
- Redis Cluster key slot用 CRC16 解释跨槽排查的实现方法
- 436浏览 收藏
-
- 数据库 · Redis | 4天前 | Redis · 脚本 · lua · eval Redis Lua redis.call redis.pcall
- Redis Lua 脚本返回结构化状态码避免业务歧义的实现方法
- 493浏览 收藏
-
- 数据库 · Redis | 4天前 | redis zset 游标分页 Sorted Set ZRANGEBYSCORE Redis分页
- Redis ZSET 分页用游标实现稳定范围分页的实现方法
- 440浏览 收藏
-
- 数据库 · Redis | 4天前 | Redis · BCAST 客户端缓存 Prefix Redis CLIENT TRACKING
- Redis CLIENT TRACKING用 BCAST 接收客户端缓存失效通知的实现方法
- 361浏览 收藏
-
- 数据库 · Redis | 4天前 |
- Redis 客户端连接池 timeout 与命令执行超时如何区分
- 340浏览 收藏
-
- 数据库 · Redis | 4天前 | Redis · 故障排查 · 内存优化 · redis 内存排查 INFO memory MEMORY DOCTOR MEMORY STATS
- Redis MEMORY DOCTOR 输出如何转成排查顺序
- 277浏览 收藏
-
- 数据库 · Redis | 4天前 |
- Redis RESP3 Push 类型通知客户端如何兼容
- 415浏览 收藏
-
- 数据库 · Redis | 4天前 |
- Redis ACL 的 key pattern 为什么放行了意外键
- 215浏览 收藏
-
- 数据库 · Redis | 4天前 | Redis · lua ·
- Redis Functions 和 Lua 脚本升级时如何保持调用名
- 455浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- PubMedQA
- 深入了解PubMedQA生物医学问答数据集,涵盖其核心功能、使用方法及在临床决策、药物研发等场景的应用,助力提升NLP模型性能。
- 121次使用
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 196次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 139次使用
-
- HELM
- 深入了解斯坦福推出的HELM(Holistic Evaluation of Language Models)大模型评测体系。本文解析其核心功能、安装配置步骤及应用场景,涵盖准确性、公平性、鲁棒性等多维度指标,助力开发者全面优化语言模型性能。
- 112次使用
-
- CMMLU
- 深入了解CMMLU中文评估基准,涵盖67个学科主题,提供数据集下载、Zero-shot/Five-shot评估方法及排行榜,助力优化中文语言模型性能。
- 94次使用
-
- Go goroutine 泄漏怎么查:pprof、context 和通道关闭检查清单
- 2026-06-27 392浏览
-
- Go select default 为什么会让 CPU 飙高?从空转循环到可控等待
- 2026-07-02 459浏览
-
- Go 服务锁竞争变慢怎么查:mutex profile 的采样、定位和修复手册
- 2026-07-15 395浏览
-
- Go 1.23 以后还要手动 Stop Timer 吗:一次超时循环改造实战
- 2026-07-16 403浏览
-
- Go 1.25 runtime/trace.FlightRecorder 怎么接:把偶发延迟留在内存环形缓冲里
- 2026-07-26 425浏览
