kube-apiserver 缓存重建阶段如何安排控制器重试:从 429 到恢复可观测性
Kubernetes v1.37 里,watchcache 初始化期间看到 HTTP 429,不一定代表 API Server 坏了。更准确的解释是:缓存还没有准备好时,kube-apiserver 主动拒绝可能拖垮 etcd 或占满 API Priority and Fairness(APF)并发席位的请求,让客户端稍后重试。
关键边界只有一句话:普通 WATCH 和大多数 LIST 可能返回 429;不带 selector、同时带有 limit 的有界 LIST,才是官方 KEP 明确保留的 etcd 委托路径。
- 429 是初始化保护信号,要结合
Retry-After和/readyz判断。 - 不要把带 selector 的大 LIST 改成无脑重试,它可能把压力转移到 etcd。
- 控制器要有指数退避,运维要同时看 429 比例和 API Server 就绪状态。
先判断 429 是保护动作还是 API Server 故障
watchcache 本质上是 API Server 内存中的对象缓存。启动或重初始化时,缓存需要从存储层建立状态;如果大量 watch 长时间挂起,它们会持续占用 APF 的 seat,甚至让同一优先级的读写请求都排不上队。v1.37 将剩余的初始化 PostStartHook 稳定化,目标就是让请求有秩序地失败,而不是堆积成洪峰。
因此先看三个信号:请求是否集中发生在 API Server 启动、升级或缓存重建之后;响应是否带有 Retry-After;/readyz 是否仍在恢复。若 429 随就绪恢复而下降,它更像保护动作;若就绪长期不恢复,才需要转向 API Server、etcd 或配置故障排查。
按 WATCH、GET、LIST 的请求形状判断分流
KEP-4568 给出的设计不是“所有请求一律 429”。GET 成本有界,可以委托给 etcd。LIST 则只先放行同时满足两个条件的请求:没有任何 selector,并且设置了 limit。前者保证读到的对象不会因为过滤而大量丢弃,后者限制单次读取规模。
可以把排障时的请求形状记成这张表:
| 请求 | 缓存未就绪时的判断 | 客户端动作 |
|---|---|---|
| 普通 WATCH | 可能 429,避免长期占席 | 尊重 Retry-After 后退避重连 |
| 带 selector 的 LIST | 可能 429,避免昂贵过滤下沉到 etcd | 减少范围,分批或等待 |
| 无 selector + limit 的 LIST | 可委托 etcd,成本受限 | 消费 continue,不并发轰击 |

图1:watchcache 未就绪时,按请求形状观察 WATCH、受限 LIST 与选择器 LIST 的分流结果。
让客户端以退避方式重试而不是放大洪峰
控制器或自定义客户端不要把 429 当成“立即再发一次”的普通业务错误。最小策略是读取 Retry-After,没有该值时采用带抖动的指数退避,并给重试次数和总等待时间设上限。以 curl 做人工验证时,也应模拟这种节奏:
curl -i --retry 5 --retry-delay 2 --retry-all-errors \
"https://apiserver.example/api/v1/pods?limit=100"
生产控制器还要避免在 watch 失败后瞬间触发全量 LIST。应让 reflector 或等价客户端负责退避,再用较小的有界 LIST 重新建立游标。若业务确实需要 selector,优先缩小 namespace、标签范围或时间窗口,而不是删除保护条件。
用就绪、429 比例和请求形状验收恢复
恢复验收建议按“状态—指标—行为”三层做。状态层检查 kubectl get --raw='/readyz?verbose';指标层观察 apiserver_request_total{code="429"} 是否回落,并按客户端身份定位异常重试者;行为层分别发起一次普通 watch、带 selector 的 list 和无 selector 且带 limit 的 list,确认客户端能等待并继续。
不要仅凭一次 200 就宣布恢复:watchcache 完成后,APF 仍可能因历史洪峰暂时排队。相反,也不要因短时 429 就关闭 ResilientWatchCacheInitialization。只有在就绪长期失败、429 持续异常升高且已确认客户端退避正确时,才进入版本与 API Server 配置级回滚评估。

图2:用就绪探针、429 指标和客户端退避三条证据链确认控制面恢复。
相关问题
为什么不把所有 LIST 都直接返回 429?
API Server 自己的 informer 也需要 LIST 完成初始化;全部拒绝会反过来拖慢恢复。所以保留无 selector 且带 limit 的有界路径。
429 会不会自动变成 410 Gone?
不会。429 表示当前请求被保护性拒绝;410 通常与客户端要求的 resourceVersion 已不可用有关,处理逻辑不同。
应该先调大 APF 并发吗?
不应把调大并发当第一反应。先确认请求形状和重试节奏,否则更大的容量可能只是把洪峰继续推向 etcd。
shimeji桌宠为什么不显示?悬浮权限、Ghost Mode与兼容排查
- 上一篇
- shimeji桌宠为什么不显示?悬浮权限、Ghost Mode与兼容排查
- 下一篇
- 字段结构经常变化的 JSON 怎么接:结构体、map 与 RawMessage 的边界对比
-
- 科技周边 · 业界新闻 | 3小时前 |
- CNCF 云原生构建标准化怎么验收:Buildpacks 的 OCI 镜像与供应链边界
- 222浏览 收藏
-
- 科技周边 · 业界新闻 | 4小时前 | 云原生 · kubernetes · 故障排查 · 控制面 · 火绒流量防火墙 Kubernetes kube-apiserver WatchCache v1.37 API Priority and Fairness
- Kubernetes v1.37 watchcache 初始化为什么返回 429:控制面恢复时的请求洪峰边界
- 183浏览 收藏
-
- 科技周边 · 业界新闻 | 15小时前 |
- OpenTelemetry Entity Events 怎么补齐资源关系:从实体身份到可追踪变更
- 164浏览 收藏
-
- 科技周边 · 业界新闻 | 1天前 | 云原生 · kubernetes · 证书轮换 · 工作负载身份 · Kubernetes 1.37 Pod Certificates 工作负载身份 Cluster Trust Bundles
- Kubernetes 1.37 Pod Certificates 进入 GA:工作负载身份有哪些新边界
- 187浏览 收藏
-
- 科技周边 · 业界新闻 | 1天前 | 云原生 · Etcd · kubernetes · 版本发布 · 内存优化 RangeStream Kubernetes 1.37 etcd 3.7 List请求
- Kubernetes 1.37 的 RangeStream 进入 Beta:大规模 List 请求为什么更省内存
- 458浏览 收藏
-
- 科技周边 · 业界新闻 | 2天前 | github copilot · AI编程 · 模型切换 · 模型迁移 GitHub Copilot MAI-Code-1-Flash MAI-Code-1.1-Flash
- GitHub Copilot 将弃用 MAI-Code-1-Flash:代码工作流如何完成模型切换
- 373浏览 收藏
-
- 科技周边 · 业界新闻 | 3天前 | github · copilot · AI开发工具 · 插件治理 · VS Code MCP Agent Plugins 1.0 GitHub Agent Plugins Copilot CLI
- GitHub Agent Plugins 1.0 跨客户端落地:团队接入前要先看哪些权限边界
- 462浏览 收藏
-
- 科技周边 · 业界新闻 | 5天前 | github · Spark · copilot · 开发者工具 · 应用迁移 · GitHub Spark GitHub Models llm() 应用迁移 Create repository
- GitHub Spark 弃用后应用如何迁移:运行时边界、替代路径与仓库资产盘点
- 386浏览 收藏
-
- 科技周边 · 业界新闻 | 5天前 | python · 开发工具 · 版本发布 · 维护实践 · Python 3.14.7 Python 发布 PEP 779 compression.zstd 软件维护
- Python 3.14.7 正式发布:499 项修复、免费线程与压缩模块的维护者核对清单
- 457浏览 收藏
-
- 科技周边 · 业界新闻 | 5天前 |
- Cloudflare Client-Side Security 开放后怎么用:第三方脚本资产盘点、检测边界与上线核验
- 294浏览 收藏
-
- 科技周边 · 业界新闻 | 5天前 | python · pypi · 软件供应链 · 开源社区 · 项目维护 · Python Packaging Council Python 包管理 PSF 投票 OpaVote 开源治理
- Python Packaging Council 2026 候选人名单公布:项目维护者如何核对投票信息与时间
- 142浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 131次使用
-
- C-Eval
- 深入了解C-Eval中文评估套件,涵盖52个学科与4级难度。本文详解其功能特点、Zero-shot/Few-shot使用方法及代码示例,助您全面评测LLM中文理解与泛化能力。
- 49次使用
-
- ClickPrompt
- ClickPrompt是一款专为AI提示词编写者设计的开源在线工具,支持Stable Diffusion绘图、ChatGPT对话及GitHub Copilot代码辅助。提供Prompt自动生成、一键运行、社区分享及可视化优化功能,帮助用户高效获取精准AI输出。
- 17次使用
-
- Google AI提示词库
- 探索Google Cloud官方生成式AI提示词库,提供免费、无需登录的中英双语Prompt模板。涵盖内容创作、代码优化、数据分析等场景,助您快速提升AI交互效率与质量。
- 26次使用
-
- Gradio
- Gradio是一个用于构建机器学习和数据科学Web应用的开源Python库。支持快速创建交互界面,获Google、Meta等大厂青睐,适合模型演示、部署反馈及调试。
- 131次使用
-
- 蒙面演唱引争议,旺仔小乔被平台封禁
- 2025-08-08 501浏览
-
- openGauss向量驱动升级,RAC多写突破内核
- 2025-07-30 501浏览
-
- 安普瑞斯工厂放假,电芯供应受影响
- 2025-07-04 501浏览
-
- 农产品APP开发优势与功能全解析
- 2025-04-30 501浏览
-
- 开店省钱妙招,外卖系统同城配送运营攻略
- 2025-04-26 501浏览

