Kubernetes v1.37 HPA 缩容到零如何准备外部指标
我第一次把队列消费者做“按需启动”时,最容易误判的一点是:把 HPA 的 minReplicas 改成 0,并不等于它能从零自动醒来。Kubernetes v1.37 把 HPA 缩容到零推进到 Beta 并默认启用,但前提是 HPA 使用仍能在没有 Pod 时返回值的 Object 或 External 指标。
准备重点只有一句话:让队列长度、积压量这类外部信号独立于消费者 Pod 持续存在,并能从 external.metrics.k8s.io 读到;CPU、内存这类只能从运行中 Pod 得到的资源指标,不能负责从零唤醒。
- v1.37 的缩容到零是 Beta,
HPAScaleToZero默认启用,但 apiserver 和 controller-manager 都要支持。 minReplicas: 0至少要配一个 Object 或 External 指标;单独配置 CPU、内存会被拒绝。- 先用原始 API 查询指标,再看
ScaledToZero和FailedGetExternalMetric,不要只盯着副本数。
官方资料:https://kubernetes.io/docs/concepts/workloads/autoscaling/horizontal-pod-autoscale/
版本说明:https://kubernetes.io/blog/2026/09/02/kubernetes-v1-37-hpa-scale-to-zero-beta/
先确认缩容到零的适用边界
HPA 常见的 CPU、内存利用率都来自正在运行的 Pod。副本数为零以后,没有新的 Pod 可以被采样,也就没有信号把工作负载拉回来。队列长度、待处理任务数或外部服务请求量不同,它们可以由 Prometheus 等监控系统持续记录。
| 指标类型 | 能否从零唤醒 | 适合场景 |
|---|---|---|
| Resource:CPU/内存 | 不能 | 已有 Pod 的负载伸缩 |
| Object | 可以 | 某个 Kubernetes 对象关联的指标 |
| External | 可以 | 队列积压、托管服务或集群外指标 |

让外部指标在零 Pod 时仍然可读
以队列消费者为例,链路应是“队列或应用产生指标 → Prometheus 保存序列 → 指标适配器暴露 External Metrics API → HPA 查询”。适配器的发现规则必须稳定地匹配指标名和队列标识,不能只在消费者 Pod 存在时才生成这条序列。
Prometheus Adapter 的配置思路可以写成下面这样。这里的 name 标签用于把同一条队列指标与 HPA 的 selector 对上,具体安装参数仍要按现有监控方案调整。
# 这段配置把队列积压聚合为 HPA 可查询的 External 指标。
externalRules:
- seriesQuery: '{__name__="queue_consumer_lag",name!=""}'
metricsQuery: 'sum(>{>}) by (name)'
resources:
overrides:
namespace:
resource: namespace
先不要急着创建 HPA,直接验证聚合 API 是否有返回:
# 用 URL 编码后的 selector 查询 default 命名空间中的队列指标。 kubectl get --raw \ '/apis/external.metrics.k8s.io/v1beta1/namespaces/default/queue_consumer_lag?labelSelector=name%3Dworker_tasks'
如果这里拿不到当前值,HPA 从零恢复就没有可靠输入。此时应检查 Prometheus 序列、适配器 discovery、命名空间匹配和聚合层权限,而不是反复调整副本数。
编写 autoscaling/v2 的 HPA
确认指标可读后,再把缩放目标写进 HPA。下面的例子表示每 30 个排队任务期望一个消费者,最大不超过 10 个。
# HPA 允许 queue-worker 在无积压时归零,有积压时按外部值恢复。
apiVersion: autoscaling/v2
kind: HorizontalPodAutoscaler
metadata:
name: queue-worker
namespace: default
spec:
scaleTargetRef:
apiVersion: apps/v1
kind: Deployment
name: queue-worker
minReplicas: 0
maxReplicas: 10
metrics:
- type: External
external:
metric:
name: queue_consumer_lag
selector:
matchLabels:
name: worker_tasks
target:
type: Value
value: "30"
这里的 Value 是整个外部指标的目标值;如果你的适配器返回的是每个 Pod 的平均量,应重新评估 AverageValue 与指标聚合方式,避免把“总积压”误当成“单 Pod 积压”。

用 API 与状态条件验收
我会把验收拆成两层:第一层确认 API 返回指标,第二层确认 HPA 是否认为零副本由自己管理。HPA 自动缩到零后,状态里会出现 ScaledToZero=True;如果运维者直接把 Deployment 手动设为零,HPA 会把它视为暂停,不会凭外部指标擅自唤醒。
# 查看 HPA 条件与失败原因,重点关注 ScaledToZero 和外部指标获取状态。 kubectl describe hpa queue-worker -n default
若看到 ScalingActive=False 或 FailedGetExternalMetric,优先沿着 API 查询、适配器日志和 selector 排查。副本数停在零本身不是充分的故障证据。
为升级、回滚和冷启动留边界
v1.37 升级期间,apiserver 负责接受 minReplicas: 0,controller-manager 负责实际伸缩;版本错位时不要提前创建这类 HPA。回滚或关闭特性前,先把相关 HPA 改回至少一个副本,并把当前为零的工作负载拉起。
另外,缩到零节省的是闲置资源,付出的是冷启动时间。它更适合可等待的持久队列消费者,不适合要求请求立即有 Pod 接住的普通 HTTP 服务;Service 不会替零副本工作负载缓存请求。生产中还应结合默认的缩容稳定窗口、队列保留时间、镜像拉取时间和消费者初始化时间做灰度。
常见问题
只写 minReplicas: 0 为什么不生效?
必须至少存在一个 Object 或 External 指标,并且 v1.37 的特性在 apiserver 与 controller-manager 两端都可用;只写 CPU 或内存指标不满足条件。
Prometheus 有数据,HPA 仍提示指标不存在怎么办?
Prometheus 有序列不等于聚合 API 已暴露。先查询 external.metrics.k8s.io,再检查适配器的 seriesQuery、标签 selector、命名空间和权限。
Deployment 手动缩到零后能否自动恢复?
不能把手动置零当成 HPA 自动缩零。只有 HPA 自己缩到零并记录 ScaledToZero=True 时,后续外部指标才会触发恢复。
Lovart做宣传单该把文字生成进图片还是单独排版?修改成本对比
- 上一篇
- Lovart做宣传单该把文字生成进图片还是单独排版?修改成本对比
- 下一篇
- Go clienttimeout 如何限定客户端范围
-
- 科技周边 · 业界新闻 | 2小时前 | kubernetes · DRA · ResourceClaim ·
- Kubernetes v1.37 DRA GA 迁移 ResourceClaim 要检查什么
- 488浏览 收藏
-
- 科技周边 · 业界新闻 | 3小时前 | kubernetes · Kubelet · Rootless ·
- Kubernetes v1.37 Rootless Kubelet Beta 节点权限怎么核对
- 313浏览 收藏
-
- 科技周边 · 业界新闻 | 4小时前 | 云原生 · 调度器 · kubernetes · 批处理 · Kubernetes v1.37 工作负载感知调度 gang scheduling 批任务
- Kubernetes v1.37 工作负载感知调度适合哪些批任务
- 427浏览 收藏
-
- 科技周边 · 业界新闻 | 5小时前 |
- Kubernetes v1.37 Node Lifecycle Conditions 怎么读节点状态
- 380浏览 收藏
-
- 科技周边 · 业界新闻 | 7小时前 | 云原生 · 调度 · kubernetes · Pod扩容 · Kubernetes Deferred v1.37 Pod原地扩容 调度器抢占
- Kubernetes v1.37 Pod 原地扩容抢占如何影响调度队列
- 120浏览 收藏
-
- 科技周边 · 业界新闻 | 8小时前 | 云原生 · 监控 · prometheus · kubernetes · prometheus Kubernetes NativeHistograms 原生直方图
- Kubernetes v1.37 原生直方图 Beta 后 Prometheus 兼容点怎么查
- 122浏览 收藏
-
- 科技周边 · 业界新闻 | 9小时前 |
- 开源项目宣布毕业后企业升级流程应先核对什么
- 407浏览 收藏
-
- 科技周边 · 业界新闻 | 10小时前 | 云原生 · kubernetes · CNCF · 行业报告 · 云原生 Kubernetes 采用率 CNCF Survey
- 云原生报告中的调查比例为什么不能直接当作采用率
- 484浏览 收藏
-
- 科技周边 · 业界新闻 | 12小时前 | CI/CD · gitHub actions · GitHub Changelog · 生产流水线 ·
- GitHub Changelog 如何筛选影响生产流水线的变更
- 194浏览 收藏
-
- 科技周边 · 业界新闻 | 13小时前 | opentelemetry · 可观测性 · CNCF · 语义约定 · 指标日志链路 · OpenTelemetry毕业 OpenTelemetry语义约定 指标日志链路统一命名 Semantic Conventions 可观测性字段规范
- OpenTelemetry 毕业后如何规划指标、日志和链路统一命名
- 146浏览 收藏
-
- 科技周边 · 业界新闻 | 15小时前 | 依赖管理 · gitHub actions · 业界新闻 · 持续集成 · 项目依赖 GitHub Actions runner images 镜像更新 CI兼容性
- GitHub Actions runner 镜像更新前如何验证项目依赖
- 152浏览 收藏
-
- 前端进阶之JavaScript设计模式
- 设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
- 543次学习
-
- GO语言核心编程课程
- 本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
- 516次学习
-
- 简单聊聊mysql8与网络通信
- 如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
- 500次学习
-
- JavaScript正则表达式基础与实战
- 在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
- 487次学习
-
- 从零制作响应式网站—Grid布局
- 本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
- 485次学习
-
- H2O EvalGPT
- H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
- 111次使用
-
- LMArena
- LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
- 31次使用
-
- OpenCompass
- OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
- 48次使用
-
- AGI-Eval
- AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
- 30次使用
-
- SuperCLUE
- SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
- 265次使用
-
- Go chassis云原生微服务开发框架应用编程实战
- 2022-12-29 214浏览
-
- Go 1.25 容器感知 GOMAXPROCS:K8s 里别再让 CPU limit 偷偷拖垮 P99
- 2026-06-01 473浏览
-
- Go 1.25 容器里的 GOMAXPROCS 怎么迁移:cgroup CPU 限额、自动更新与旧环境兼容
- 2026-08-09 438浏览
-
- docker的 linux 内核可以和宿主机不一样吗?
- 2023-01-12 318浏览
-
- mac 如何安装k8s
- 2023-01-13 353浏览

