当前位置:首页 > 文章列表 > 科技周边 > 业界新闻 > KubeCon 议题中 GPU 调度和可观测性如何分别落到工程任务

KubeCon 议题中 GPU 调度和可观测性如何分别落到工程任务

来源:17golang原创 2026-09-12 17:32:06 0浏览 收藏

KubeCon 的议程里出现 GPU 调度、拓扑感知、eBPF 和推理可观测性,并不等于团队应该马上换一套平台。更有用的做法,是把每个议题翻译成“谁负责、改哪一层、拿什么证据验收”的工程任务。2026 年北美 KubeCon + CloudNativeCon 将于 11 月 9 日至 12 日在盐湖城举行,CNCF 公告把新设的 AI Inference + Agentic 轨道直接指向 GPU 调度、模型服务和生产可观测性。

要点速览
  • GPU 调度先拆资源描述、队列配额、拓扑放置和反碎片化验收。
  • 可观测性不能只看一张 GPU 利用率图,要把硬件、Pod、模型请求和租户串起来。
  • 多租户场景把 ResourceClaim 权限、遥测标签和审计记录列为上线条件。

先把会议热词分成两条工程线

“调度”回答的是工作负载能不能拿到合适的 GPU、何时拿到、放在哪些节点;“可观测性”回答的是拿到之后是否按预期运行,以及延迟、显存和租户成本为什么变化。两者有关联,但负责人和验收证据不同。

议题信号应落成的任务最小验收证据
DRA、设备共享定义 DeviceClass、ResourceClaim 与驱动责任声明能绑定,失败原因可定位
Kueue、拓扑感知配置队列、配额和 preferred/required 拓扑等待时间、放置结果、碎片率可对比
GPU eBPF、DCGM采集设备指标并关联 Pod/命名空间异常 GPU 能回溯到工作负载
推理可观测性贯通 trace、token 延迟、吞吐和显存压力一条请求能解释到硬件瓶颈

GPU 调度线:从“有卡可用”变成可验收的资源合同

第一张任务卡写资源模型。Kubernetes 当前 DRA 文档把 DeviceClass、ResourceClaim、ResourceClaimTemplate 和 ResourceSlice 分成不同职责:驱动发布设备,集群管理员定义可用类别,工作负载通过 claim 请求设备。这样做的重点不是把 YAML 写得更长,而是让“什么设备、能否共享、由谁维护”变成明确合同。

第二张任务卡写放置策略。GPU 数量够,不代表训练任务能启动;NVLink 域、NUMA 和机架边界可能决定一组 GPU 是否适合放在一起。把队列、配额、拓扑偏好和必需条件分开记录,并同时保留“为什么 Pending”的事件证据。

第三张任务卡写反碎片化。至少跟踪排队时长、实际分配容量、空闲但不可组合的 GPU、任务启动失败原因和节点热替换后的恢复时间。DRA 文档也提醒,当前调度器对 DRA 资源不提供抢占;高优先级工作负载可能要等冲突 Pod 结束,这应进入风险说明和回退方案。

Kubernetes DRA 与 Kueue GPU 调度任务卡示意,展示资源描述、队列配额和拓扑放置之间的关系
图1:GPU 调度任务卡的关系示意图;它用于拆解工程责任,不是实际集群截图。

可观测性线:不要让一张 80% 利用率图替团队下结论

可观测性任务应按四层写。硬件层采集 GPU 利用率、显存压力、温度和错误信号;Kubernetes 层补上节点、Pod、容器、命名空间和工作负载 UID;模型层记录请求延迟、首 token 延迟、吞吐、队列深度和错误;租户层再回答“是谁消耗了资源、是否能计费、是否出现邻居干扰”。

官方议程把 eBPF、Prometheus、OpenTelemetry 和推理链路放在相邻的工程问题里,真正可执行的 backlog 应是“建立关联键”,而不是简单增加 dashboard。建议规定 trace_id、Pod UID、模型名和 GPU device 标识的关联范围;高基数的请求参数、完整提示词和敏感业务字段不要直接塞进指标标签,必要信息放到受控日志或 trace 属性中。

第一版验收可以用一条脱敏请求做反向追踪:从用户响应找到模型实例,再找到 Pod、节点和 GPU 指标;如果只能看到硬件曲线,却不能解释某个租户的排队或显存压力,说明链路还没闭环。

Kubernetes GPU 推理可观测性关联示意,展示 GPU 指标、Pod 上下文、模型请求和租户审计边界
图2:从 GPU 指标到推理请求的关联示意;画面中的数值和界面均为解释性插图。

用威胁建模补上多租户的边界

GPU 是稀缺资产,遥测数据同样可能包含模型和业务信息。先列资产:设备容量、队列配额、模型路由、trace 与成本数据。再列攻击路径:越权创建高权限 ResourceClaim、通过标签泄露租户信息、利用共享 GPU 造成邻居干扰、用高基数标签拖垮指标系统。

控制措施要落到对象和动作:DeviceClass、ResourceSlice 只给管理员和驱动;普通工作负载只获得命名空间范围的 ResourceClaim 权限;遥测采集器使用最小 RBAC;审计记录保留 claim 创建、绑定、释放、驱动异常和队列决策。每项控制都要有反向验证,例如用普通服务账号尝试读取设备切片应被拒绝,用一条脱敏 trace 检查跨租户查询是否被隔离。

把议程转成会后可排期的任务卡

会议结束后不要按演讲数量立项。按下面四个字段整理即可:负责人是平台、GPU 驱动、推理服务还是安全团队;输入是资源清单、队列策略或遥测字段;产出是 claim 模板、调度策略、指标契约或审计规则;验收是等待时间、放置成功率、归因完整度和越权测试结果。

官方核对入口:https://events.linuxfoundation.org/kubecon-cloudnativecon-north-america/program/schedule/;DRA 术语与权限边界可查看 https://kubernetes.io/docs/concepts/resource-management/dynamic-resource-allocation/。议程会变化,真正排期前应重新打开官方页面确认场次和版本语境。

常见问题

有 GPU 配额,为什么任务仍然 Pending?

配额只说明账面资源,拓扑、claim、驱动状态或不可抢占限制都可能阻止实际放置,应结合队列事件和 ResourceClaim 状态判断。

只采集 GPU 利用率够不够?

不够。它不能解释租户、模型请求、排队和首 token 延迟,至少要补上 Pod/命名空间上下文和请求链路关联。

eBPF 能替代现有 GPU 监控吗?

不应直接替代。它适合补充内核或进程侧信号,硬件指标、容器上下文和 trace 仍需组合,并先确认驱动与内核支持范围。

版本声明
本文转载于:17golang原创 如有侵犯,请联系study_golang@163.com删除
Go unsafe.Slice 如何从指针构造字节切片Go unsafe.Slice 如何从指针构造字节切片
上一篇
Go unsafe.Slice 如何从指针构造字节切片
Go database/sql 查询上下文取消后为什么还占连接
下一篇
Go database/sql 查询上下文取消后为什么还占连接
查看更多
最新文章
查看更多
课程推荐
  • 前端进阶之JavaScript设计模式
    前端进阶之JavaScript设计模式
    设计模式是开发人员在软件开发过程中面临一般问题时的解决方案,代表了最佳的实践。本课程的主打内容包括JS常见设计模式以及具体应用场景,打造一站式知识长龙服务,适合有JS基础的同学学习。
    543次学习
  • GO语言核心编程课程
    GO语言核心编程课程
    本课程采用真实案例,全面具体可落地,从理论到实践,一步一步将GO核心编程技术、编程思想、底层实现融会贯通,使学习者贴近时代脉搏,做IT互联网时代的弄潮儿。
    516次学习
  • 简单聊聊mysql8与网络通信
    简单聊聊mysql8与网络通信
    如有问题加微信:Le-studyg;在课程中,我们将首先介绍MySQL8的新特性,包括性能优化、安全增强、新数据类型等,帮助学生快速熟悉MySQL8的最新功能。接着,我们将深入解析MySQL的网络通信机制,包括协议、连接管理、数据传输等,让
    500次学习
  • JavaScript正则表达式基础与实战
    JavaScript正则表达式基础与实战
    在任何一门编程语言中,正则表达式,都是一项重要的知识,它提供了高效的字符串匹配与捕获机制,可以极大的简化程序设计。
    487次学习
  • 从零制作响应式网站—Grid布局
    从零制作响应式网站—Grid布局
    本系列教程将展示从零制作一个假想的网络科技公司官网,分为导航,轮播,关于我们,成功案例,服务流程,团队介绍,数据部分,公司动态,底部信息等内容区块。网站整体采用CSSGrid布局,支持响应式,有流畅过渡和展现动画。
    485次学习
查看更多
AI推荐
  • H2O EvalGPT:开源LLM大模型评估与排行榜工具
    H2O EvalGPT
    H2O EvalGPT是H2O.ai推出的开源LLM评估平台,提供详细的大模型性能排行榜、行业特定基准测试及A/B测试功能,助您快速选择最适合项目的高性能大语言模型。
    104次使用
  • LMArena是什么?伯克利AI模型评估平台使用指南与功能解析
    LMArena
    LMArena是加州大学伯克利分校推出的AI模型匿名评测平台。通过盲测投票机制,用户可对比不同大模型回答并生成实时排行榜,助力开发者优化模型及用户选择最佳AI工具。
    20次使用
  • OpenCompass大模型评测体系详解:功能、使用指南与应用场景
    OpenCompass
    OpenCompass是上海AI实验室推出的开源大模型评测平台,提供CompassKit、CompassHub和CompassRank三大核心组件,支持LLM及多模态模型的一站式标准化评估与排行榜查询。
    31次使用
  • AGI-Eval大模型评测平台:权威榜单、数据集与人机协同评测方案
    AGI-Eval
    AGI-Eval是由上海交大等高校联合发布的大模型评测社区,提供公正透明的LLM能力榜单、多领域评测集及Data Studio数据服务,助力AI模型性能评估与NLP科研开发。
    21次使用
  • SuperCLUE中文大模型评测基准:功能、能力维度与应用指南
    SuperCLUE
    SuperCLUE是权威的中文大语言模型综合评测基准,涵盖语言理解、知识应用、AI Agent智能体及安全性等12项核心能力。通过多轮对话与客观测试,定期发布榜单与技术报告,为模型研发、优化及行业选型提供科学依据。
    258次使用
微信登录更方便
  • 密码登录
  • 注册账号
登录即同意 用户协议隐私政策
返回登录
  • 重置密码