跳转到文档内容

15 篇文章 文档包含 "Kubernetes"

查看全部标签

KAI Scheduler 与 HAMi 的 GPU 显存硬隔离:运行原理与实践

· 阅读需要 9 分钟

上一篇 《HAMi-core 被 NVIDIA KAI Scheduler 采用》已经介绍了 KAI Scheduler 和这项集成的协作背景。本文不再重复铺垫,只回答一个问题:KAI Scheduler 把两个 Pod 调度到同一张 GPU 后,HAMi-core 是否真的能限制每个 Pod 的显存用量?

我们在 GKE 1.35/COS/CDI 上验证了当前文档支持的组合:KAI Scheduler v0.17.0 与 kai-resource-isolator 1.1.0-chart。两个 Pod 共享同一张 NVIDIA T4,各自看到 4147 MiB 上限;申请 3 GiB 成功,累计申请 5 GiB 失败。可选的 monitor 也导出了两个 Pod 的实时显存上限与用量。

关于实测输出

下文的 UUID、显存上限、CUDA 分配结果和 monitor 指标均来自该次 GKE 实测。资源后缀和地址在不同集群中会变化。

HAMi 亮相 KubeCon + CloudNativeCon India 2026:将 GPU 共享带给社区

· 阅读需要 7 分钟
HAMi 社区

2026 年 6 月 18-19 日,KubeCon + CloudNativeCon India 2026 在印度孟买举行,来自云原生生态的实践者、平台工程师、AI 基础设施团队和开源贡献者齐聚一堂。随着 AI 成为本届大会最重要的主题之一,HAMi 展示了 Kubernetes 原生 GPU 共享如何帮助组织提升加速器利用率,同时保持工作负载隔离和运维灵活性。

从开场 Keynote 到展台现场演示,再到与工程团队的技术讨论,本次活动凸显了一个越来越明确的行业关注点:让昂贵的 GPU 基础设施真正适用于多租户 AI 工作负载。

HAMi-core 被 NVIDIA KAI Scheduler 采用:GPU 共享正式迈入硬隔离时代

· 阅读需要 11 分钟
HAMi 社区

本文中的集成对象严格来说是 HAMi-core,而非完整 HAMi 平台。KAI Scheduler 保留自身调度能力,引入 HAMi-core 提供 GPU Memory Isolation 能力。

2026 年 6 月,两项核心 PR 正式合并进入 NVIDIA KAI Scheduler 主干。HAMi 的 GPU 显存硬隔离能力已作为内置特性随 KAI Scheduler v0.16.4 发布,云原生 GPU 资源调度正式从「软共享」迈入「硬隔离」时代。

HAMi v2.9.0 发布:昇腾用户态切分、DRA 正式可用与调度生态扩展

· 阅读需要 14 分钟
HAMi 社区

HAMi 社区正式发布 HAMi v2.9.0。这是一个在异构设备虚拟化深度、调度器生态扩展与 Kubernetes 原生标准落地层面具有里程碑意义的版本。

v2.9.0 引入了昇腾 910C HAMi-core 模式、HAMi-DRA 正式可用、项目发布以及 Volcano vGPU 升级至 v0.19 等重磅特性,同时在可观测性、安全性、稳定性等方面进行了系统性增强,共有 19 位新贡献者首次参与。

本文将对 v2.9.0 的主要更新进行详细说明。

HAMi WebUI 正式发布:Kubernetes GPU 监控仪表盘

· 阅读需要 6 分钟
HAMi 社区

在 Kubernetes 中管理 GPU 资源,长期以来存在一个"盲区"。你知道 GPU 在被使用,但要回答"哪个节点还有空闲?"、"这个工作负载是否真的在用分配到的 GPU?"、"集群整体 GPU 利用率趋势如何?"这些问题,往往需要在 kubectl get、Prometheus PromQL 和日志输出之间反复切换。

今天,HAMi 社区正式推出 HAMi WebUI,一款将整个 GPU 集群呈现在单一可视化界面中的开源 GPU 监控仪表盘。

HAMi WebUI v1.1.0 现已作为首个正式主要版本发布,邀请你试用。

与 HAMi 核心调度器配合,WebUI 实现了完整的闭环:从 GPU 调度到可视化可观测性

KubeCon EU 2026 回顾:HAMi 从展台到主论坛 Keynote Demo

· 阅读需要 11 分钟
HAMi 社区

刚刚结束的 KubeCon + CloudNativeCon Europe 2026,释放出一个越来越明确的行业信号:

云原生正在快速从“应用运行平台”演进为 AI 基础设施的运行底座。

在阿姆斯特丹,围绕 Kubernetes、GPU、推理服务、Agentic AI 和异构算力调度的讨论,已经不再停留在概念层面,而是进入到更具体的工程实践、社区协作与基础设施范式演进阶段。

从 Device Plugin 到 DRA:GPU 调度范式升级与 HAMi-DRA 实践回顾

· 阅读需要 5 分钟
HAMi 社区

刚刚过去的 KCD Beijing 2026,是近年来规模最大的一次 Kubernetes 社区大会之一。

超过 1000 人报名参与,刷新历届 KCD 北京记录。

HAMi 社区不仅受邀进行了技术分享,也在现场设立了展台,与来自云原生与 AI 基础设施领域的开发者、企业用户进行了深入交流。

本次分享主题为:

从 Device Plugin 到 DRA:GPU 调度范式升级与 HAMi-DRA 实践

本文结合现场分享内容与 PPT,做一次更完整的技术回顾。附幻灯片下载:GitHub - HAMi-DRA KCD Beijing 2026

CNCFHAMi 是 CNCF 孵化项目