<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>VGPU - 标签 - 探索云原生</title><link>https://www.lixueduan.com/tags/vgpu/</link><description>探索云原生（微信公众号：探索云原生）,是意琦行的技术博客。一个云原生打工人的探索之路。从容器与编排出发，目前主要折腾云原生 AI 基础设施：GPU 资源化、编排调度、模型服务与可观测性。分享踩坑实录和实践经验。</description><generator>Hugo 0.149.0 &amp; FixIt v0.4.0-alpha-20250831070510-5a66a050</generator><language>zh-CN</language><managingEditor>xueduan.li@gmail.com (意琦行)</managingEditor><webMaster>xueduan.li@gmail.com (意琦行)</webMaster><lastBuildDate>Tue, 14 Jul 2026 22:00:00 +0000</lastBuildDate><atom:link href="https://www.lixueduan.com/tags/vgpu/index.xml" rel="self" type="application/rss+xml"/><item><title>Kueue + HAMi vGPU 实战：显存与算力配额管理</title><link>https://www.lixueduan.com/posts/kubernetes/65-kueue-p4-hami-vgpu/</link><pubDate>Tue, 14 Jul 2026 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/65-kueue-p4-hami-vgpu/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/kueue-p4-hami.jpg' alt="Kueue &amp;#43; HAMi vGPU 实战：显存与算力配额管理"&gt;&lt;/p&gt;
&lt;p&gt;上一篇我们用 Kueue + NVIDIA 原生 DRA 跑通了 GPU 整卡配额：Job 先进入队列，Kueue 判断配额够不够，够了再放行给调度器。&lt;/p&gt;
&lt;p&gt;但整卡只是第一步。真实的 GPU 集群里，一张 GPU 往往不会只给一个 Pod 用，HAMi 可以继续按显存和算力切成 vGPU。问题也跟着来了：&lt;em&gt;切完之后，队列系统还能不能知道每个任务用了多少？能不能做到两个任务放行、第三个因为显存或算力配额不够继续排队？&lt;/em&gt;&lt;/p&gt;
&lt;p&gt;这篇就围绕这个问题跑一遍：&lt;strong&gt;HAMi 把 GPU 切给 Pod，Kueue 在 Job 准入阶段先把 vGPU、显存和算力配额算清楚。重点不是“能不能切卡”，而是“切完之后还能不能管起来”&lt;/strong&gt;。&lt;/p&gt;</description></item><item><title>Kubernetes GPU 虚拟化实战：HAMi DRA 模式完整指南</title><link>https://www.lixueduan.com/posts/kubernetes/56-hami-dra-quickstart/</link><pubDate>Thu, 14 May 2026 12:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/56-hami-dra-quickstart/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-dra-quickstart.jpg' alt="hami-dra-quickstart.jpg"&gt;&lt;/p&gt;
&lt;p&gt;&lt;a href="https://github.com/Project-HAMi/HAMi"target="_blank" rel="external nofollow noopener noreferrer"&gt;HAMi&lt;/a&gt; 是目前 Kubernetes 上最活跃的开源 vGPU 方案，能够将一块物理 GPU 按显存和算力细粒度地切分为多个虚拟 GPU，供不同 Pod 共享。&lt;/p&gt;
&lt;p&gt;本文聚焦 HAMi DRA 模式的部署与使用：安装 HAMi DRA 驱动后，分别用原生模式和兼容模式提交 Pod，验证 GPU 切分是否生效。&lt;/p&gt;</description></item><item><title>Volcano vGPU实战：无硬件依赖的Kubernetes GPU共享与隔离方案</title><link>https://www.lixueduan.com/posts/kubernetes/45-volcano-vgpu/</link><pubDate>Tue, 19 Aug 2025 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/45-volcano-vgpu/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/volcano-vgpu.jpg' alt="volcano-vgpu.jpg"&gt;&lt;/p&gt;
&lt;p&gt;在上一篇《Volcano初探：批处理调度引擎的云原生实践》中，我们通过Helm快速部署了Volcano集群，并成功运行了首个测试任务，验证了其基础调度能力。本文将进一步探索Volcano的&lt;strong&gt;GPU虚拟化功能&lt;/strong&gt;，聚焦如何通过&lt;strong&gt;HAMi vGPU 技术&lt;/strong&gt;实现GPU资源的细粒度共享与硬隔离。&lt;/p&gt;</description></item><item><title>HAMi 异构设备虚拟化之海光 DCU 实战：K8s 下的 vDCU 资源调度与纳管</title><link>https://www.lixueduan.com/posts/kubernetes/41-hami-vdcu/</link><pubDate>Wed, 28 May 2025 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/41-hami-vdcu/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-vdcu.jpg' alt="hami-vdcu.jpg"&gt;&lt;/p&gt;
&lt;p&gt;之前通过一系列文章分析了 HAMI vGPU 部署使用以及背后的实现原理，本文则是分析海光 DCU 设备如何通过 HAMi 完成虚拟化，实现统一纳管与调度。&lt;/p&gt;</description></item><item><title>精准而优雅：HAMi 调度特性之按 GPU 类型和 UUID 调度</title><link>https://www.lixueduan.com/posts/kubernetes/40-hami-6-precise-schedule/</link><pubDate>Wed, 05 Mar 2025 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/40-hami-6-precise-schedule/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-precise-schedule.jpg' alt="hami-precise-schedule.jpg"&gt;&lt;/p&gt;
&lt;p&gt;上一篇我们简单分析一下 HAMi-Core(libvgpu.so) vCUDA 的工作原理，包括怎么生效的，CUDA API 怎么拦截的，以及是怎么实现的对 GPU 的 core、memory 资源的 limit 的。&lt;/p&gt;
&lt;p&gt;这一篇我们分析一下 HAMi 的调度特性：根据 GPU 类型甚至 UUID 实现精细调度。&lt;/p&gt;</description></item><item><title>HAMi v2.5.0 Released，新特性一览</title><link>https://www.lixueduan.com/posts/kubernetes/38-hami-v2.5.0-released/</link><pubDate>Sun, 09 Feb 2025 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/38-hami-v2.5.0-released/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-2.5.0-released.jpg' alt="hami-2.5.0-released.jpg"&gt;&lt;/p&gt;
&lt;p&gt;HAMi v2.5.0 发布啦，新增了动态 MIG 支持的同时稳定性、易用性都有较大提升，快来看看吧~&lt;/p&gt;</description></item><item><title>HAMi vGPU 原理分析 Part5：HAMi-core(libvgpu.so) vCUDA 工作原理分析</title><link>https://www.lixueduan.com/posts/kubernetes/36-hami-analyze-5-hami-core/</link><pubDate>Wed, 08 Jan 2025 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/36-hami-analyze-5-hami-core/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-analyze-5-hami-core.jpg' alt="hami-analyze-5-hami-core"&gt;&lt;/p&gt;
&lt;p&gt;上篇我们分析了 hami-scheduler 中 Spread、Binpack 等高级调度策略是怎么实现的。&lt;/p&gt;
&lt;p&gt;本文为 HAMi 原理分析的第五篇，简单分析一下 HAMi-Core(libvgpu.so) vCUDA 的工作原理，包括怎么生效的，CUDA API 怎么拦截的，以及是怎么实现的对 GPU 的 core、memory 资源的 limit 的。&lt;/p&gt;</description></item><item><title>HAMi vGPU 原理分析 Part4：Spread&amp;Binpack 高级调度策略实现</title><link>https://www.lixueduan.com/posts/kubernetes/33-hami-analyze-4-scheduler-policy/</link><pubDate>Tue, 10 Dec 2024 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/33-hami-analyze-4-scheduler-policy/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-analyze-4-spread-binpark-policy.jpg' alt="hami-analyze-4-spread-binpark-policy.jpg"&gt;&lt;/p&gt;
&lt;p&gt;上篇我们分析了 hami-scheduler 工作流程，知道了 hami-webhook、hami-scheduler 是怎么配合工作的。&lt;/p&gt;
&lt;p&gt;本文为 HAMi 原理分析的第四篇，分析 hami-scheduler 在调度时是如何选择节点的，即：Spread、Binpack 等高级调度策略是怎么实现的。&lt;/p&gt;</description></item><item><title>HAMi vGPU 原理分析 Part3：hami-scheduler 工作流程分析</title><link>https://www.lixueduan.com/posts/kubernetes/32-hami-analyze-3-scheduler/</link><pubDate>Tue, 26 Nov 2024 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/32-hami-analyze-3-scheduler/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-analyze-3-hami-scheduler.png' alt="hami-analyze-3-hami-scheduler.png"&gt;&lt;/p&gt;
&lt;p&gt;上篇我们分析了 hami-webhook，该 Webhook 将申请了 vGPU 资源的 Pod 的调度器修改为 hami-scheduler，后续使用 hami-scheduler 进行调度。&lt;/p&gt;
&lt;p&gt;本文为 HAMi 原理分析的第三篇，分析 hami-scheduler 工作流程。&lt;/p&gt;</description></item><item><title>HAMi vGPU 原理分析 Part2：hami-webhook 原理分析</title><link>https://www.lixueduan.com/posts/kubernetes/31-hami-analyze-2-webhook/</link><pubDate>Wed, 20 Nov 2024 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/31-hami-analyze-2-webhook/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-analyze-2-hami-webhook.jpg' alt="hami-analyze-2-hami-webhook.jpg"&gt;&lt;/p&gt;
&lt;p&gt;上篇我们分析了 hami-device-plugin-nvidia，知道了 HAMi 的 NVIDIA device plugin 工作原理。&lt;/p&gt;
&lt;p&gt;&lt;a href="https://www.lixueduan.com/posts/kubernetes/29-hami-analyze-1-device-plugin-nvidia/"target="_blank" rel="external nofollow noopener noreferrer"&gt;HAMi vGPU 原理分析 Part1：hami-device-plugin-nvidia 实现&lt;/a&gt;&lt;/p&gt;
&lt;p&gt;本文为 HAMi 原理分析的第二篇，分析 hami-scheduler 实现原理。&lt;/p&gt;</description></item><item><title>HAMi vGPU 原理分析 Part1：hami-device-plugin-nvidia 实现</title><link>https://www.lixueduan.com/posts/kubernetes/29-hami-analyze-1-device-plugin-nvidia/</link><pubDate>Tue, 05 Nov 2024 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/29-hami-analyze-1-device-plugin-nvidia/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-analyze-1-device-plugin-nvidia.jpg' alt="hami-analyze-1-device-plugin-nvidia.jpg"&gt;&lt;/p&gt;
&lt;p&gt;本文为开源的 vGPU 方案 HAMi 实现原理分析第一篇，主要分析 hami-device-plugin-nvidia 实现原理。&lt;/p&gt;</description></item><item><title>开源 vGPU 方案 HAMi: core&amp;memory 隔离测试</title><link>https://www.lixueduan.com/posts/kubernetes/28-hami-isolation-test/</link><pubDate>Mon, 28 Oct 2024 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/28-hami-isolation-test/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/hami-isolation-test.jpg' alt="hami-isolation-test.jpg"&gt;&lt;/p&gt;
&lt;p&gt;本文主要对开源的 vGPU 方案 HAMi 的 GPU Core&amp;amp;Memory 隔离功能进行测试。&lt;/p&gt;</description></item><item><title>开源 vGPU 方案：HAMi,实现细粒度 GPU 切分</title><link>https://www.lixueduan.com/posts/kubernetes/26-gpu-virtualization-hami/</link><pubDate>Wed, 09 Oct 2024 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/26-gpu-virtualization-hami/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/kubernetes/cover/vgpu-hami.png' alt="vgpu-hami.png"&gt;&lt;/p&gt;
&lt;p&gt;本文主要分享一个开源的 GPU 虚拟化方案：HAMi，包括如何安装、配置以及使用。&lt;br&gt;
相比于上一篇分享的 TimeSlicing 方案，HAMi 除了 GPU 共享之外还可以实现 GPU core、memory 的限制，保证共享同一 GPU 的各个 Pod 都能拿到足够的资源。&lt;/p&gt;</description></item><item><title>一文搞懂 GPU 共享方案： NVIDIA Time Slicing</title><link>https://www.lixueduan.com/posts/kubernetes/25-gpu-share-time-slicing/</link><pubDate>Tue, 24 Sep 2024 22:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/kubernetes/25-gpu-share-time-slicing/</guid><category domain="https://www.lixueduan.com/categories/kubernetes/">Kubernetes</category><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/ai/cover/gpu-share-time-slicing.jpg' alt="gpu-share-time-slicing.jpg"&gt;&lt;/p&gt;
&lt;p&gt;本文主要分享 GPU 共享方案，包括如何安装、配置以及使用，最后通过分析源码了 TimeSlicing 的具体实现。通过配置 TimeSlicing 可以实现 Pod 共享一块物理 GPU，以提升资源利用率。&lt;/p&gt;</description></item></channel></rss>