<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Control Plane - 标签 - 探索云原生</title><link>https://www.lixueduan.com/tags/control-plane/</link><description>探索云原生（微信公众号：探索云原生）,是意琦行的技术博客。一个云原生打工人的探索之路。从容器与编排出发，目前主要折腾云原生 AI 基础设施：GPU 资源化、编排调度、模型服务与可观测性。分享踩坑实录和实践经验。</description><generator>Hugo 0.149.0 &amp; FixIt v0.4.0-alpha-20250831070510-5a66a050</generator><language>zh-CN</language><managingEditor>xueduan.li@gmail.com (意琦行)</managingEditor><webMaster>xueduan.li@gmail.com (意琦行)</webMaster><lastBuildDate>Sat, 01 Aug 2026 20:00:00 +0000</lastBuildDate><atom:link href="https://www.lixueduan.com/tags/control-plane/index.xml" rel="self" type="application/rss+xml"/><item><title>KServe 工作流程：从 InferenceService 到 vLLM 服务</title><link>https://www.lixueduan.com/posts/ai/23-kserve-p2-architecture/</link><pubDate>Sat, 01 Aug 2026 20:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/ai/23-kserve-p2-architecture/</guid><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/ai/cover/kserve-p2-architecture.jpg' alt="KServe 工作流程：从 InferenceService 到 vLLM 服务"&gt;&lt;/p&gt;
&lt;p&gt;上一篇完成了 KServe 的安装，并通过 InferenceService 跑通了一个 Qwen 模型服务。&lt;/p&gt;
&lt;p&gt;当时提交的 InferenceService 只包含模型格式、存储地址、GPU 资源和启动参数，KServe 却创建出了 Deployment、Service 和 HTTPRoute。这份 YAML 中没有容器镜像，那么 KServe 如何选中 HuggingFaceServer，Pod 中又为什么会运行 vLLM？&lt;/p&gt;
&lt;p&gt;这一篇先看 KServe 的整体架构和核心 CRD，再结合上一篇的 &lt;code&gt;qwen-llm&lt;/code&gt;，梳理从提交 InferenceService 到请求进入 vLLM 的完整流程。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;以下内容基于 KServe 0.18，部署模式为 Standard。&lt;/p&gt;&lt;/blockquote&gt;</description></item></channel></rss>