<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>KServe - 标签 - 探索云原生</title><link>https://www.lixueduan.com/tags/kserve/</link><description>探索云原生（微信公众号：探索云原生）,是意琦行的技术博客。一个云原生打工人的探索之路。从容器与编排出发，目前主要折腾云原生 AI 基础设施：GPU 资源化、编排调度、模型服务与可观测性。分享踩坑实录和实践经验。</description><generator>Hugo 0.149.0 &amp; FixIt v0.4.0-alpha-20250831070510-5a66a050</generator><language>zh-CN</language><managingEditor>xueduan.li@gmail.com (意琦行)</managingEditor><webMaster>xueduan.li@gmail.com (意琦行)</webMaster><lastBuildDate>Tue, 28 Jul 2026 20:00:00 +0000</lastBuildDate><atom:link href="https://www.lixueduan.com/tags/kserve/index.xml" rel="self" type="application/rss+xml"/><item><title>一个 Deployment 就能跑 vLLM，为什么还需要 KServe？</title><link>https://www.lixueduan.com/posts/ai/22-kserve-p1-intro/</link><pubDate>Tue, 28 Jul 2026 20:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/ai/22-kserve-p1-intro/</guid><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/ai/cover/kserve-p1-quickstart.jpg' alt="KServe 入门：部署第一个 vLLM 推理服务"&gt;&lt;/p&gt;
&lt;p&gt;在 Kubernetes 上启动一个推理服务并不难。如果只有一个模型，vLLM + Deployment 确实够了。但服务多起来以后，模型从哪里加载、使用哪个 Runtime、GPU 怎么分配、服务怎么暴露，每个服务都要重复处理一遍，配置很快就会散落在一堆 YAML 里。KServe 解决的不是怎么启动 vLLM，而是怎么用统一的方式管理这些模型服务。&lt;/p&gt;
&lt;p&gt;本文从零安装 KServe Standard 模式和 Envoy Gateway，通过本地 PVC 部署 Qwen2.5-0.5B-Instruct 模型。&lt;/p&gt;</description></item></channel></rss>