<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>HPA - 标签 - 探索云原生</title><link>https://www.lixueduan.com/tags/hpa/</link><description>探索云原生（微信公众号：探索云原生）,是意琦行的技术博客。一个云原生打工人的探索之路。从容器与编排出发，目前主要折腾云原生 AI 基础设施：GPU 资源化、编排调度、模型服务与可观测性。分享踩坑实录和实践经验。</description><generator>Hugo 0.149.0 &amp; FixIt v0.4.0-alpha-20250831070510-5a66a050</generator><language>zh-CN</language><managingEditor>xueduan.li@gmail.com (意琦行)</managingEditor><webMaster>xueduan.li@gmail.com (意琦行)</webMaster><lastBuildDate>Wed, 26 Aug 2026 20:00:00 +0000</lastBuildDate><atom:link href="https://www.lixueduan.com/tags/hpa/index.xml" rel="self" type="application/rss+xml"/><item><title>KServe 集成 KEDA：基于 vLLM 指标自动扩缩容</title><link>https://www.lixueduan.com/posts/ai/26-kserve-p4-keda/</link><pubDate>Wed, 26 Aug 2026 20:00:00 +0000</pubDate><author>xueduan.li@gmail.com (意琦行)</author><guid>https://www.lixueduan.com/posts/ai/26-kserve-p4-keda/</guid><category domain="https://www.lixueduan.com/categories/ai/">AI</category><description>&lt;p&gt;&lt;img loading="lazy" src='https://img.lixueduan.com/ai/cover/kserve-p4-keda-autoscaling.jpg' alt="KServe 集成 KEDA：基于 vLLM 指标自动扩缩容"&gt;&lt;/p&gt;
&lt;p&gt;模型服务运行后，固定副本数很难同时兼顾突发请求和资源利用率。请求增加时需要扩容，流量回落后又希望及时缩容。&lt;/p&gt;
&lt;p&gt;本文通过一个简单 Demo，为 KServe 模型服务接入 KEDA，根据 vLLM 的请求指标自动调整副本数，并验证服务从 &lt;code&gt;1 -&amp;gt; 2 -&amp;gt; 1&lt;/code&gt; 的扩缩容过程。&lt;/p&gt;</description></item></channel></rss>