vLLM 如何管理混合架构模型的 KV Cache:从 Kimi Linear / Kimi K3 说起

以 Kimi Linear 与 Kimi K3 为例,梳理 vLLM 面对线性注意力 + 全注意力混合架构时,KV cache 如何组织、分配与复用。

2026年7月31日 · 6 分钟 · Adeline