Threads (@myps6415)
ai-engineeringlocal-llm
Original source

OasisKV:把 KV Cache 搬出 HBM 解決 LLM 推理記憶體瓶頸

Summary

LLM 推理的真正瓶頸不在算力,而在記憶體——具體是 KV cache。上下文越長、推理鏈越深,KV cache 膨脹越快,HBM 容量很快見底。

OasisKV 的做法

在解碼階段把完整 KV cache 挪出 HBM,利用注意力稀疏性只保留最相關的 Token 在高速記憶體,再靠投機解碼(speculative decoding)預測下一輪哪些 Token 會變重要,提前從大容量記憶體預抓回來。

效益數據

  • 推理吞吐量比原生 vLLM 高 1.69x
  • 準確度只掉 0.1 個百分點
  • 多 GPU 長上下文場景最高 2.1x 吞吐提升
  • Prefill-decode 分離部署下:KV 量減少 6.5-9.7x,吞吐維持約 2x,主記憶體省 2.2-2.6x
  • 2,048 Token KV budget 下,與完整注意力差距壓在 0.7% 以內

關鍵特點

  • 底層建置在 vLLM,已有部署可直接實驗
  • 適用場景:長上下文、多輪推理、記憶體緊縮的環境

為什麼重要(「鈔票」)

這是直接省推理成本的技術——同樣的 GPU 記憶體能服務更多請求、更長上下文,對任何跑 LLM 推理的人來說都是實打實的錢。