Nvidia: Cross-Model KV Cache Transfer via Linear Mapping
- URL: https://www.threads.com/share/_0svqndnU/
- Date Saved: 2026-08-24
- Source: Threads (@asgard_ai_platform)
- Tags: ai-engineering, local-llm
- Paper: https://arxiv.org/abs/2608.03893
Summary
Nvidia 研究發現不同 LLM 之間的 KV cache 存在明顯線性結構,可用線性代數(閉合式矩陣映射)直接搬移,不需訓練神經網路做轉換。
關鍵數據
- Qwen3 14B → 32B,32768 tokens:278ms(原本 prefill 7 秒)→ 快 25 倍
- Llama 8B → 70B 組合也驗證可行
- 準確率保留 73%-98%(ARC-Challenge, HellaSwag, MMLU, GSM8K, WinoGrande)
- 速度提升 2.7x-25x
應用場景
- 長時間 agent 任務中途換模型(小模型跑前半,關鍵時刻交棒大模型)
- MoE 架構效率提升
- 省掉重算 prefill 的成本
限制
- 目前測試限於同家族模型(Qwen3 14B→32B, Llama 8B→70B)
- 跨架構(如 Llama→Qwen)可行性未明確驗證
- arXiv 預印本階段