Threads (@asgard_ai_platform)
ai-engineeringlocal-llm
Original source

Nvidia: Cross-Model KV Cache Transfer via Linear Mapping

Summary

Nvidia 研究發現不同 LLM 之間的 KV cache 存在明顯線性結構,可用線性代數(閉合式矩陣映射)直接搬移,不需訓練神經網路做轉換。

關鍵數據

  • Qwen3 14B → 32B,32768 tokens:278ms(原本 prefill 7 秒)→ 快 25 倍
  • Llama 8B → 70B 組合也驗證可行
  • 準確率保留 73%-98%(ARC-Challenge, HellaSwag, MMLU, GSM8K, WinoGrande)
  • 速度提升 2.7x-25x

應用場景

  • 長時間 agent 任務中途換模型(小模型跑前半,關鍵時刻交棒大模型)
  • MoE 架構效率提升
  • 省掉重算 prefill 的成本

限制

  • 目前測試限於同家族模型(Qwen3 14B→32B, Llama 8B→70B)
  • 跨架構(如 Llama→Qwen)可行性未明確驗證
  • arXiv 預印本階段