Threads (@largitdata)
local-llmai-engineering
Original source

DFlash 2:平行猜測解碼加速,吞吐量 2.7-4.6x

Summary

Inco AI 推出 DFlash 2,一種改進的 speculative decoding 方法,讓 Qwen3.8-27B 產生相同輸出但速度快 3 倍。

核心洞察

  • 平行猜字的問題不是猜不到,而是挑錯
  • 第一個字的 top-1 只對 85%,但正確答案有 99.5% 機率在前 16 名裡
  • 結論:「挑比猜便宜」

兩個創新

  1. 每位置留 16 候選:一次算完所有相鄰配對分數,走出最順路徑。只多 2M 參數、延遲多 0.6%,贏過參數多 40 倍的對手
  2. 層內小卷積:解決「越猜到後面越不準」問題,在每層加只看前一位置的小卷積讓資訊流動。多 3% 參數,5 層打贏 15 層

結果

  • 每多接受一個字成本只多 1.3%
  • 吞吐量為傳統解碼的 2.7-4.6 倍
  • 不過實測 DFlash 2 vs MTP,MTP 還是略快

參考

  • 原文:inco.ai/blog (DFlash 2: Keep Drafting Parallel)