DFlash 2:平行猜測解碼加速,吞吐量 2.7-4.6x
- URL: https://www.threads.com/share/BAiQxZILKG/
- Date Saved: 2026-08-20
- Source: Threads (@largitdata)
- Tags: local-llm, ai-engineering
Summary
Inco AI 推出 DFlash 2,一種改進的 speculative decoding 方法,讓 Qwen3.8-27B 產生相同輸出但速度快 3 倍。
核心洞察
- 平行猜字的問題不是猜不到,而是挑錯
- 第一個字的 top-1 只對 85%,但正確答案有 99.5% 機率在前 16 名裡
- 結論:「挑比猜便宜」
兩個創新
- 每位置留 16 候選:一次算完所有相鄰配對分數,走出最順路徑。只多 2M 參數、延遲多 0.6%,贏過參數多 40 倍的對手
- 層內小卷積:解決「越猜到後面越不準」問題,在每層加只看前一位置的小卷積讓資訊流動。多 3% 參數,5 層打贏 15 層
結果
- 每多接受一個字成本只多 1.3%
- 吞吐量為傳統解碼的 2.7-4.6 倍
- 不過實測 DFlash 2 vs MTP,MTP 還是略快
參考
- 原文:inco.ai/blog (DFlash 2: Keep Drafting Parallel)