Threads (@tripleh.ai)
local-llmai-engineering
Original source

FreeToken: Edge-Native MoE Serving with Bandwidth-Adaptive Execution

Summary

  • FreeToken 是一個 edge-native MoE 推理引擎,專為本地設備(筆電/桌機)設計
  • 核心解決問題:本地 code agent 跑起來時,負載動態變化(tool call 插入導致 CPU/GPU/記憶體/頻寬瓶頸切換)
  • 動態決定 MoE expert 放在哪裡、哪些狀態值得重用,讓整台機器協同扛推理
  • 實測成果:
    • 8GB 筆電 GPU → 跑 35B MoE
    • 32GB 4090 桌機 → 跑 284B MoE
    • 單張工作站 GPU → 753B GLM-5.2
  • BAAI Hot Papers 排名第 1
  • 作者觀點:如果這路線成熟,本地 AI 採購重點將變成「哪台機器最會養 agent workflow」而非只看顯存大小
  • 目前需要 Linux 環境運行