FreeToken: Edge-Native MoE Serving with Bandwidth-Adaptive Execution
- URL: https://www.threads.com/share/_3kZRUQZi/
- Date Saved: 2026-08-25
- Source: Threads (@tripleh.ai)
- Tags: local-llm, ai-engineering
- Paper: https://hub.baai.ac.cn/paper/cb30391b-41b4-4b91-938b-00f60dcc83f7
Summary
- FreeToken 是一個 edge-native MoE 推理引擎,專為本地設備(筆電/桌機)設計
- 核心解決問題:本地 code agent 跑起來時,負載動態變化(tool call 插入導致 CPU/GPU/記憶體/頻寬瓶頸切換)
- 動態決定 MoE expert 放在哪裡、哪些狀態值得重用,讓整台機器協同扛推理
- 實測成果:
- 8GB 筆電 GPU → 跑 35B MoE
- 32GB 4090 桌機 → 跑 284B MoE
- 單張工作站 GPU → 753B GLM-5.2
- BAAI Hot Papers 排名第 1
- 作者觀點:如果這路線成熟,本地 AI 採購重點將變成「哪台機器最會養 agent workflow」而非只看顯存大小
- 目前需要 Linux 環境運行