Mage-VL — 微軟 Codec-Native 串流多模態基礎模型
- URL: https://microsoft.github.io/Mage/vl/
- Date Saved: 2026-09-02
- Source: Microsoft Research (project page)
- Tags: ai-engineering, ai-tools
- Repo: https://github.com/microsoft/Mage (1.6k stars)
- Paper: https://arxiv.org/abs/2607.24904
- Models: https://huggingface.co/microsoft/Mage-VL, https://huggingface.co/microsoft/Mage-ViT
Summary
微軟推出 Mage-VL,一個 codec-native 串流多模態基礎模型,解決標準 VLM 的 Moravec’s paradox:擅長複雜離線視覺推理,卻在簡單串流感知任務上低效失敗。
核心創新
-
Codec-Native 視覺編碼器 (Mage-ViT)
- 不用均勻幀取樣,而是像視頻 codec 一樣讀取影片
- 分為 anchor (I) frames(完整保留)和 predicted (P) frames(只保留運動顯著的 patch)
- 16x16 patch 級別操作,視覺 token 減少 75%+,推理速度最高提升 3.5x
- Codec 無關:支持傳統 codec(H.264/HEVC)和神經 codec(DCVC-RT)
- 僅用 1 億未標註圖像/視頻從零訓練,匹配或超越用數十億圖文對訓練的旗艦編碼器
-
仿生主動串流 (System 1 + System 2)
- 輕量 System 1 事件門監控滾動 codec 窗口,決定「何時說話」
- 只有值得回應的事件才觸發完整 System 2 VLM 生成
- 不需要多 Agent 管線,單模型設計
- 可泛化到真實場景(如 2026 世界盃直播評論)
-
AI4AI 數據管線
- 訓練數據通過 agentic 閉環自我優化
- Qwen3-VL-32B 生成 caption → GPT-5 評分 → GitHub Copilot 協同優化 prompt 和代碼 → 人工驗證
- 10 輪迭代提升所有下游任務(+5.6 InfoVQA, +3.8 OCRBench, +3.8 RealWorldQA)
性能
- Mage-VL-4B 在靜態任務匹配 Qwen3-VL-4B
- 在視頻理解和 2D/3D 空間推理上大幅超越 15B 的 Phi-4-Reasoning-Vision
- 推理速度最高 3.5x wall-clock speedup
七個關鍵發現
涵蓋預訓練數據效率、可變解析度縮放、codec 系統加速、VideoQA SFT 冗餘、運動-空間協同、AI4AI 數據管線、Zero-Vision SFT for multimodal RL