Microsoft Research (project page)
ai-engineeringai-tools
Original source

Mage-VL — 微軟 Codec-Native 串流多模態基礎模型

Summary

微軟推出 Mage-VL,一個 codec-native 串流多模態基礎模型,解決標準 VLM 的 Moravec’s paradox:擅長複雜離線視覺推理,卻在簡單串流感知任務上低效失敗。

核心創新

  1. Codec-Native 視覺編碼器 (Mage-ViT)

    • 不用均勻幀取樣,而是像視頻 codec 一樣讀取影片
    • 分為 anchor (I) frames(完整保留)和 predicted (P) frames(只保留運動顯著的 patch)
    • 16x16 patch 級別操作,視覺 token 減少 75%+,推理速度最高提升 3.5x
    • Codec 無關:支持傳統 codec(H.264/HEVC)和神經 codec(DCVC-RT)
    • 僅用 1 億未標註圖像/視頻從零訓練,匹配或超越用數十億圖文對訓練的旗艦編碼器
  2. 仿生主動串流 (System 1 + System 2)

    • 輕量 System 1 事件門監控滾動 codec 窗口,決定「何時說話」
    • 只有值得回應的事件才觸發完整 System 2 VLM 生成
    • 不需要多 Agent 管線,單模型設計
    • 可泛化到真實場景(如 2026 世界盃直播評論)
  3. AI4AI 數據管線

    • 訓練數據通過 agentic 閉環自我優化
    • Qwen3-VL-32B 生成 caption → GPT-5 評分 → GitHub Copilot 協同優化 prompt 和代碼 → 人工驗證
    • 10 輪迭代提升所有下游任務(+5.6 InfoVQA, +3.8 OCRBench, +3.8 RealWorldQA)

性能

  • Mage-VL-4B 在靜態任務匹配 Qwen3-VL-4B
  • 在視頻理解和 2D/3D 空間推理上大幅超越 15B 的 Phi-4-Reasoning-Vision
  • 推理速度最高 3.5x wall-clock speedup

七個關鍵發現

涵蓋預訓練數據效率、可變解析度縮放、codec 系統加速、VideoQA SFT 冗餘、運動-空間協同、AI4AI 數據管線、Zero-Vision SFT for multimodal RL