Threads (@aiposthub)
ai-engineeringai-tools
Original source

NVIDIA Nemotron 3.5 Lightning + NeMo Switchyard:Agent 自動選模型

Summary

NVIDIA 推出兩個新東西,讓 AI Agent 不再每一步都需要叫最強模型。

Nemotron 3.5 Lightning

  • 30B MoE 模型,每次推論只啟用約 3B 參數
  • 專門處理大量、高頻的 Agent 任務

NeMo Switchyard(模型調度員)

核心概念:Agent 執行任務時自動決定每一步該找哪個模型

  • 簡單任務 → 便宜快速的小模型
  • 複雜推理 → 升級給前沿模型
  • 小模型一直失敗 → 自動換更強模型

公布測試數據

LangChain 案例:

  • 只有 7% 呼叫需要前沿模型
  • 成本降低 74%
  • 準確率下降約 6 個百分點

Ramp 案例:

  • 成本降低 58%
  • 執行時間降低 33%

觀點

未來 AI Agent 競爭,「模型怎麼分工」可能直接決定一套 Agent 燒多少錢。

企業問題會從「選 Claude/GPT/Gemini 哪個?」變成「什麼任務該交給哪個模型?然後讓 Router 自己分配」。

注意:NeMo Switchyard 目前還在 pre-alpha。

與 tenkapo.ai 的關聯

這正是 LLM Gateway/Router 層的價值所在。智能路由(根據任務複雜度自動選模型)是網關產品的重要差異化功能。NVIDIA 從 GPU→模型→調度層一路延伸,說明這個位置很重要。