NVIDIA Nemotron 3.5 Lightning + NeMo Switchyard:Agent 自動選模型
- URL: https://www.threads.com/@aiposthub/post/Db58t0zAcOo
- Date Saved: 2026-08-12
- Source: Threads (@aiposthub)
- Tags: ai-engineering, ai-tools
Summary
NVIDIA 推出兩個新東西,讓 AI Agent 不再每一步都需要叫最強模型。
Nemotron 3.5 Lightning
- 30B MoE 模型,每次推論只啟用約 3B 參數
- 專門處理大量、高頻的 Agent 任務
NeMo Switchyard(模型調度員)
核心概念:Agent 執行任務時自動決定每一步該找哪個模型
- 簡單任務 → 便宜快速的小模型
- 複雜推理 → 升級給前沿模型
- 小模型一直失敗 → 自動換更強模型
公布測試數據
LangChain 案例:
- 只有 7% 呼叫需要前沿模型
- 成本降低 74%
- 準確率下降約 6 個百分點
Ramp 案例:
- 成本降低 58%
- 執行時間降低 33%
觀點
未來 AI Agent 競爭,「模型怎麼分工」可能直接決定一套 Agent 燒多少錢。
企業問題會從「選 Claude/GPT/Gemini 哪個?」變成「什麼任務該交給哪個模型?然後讓 Router 自己分配」。
注意:NeMo Switchyard 目前還在 pre-alpha。
與 tenkapo.ai 的關聯
這正是 LLM Gateway/Router 層的價值所在。智能路由(根據任務複雜度自動選模型)是網關產品的重要差異化功能。NVIDIA 從 GPU→模型→調度層一路延伸,說明這個位置很重要。