Threads (@oxjimmyo / 台灣AI)
ai-engineeringai-tools
Original source

把最強 AI 拔掉換中階模型 — 品質沒掉,迷信掉了

Summary

作者用 Fable(前沿最強模型)做 AI 研究,設計了一個對照實驗:六組 AI agent、650 萬 token、100+ AI 分身,測試「品質到底來自模型智商,還是來自流程紀律」。

核心發現:

  1. 沒有結構的中階模型 — 寫出最漂亮的報告,但推薦的研究題目早已被 ACL 2025 發表,判定:KILLED。連最強模型當盲審都沒查出來。

  2. 有紀律的中階模型 — 自動跑掃描、反駁、引用稽核、兩輪挑錯,盲測只落後最強模型半分,且是唯一通過所有攻擊的建議。

  3. 同一個中階模型,拿掉紀律 — 每一項都輸。

  4. 最強模型唯一剩的優勢是「品味」(TASTE) — 但品味可以被壓縮成九條檢查表,中階模型照樣能查。

結論:

  • 貴的不是智商,是紀律
  • 判斷力無法取代查證,任何等級的 AI 都一樣
  • 別把命押在最聰明的模型上,押在連笨模型都會執行的流程上
  • 整套系統就是一個裝滿 markdown 的資料夾(流程、規則、Lesson.md 錯誤帳)

完整實驗記錄:https://medium.com/@just… (The Understudy: what happened when I benched my frontier model)