Threads (@calvin.j.ku)
ai-engineeringdev-tools
Original source

Databricks Coding Agent Benchmark:模型 + Harness 實測結論

Summary

Databricks 在自家數百萬行 codebase 上實測 coding agents,比較不同模型和 harness 組合的效果與成本。

原文:https://www.databricks.com/blog/benchmarking-coding-agents-databricks-multi-million-line-codebase

核心結論:

  1. Token 單價不等於實際任務成本 — Sonnet 5 單價是 Opus 4.8 的 58%,但廢話太多,實際完成任務的平均成本反而比 Opus 4.8 高 12%
  2. GLM-5.2 在真實任務上表現與 Opus 4.8 完全相同,不再只是備胎
  3. 同模型不同 harness 成本可差 2 倍以上,但效果幾乎一樣
  4. 普通任務用 Haiku / GPT Mini 系列就夠,設計和找 bug 再用頂級模型
  5. Pi 是 harness 王者(極簡 CLI loop、精簡 context、模型中立)

作者補充:

  • Pi 的極簡設計(純 CLI loop)和精簡 context 與其他框架形成強烈對比
  • Databricks 選 Pi 而非 OpenCode 測試,可能因為更模型中立
  • 可惜沒測到 Fable 5 和 GPT-5.6