Facebook (DevOps Taiwan 群組)
ai-engineeringdev-tools
Original source

AI Agent 自己跑 TDD:成本暴增,品質卻沒比較好

Summary

探討 AI Agent 使用 TDD(Test-Driven Development)是否有效的研究/分析:

兩種流程比較

  1. AI Agent 做 TDD:寫測試(紅)→ 寫程式(綠)→ 重構
  2. AI Agent 不做 TDD:先規劃(理解需求)→ 直接寫程式 → 測試驗證

測試結果

  • Mutation Score:非 TDD 版本常佔第 1、第 2 名,看不出 TDD 有系統性優勢
  • Token 成本:TDD 高出 3~8.5 倍

可能原因

  • TDD 讓 agent 容易陷入局部決策
  • 直接從需求寫程式反而讓模型有更完整的全局視角

作者建議

  • 用 Mutation testing 看防護力
  • 用 Approved/review Scenarios
  • 凍結已確認情境

結論

重點不是逼 AI 照 TDD 儀式走,而是建立回饋機制,並讓人類擔任品質仲裁者。

口號:「與其規定怎麼做,不如監測結果」