LongHorizon-Harness — 只換迴圈就讓 Agent 完成率翻倍
- URL: https://www.threads.com/share/BAodb3Sg2X/
- Date Saved: 2026-08-24
- Source: Threads (@dustin_gmat)
- Tags: ai-engineering, ai-tools
- Repo: https://github.com/AMAP-ML/LongHorizon-Harness (1,108 ⭐, created 2026-08-04)
Summary
架在 Claude Code / Codex / OpenCode / DeepSeek Harness 外面的 loop 框架。不訓練模型、不取代 agent,只做外層迴圈控制。MIT 授權。
核心架構:三角色分工
- Manager — 從「原始目標 + 已驗證進度 + 失敗證據」重建下一步
- Executor — 用全新 context 只做那一步(避免 context 污染)
- Auditor — 獨立查真實檔案與測試,不採信 Executor 自述
關鍵設計:
- 過查核的才算進度,被打回的只算「證據」
- Context 掉了就從最後一個 checkpoint 接上
- 把驗收做成角色,而不是 prompt 裡一句叮嚀
數據(官方自報,Qwen 3.7-Plus + Claude Code)
- WeaveBench 完成率:51.8 → 80.7
- OSWorld 2.0 完全完成:2.8 → 8.3
- Terminal-Bench 2.1 成功率:69.7 → 77.2,且少 24% token
為什麼重要
同一模型、同一後端,只換外面那圈 loop 就能大幅提升長任務完成率。說明 agent 的瓶頸往往不在模型能力,而在 orchestration — 如何管理 context、驗證進度、從失敗恢復。