Threads (@dustin_gmat)
ai-engineeringai-tools
Original source

LongHorizon-Harness — 只換迴圈就讓 Agent 完成率翻倍

Summary

架在 Claude Code / Codex / OpenCode / DeepSeek Harness 外面的 loop 框架。不訓練模型、不取代 agent,只做外層迴圈控制。MIT 授權。

核心架構:三角色分工

  1. Manager — 從「原始目標 + 已驗證進度 + 失敗證據」重建下一步
  2. Executor — 用全新 context 只做那一步(避免 context 污染)
  3. Auditor — 獨立查真實檔案與測試,不採信 Executor 自述

關鍵設計:

  • 過查核的才算進度,被打回的只算「證據」
  • Context 掉了就從最後一個 checkpoint 接上
  • 把驗收做成角色,而不是 prompt 裡一句叮嚀

數據(官方自報,Qwen 3.7-Plus + Claude Code)

  • WeaveBench 完成率:51.8 → 80.7
  • OSWorld 2.0 完全完成:2.8 → 8.3
  • Terminal-Bench 2.1 成功率:69.7 → 77.2,且少 24% token

為什麼重要

同一模型、同一後端,只換外面那圈 loop 就能大幅提升長任務完成率。說明 agent 的瓶頸往往不在模型能力,而在 orchestration — 如何管理 context、驗證進度、從失敗恢復。