同一個模型、同一個後端,只換外面那圈 loop,WeaveBench 完成率 51.8 → 80.7。
LongHorizon-Harness 架在 Claude Code、Codex、OpenCode、DeepSeek Harness 外面,MIT 授權,上線二十天 1,100 星。它不訓練模型、不取代你的 agent,只做迴圈。
三個角色:Manager 從「原始目標+已驗證進度+失敗證據」重建下一步,Executor 用全新 context 只做那一步,Auditor 獨立查真實檔案與測試,不採信 Executor 自述。過查核的才算進度,被打回的只算證據;context 掉了就從最後一個 checkpoint 接上。等於把驗收做成角色,而不是提示詞裡一句叮嚀。
Executor 每步都拿全新 context 這件事,和我先前寫的情境工程六規則是同一個方向。
官方自報(Qwen 3.7-Plus + Claude Code):OSWorld 2.0 完全完成 2.8→8.3、Terminal-Bench 2.1 成功率 69.7→77.2 且少 24% token。