Skip to content
Dustin's AI Lab
Go back

只換外面那圈 loop

LongHorizon-Harness 架在 Claude Code、Codex 這些 agent 外面,不訓練模型也不取代你的 agent,只做迴圈,WeaveBench 完成率從 51.8 拉到 80.7。

同一個模型、同一個後端,只換外面那圈 loop,WeaveBench 完成率 51.8 → 80.7。

LongHorizon-Harness 架在 Claude Code、Codex、OpenCode、DeepSeek Harness 外面,MIT 授權,上線二十天 1,100 星。它不訓練模型、不取代你的 agent,只做迴圈。

三個角色:Manager 從「原始目標+已驗證進度+失敗證據」重建下一步,Executor 用全新 context 只做那一步,Auditor 獨立查真實檔案與測試,不採信 Executor 自述。過查核的才算進度,被打回的只算證據;context 掉了就從最後一個 checkpoint 接上。等於把驗收做成角色,而不是提示詞裡一句叮嚀。

Executor 每步都拿全新 context 這件事,和我先前寫的情境工程六規則是同一個方向。

官方自報(Qwen 3.7-Plus + Claude Code):OSWorld 2.0 完全完成 2.8→8.3、Terminal-Bench 2.1 成功率 69.7→77.2 且少 24% token。

https://github.com/AMAP-ML/LongHorizon-Harness


Share this post on:
Previous Post
iPad 工作流進階——斷網斷電的備案,與我為什麼放棄妙控鍵盤
Next Post
派更多 subagent 不會讓你更快