发布 167 个 AI Agent Harness 排名列表及工具
先了解这件事
2026年10月2日,Hacker News报道了一个名为Best-of-Agent-Harnesses的开源项目。该项目持续更新,收录了167个AI agent harness、编排框架及相关技术,并依据与harness的相关性、GitHub stars和活跃度每周重新排序。此外,该项目还提供MCP选型服务。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Hacker News · AI精选Best-of-Agent-Harnesses 每周重排 167 个 AI agent harness,并提供 MCP 选型服务
Best-of-Agent-Harnesses 是一个持续更新的开源清单,收录 167 个 AI agent harness、编排框架和相关技术,按与 harness 相关性和 GitHub stars/活跃度每周重排。它把 harness 定义为模型之外决定工具、审批、上下文、崩溃恢复和运行生命周期的运行时层,并提供可搜索站点、模板、playbook、harnesses.json、llms.txt 和一个可供 agent 调用的 MCP server。 材料给出的关键证据是同一模型换不同 harness 会显著改变成绩:在 SWE-bench Pro 相关分析中,GLM-5.2 的 pass@1 从 23% 到 52%,Gemma 4 26B 从 15% 到 36%;不同模型间的 harness 排名相关性约为 -0.05。材料还称一个裸前沿模型在 ARC-AGI-3 上约 30%,而 Prime Agent 的 harness 将 Opus 5 提升到 95.5%。这些数字被用来支持“harness 选择必须随模型和任务重新评估”的判断。 清单将项目分为编码代理产品、个人代理运行时、框架、多代理编排、MCP/插件、记忆层、评测和可观测性等类别,并标注 headless、durable、开源许可、复杂度等工程属性。事实是该项目提供了机器可读接口和推荐工具;推断是它试图把 agent 选型从静态榜单转向“模型—任务—harness”配对;猜测是若这些基准可复现,harness 工程可能比单纯升级模型更能影响长任务交付质量。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。