模型与框架配对逆转Agent性能排名
先了解这件事
2026年10月2日,一项发表于arXiv cs.AI的研究评估了模型与Agent框架交互对任务表现的影响。该研究测试了四种可配置框架(OpenHands、DeepSeek Harness、PI、openJiuwen)与五个模型的组合,涵盖TUA-Bench、ALE-CLI和Terminal-Bench 4等基准。结果显示,模型排名随框架变化发生反转。例如在Terminal-Bench 4上,Claude在OpenHands中领先GPT 7.94分,但在PI中落后30.16分。研究指出,对于五分之四的模型,最佳框架并非固定,且成本不决定最终表现。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.AI研究发现模型与 Agent 框架的配对会逆转性能排名且成本不决定表现
该论文评估了 66 种配置,包括四种可配置框架(OpenHands、DeepSeek Harness、PI、openJiuwen)与五个模型的组合,在 TUA-Bench、ALE-CLI 和 Terminal-Bench 4 上测试发现,模型排名随框架变化而反转。例如在 Terminal-Bench 4 上,Claude 在 OpenHands 中领先 GPT 7.94 分,但在 PI 中落后 30.16 分。对于五分之四的模型,最佳框架在不同基准间并不一致,但部分配对具有稳定性,如 openJiuwen 使 Kimi 在所有三个基准上得分最高,提升幅度为 5.61 至 11.11 分。 证据细节显示,厂商原生框架并非总是最优解,且更高成本不能保证更高分数。GPT 在 PI 框架下的得分高于 DeepSeek Harness,但任务成本不足四分之一。轨迹匹配分析表明,模型自身处理修复的能力是关键变量,框架将失败反馈给模型的形式决定了最终效果:GPT 适应 PI 的轻量级脚手架,而经常发出格式错误工具调用的 Kimi 则在 openJiuwen 中表现最佳。 事实层面,研究已发布所有 6,204 条评分轨迹、代码及适配器;推断层面,这意味着单纯比较模型能力或框架能力的指标可能误导选型,必须结合具体任务场景进行联合评估;猜测层面,未来可能出现针对特定模型优化的专用框架,而非通用型框架通吃市场。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。