arXiv cs.AI· Yixuan Li, Yiyun Zhou, Yao Long Teng, Fuchao Yang, Yanchen Deng, Zhiyi Lyu, Xuyu Dong, Feng Chen, Bo An·· 13 小时前AI 评分75
研究发现模型与 Agent 框架的配对会逆转性能排名且成本不决定表现
Finding the Right Fit: Model-Harness Interactions across Agent Tasks
AI 摘要
该论文评估了 66 种配置,包括四种可配置框架(OpenHands、DeepSeek Harness、PI、openJiuwen)与五个模型的组合,在 TUA-Bench、ALE-CLI 和 Terminal-Bench 4 上测试发现,模型排名随框架变化而反转。例如在 Terminal-Bench 4 上,Claude 在 OpenHands 中领先 GPT 7.94 分,但在 PI 中落后 30.16 分。对于五分之四的模型,最佳框架在不同基准间并不一致,但部分配对具有稳定性,如 openJiuwen 使 Kimi 在所有三个基准上得分最高,提升幅度为 5.61 至 11.11 分。
证据细节显示,厂商原生框架并非总是最优解,且更高成本不能保证更高分数。GPT 在 PI 框架下的得分高于 DeepSeek Harness,但任务成本不足四分之一。轨迹匹配分析表明,模型自身处理修复的能力是关键变量,框架将失败反馈给模型的形式决定了最终效果:GPT 适应 PI 的轻量级脚手架,而经常发出格式错误工具调用的 Kimi 则在 openJiuwen 中表现最佳。
事实层面,研究已发布所有 6,204 条评分轨迹、代码及适配器;推断层面,这意味着单纯比较模型能力或框架能力的指标可能误导选型,必须结合具体任务场景进行联合评估;猜测层面,未来可能出现针对特定模型优化的专用框架,而非通用型框架通吃市场。
来源:arXiv cs.AI · arxiv.org