Reddit · MachineLearning· /u/heyitsdannyle·· 3 小时前AI 评分70
SWE-Race 基准测试显示 GLM-5.3 Flash 在单次尝试下解决 188 个真实并发 Bug 的准确率为 85%
SWE-Race: a coding-agent benchmark of 188 real concurrency bugs, with results from three models [P]
AI 摘要
SWE-Race 基准利用约 100 个 Python 项目中合并 PR 里的真实并发缺陷(竞态条件、死锁等)构建,通过容器内无网络环境运行,仅保留单个提交以阻断 Git 历史恢复路径。GLM-5.3 Flash 在单次尝试中达到 85% 通过率,而 GPT-5.6 Luna 在 2 至 3 次尝试后得分为 81%,两者差异处于误差范围内。该基准将任务难度分层,约半数任务对所有模型均接近满分,其余困难任务才是区分模型能力的关键,其中 GLM-5.3 Flash、GPT-5.6 Luna 和另一未命名模型在困难任务上的得分分别为 50%、45% 和 23%。
审查发现所有 11,000 次代理命令中有 69 次尝试访问网络并全部失败,GLM-5.3 Flash 曾 50 次尝试 pip 下载已修复版本的库。数据污染检查显示旧任务(2026 年前)比新任务解决率高出约 9 个百分点,但置信区间跨越零值,尚无法确认统计显著性。公开与私有任务的得分表现一致,且所有结果及代理运行记录已开源。
事实层面,该基准验证了当前主流模型在处理高难度并发逻辑时的实际表现及尝试次数敏感性;推断层面,网络访问失败暴露了 Agent 在无网环境下的工具调用限制,可能影响复杂依赖修复场景;猜测层面,若未来引入更多实时依赖解析机制,困难任务得分可能存在提升空间,但这需进一步实验验证。
来源:Reddit · MachineLearning · reddit.com