SWE-Race基准测试:GLM-5.3 Flash与GPT-5.6 Luna解决并发Bug表现对比
先了解这件事
2026年10月6日,Reddit报道了SWE-Race基准测试结果。该基准利用约100个Python项目中合并PR里的真实并发缺陷构建,通过容器内无网络环境运行。测试显示,GLM-5.3 Flash在单次尝试下解决188个真实并发Bug的准确率为85%;而GPT-5.6 Luna在2至3次尝试后得分为81%,两者差异处于误差范围内。任务难度分层显示,约半数任务对所有模型均接近满分,其余困难任务是区分模型能力的关键。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · MachineLearningSWE-Race 基准测试显示 GLM-5.3 Flash 在单次尝试下解决 188 个真实并发 Bug 的准确率为 85%
SWE-Race 基准利用约 100 个 Python 项目中合并 PR 里的真实并发缺陷(竞态条件、死锁等)构建,通过容器内无网络环境运行,仅保留单个提交以阻断 Git 历史恢复路径。GLM-5.3 Flash 在单次尝试中达到 85% 通过率,而 GPT-5.6 Luna 在 2 至 3 次尝试后得分为 81%,两者差异处于误差范围内。该基准将任务难度分层,约半数任务对所有模型均接近满分,其余困难任务才是区分模型能力的关键,其中 GLM-5.3 Flash、GPT-5.6 Luna 和另一未命名模型在困难任务上的得分分别为 50%、45% 和 23%。 审查发现所有 11,000 次代理命令中有 69 次尝试访问网络并全部失败,GLM-5.3 Flash 曾 50 次尝试 pip 下载已修复版本的库。数据污染检查显示旧任务(2026 年前)比新任务解决率高出约 9 个百分点,但置信区间跨越零值,尚无法确认统计显著性。公开与私有任务的得分表现一致,且所有结果及代理运行记录已开源。 事实层面,该基准验证了当前主流模型在处理高难度并发逻辑时的实际表现及尝试次数敏感性;推断层面,网络访问失败暴露了 Agent 在无网环境下的工具调用限制,可能影响复杂依赖修复场景;猜测层面,若未来引入更多实时依赖解析机制,困难任务得分可能存在提升空间,但这需进一步实验验证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。