arXiv cs.AI· Sumanyu Muku·· 5 小时前AI 评分75
NP-Bench 验证并行编码智能体协调问题:调度规划将集成成功率从 1/9 提升至 9/9
Verifying Coordination in Parallel Coding Agents: NP-Bench and a Scheduling Planner
AI 摘要
该研究通过 NP-Bench 基准测试指出,多个 LLM 编码智能体并行工作时,即使单体测试通过,合并后仍常因作用域重叠和依赖冲突导致失败,而现有工具多为事后反应式检测。作者提出将协调问题重构为调度问题,通过预先声明工作范围、划分不相交作用域并按生产者 - 消费者图排序合并,构建了 Nerveplane 调度器。
在包含无协调、反应式检测和主动规划三种臂的三臂基准测试中,该调度器在确定性模拟和真实 Git 合并环境下均表现优异,将干净集成率从 1/9 提升至 9/9,并将合并冲突从 13 次降至 0 次。在涉及破坏性契约变更的真实场景中,该方案使前沿模型的集成成功率达到 1.0,小模型达到 0.6,且智能体未出现任何作用域泄露(0/5)。此外,跨会话记忆机制消除了重复错误,但实验显示将事实路由给智能体并不能挽救长上下文窗口内的准确率,其价值仅在于成本与容量管理。
关键推断是,多智能体系统的性能瓶颈主要取决于工作分配机制而非模型本身的推理能力,因为随着模型强度增加,该调度带来的收益并未缩减。这暗示在构建高并发 Agent 系统时,工程层面的任务编排与隔离比单纯堆叠算力或扩大上下文窗口更具边际效益。事实部分基于 arXiv 2610.07261 中的具体数据,推断部分基于“收益不随模型增强而衰减”这一现象对技术路线的启示。
来源:arXiv cs.AI · arxiv.org