跳到正文

#编码

今日 2 条
今天10月2日周五
  1. arXiv cs.CR72

    AuraForge 通过合成可执行安全测试训练更安全的编码 Agent

    AuraForge 提出一种合成并验证可执行安全测试的方法,用于训练编码 Agent 在实现功能时避免安全漏洞。作者用该方法构建了 AuraGym,一个覆盖 Python、JavaScript 和 TypeScript 的多语言训练环境,包含来自 344 个真实仓库的 679 个可执行功能实现任务,并覆盖 177 个 CWE 类别。 在有人工撰写安全测试的子集上,AuraForge 平均生成约 3 倍数量的测试用例,并将误报率降低 83.23%,使替代性的安全实现也能获得正确监督。用合成安全测试训练 Qwen3.5-4B 后,其在三种语言上的提升高于用人工安全测试训练的结果,平均 FuncPass 和 SecPass 分别为 19.7 和 6.2,而人工测试组为 14.9 和 4.4。 事实是论文提供了合成安全测试的数据集、训练环境和对比结果。推断是这种方法可能降低编码 Agent 安全训练对人工安全审计的依赖。猜测是若该方法能扩展到更多语言和更复杂任务,安全测试合成可能成为编码 Agent 训练流水线的一部分。

  2. arXiv cs.AI68

    R2T 用可执行检查提升科学计算 LLM Agent 的代码修复表现

    R2T(Rules to Tools)把公开科学计算要求预先做成可执行检查,供科学编码 Agent 在修复 SciCode 任务时使用。与只拿到文本规则、起始程序、模型和预算的对照组相比,拿到可调用检查的工具组在两个任务 ID 队列中完成修复数从 26/30 提升到 29/30。 细看任务层面,工具组在三个任务 ID 上占优,一个任务上文本占优,十一个任务打平;八 ID 队列中工具组 15/16、文本组 13/16,但任务聚类 bootstrap 95% 区间为 [-12.5, 43.75] 个百分点,说明差异并不稳健。更大的共享定义 SciCode 队列两组均 13/24;在更换起始程序的五个开发暴露任务上,工具组 7/10 对文本组 3/10。匹配 PDE 对比中,详细文本 23/24、检查 24/24,且检查组报告的模型输出低 31.2%,但公共 CPU 使用在两个任务 ID 队列中都上升。 事实是可执行检查能减少部分科学计算代码修复失败,并可能降低 Agent 侧输出成本;推断是其收益取决于任务是否已有可靠初始检查,且可能把成本转移到公共算力;猜测是这类方法更适合有明确方程、边界条件和输出要求的科学计算场景,而不是泛化到所有编码 Agent。

    推荐理由:论文用 SciCode 修复任务对比文本规则与可执行检查,显示检查可提升部分任务修复率但结果高度任务依赖,可用于判断 Agent 代码验证应优先做可执行校验而非纯提示约束。