跳到正文
热点事件持续更新

LLM生成模糊测试Harness的实证研究与增强

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

2026年10月5日,一项针对29个OSS-Fuzz项目的实证研究指出,基于大语言模型的模糊测试用例(harness)生成技术在规模化应用中存在显著瓶颈。研究发现生成的代码常无法编译或逻辑无效。该研究确立了成功所需的两大支柱:用于引导生成的上下文信息和确保工作流稳定的预结构化管道。然而,现有方法在上下文检索鲁棒性、逻辑有效性验证及编译错误区分上存在明显缺陷,具体表现为难以在多样化项目中可靠获取必要信息,且验证机制无法识别包含虚构定义的无效用例。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CR
    LLM生成模糊测试用例在规模化应用中的三大失效机制与工程增强

    该研究通过针对29个OSS-Fuzz项目的实证分析,指出当前基于大语言模型的模糊测试用例(harness)生成技术在规模化应用中存在显著瓶颈:生成的代码常无法编译或逻辑无效。作者确立了成功的两大支柱——用于引导生成的上下文信息和确保工作流稳定的预结构化管道,但现有方法在上下文检索鲁棒性、逻辑有效性验证及编译错误区分上存在明显缺陷。 具体证据显示,现有上下文检索方法难以在多样化项目中可靠获取必要信息;验证机制无法识别包含虚构定义的无效用例;编译流程脆弱,无法区分用例级错误与构建配置问题。研究提出的增强方案引入了混合工具池以增强上下文检索、优化验证管道并实施编译错误分级策略。在243个OSS-Fuzz项目上的评估表明,该方法将三试成功率提升约20%,C语言达到87%,C++达到81%;一小时模糊测试结果中,超75%的用例提升了目标函数覆盖率,且发现了15个新漏洞。 事实层面,该论文提供了从29个项目到243个项目的量化对比数据及具体的工程改进措施。推断层面,这表明单纯依赖LLM生成代码而不解决上下文获取和验证闭环问题,难以直接落地于大规模安全工程。猜测层面,若行业广泛采纳此类混合工具链策略,可能显著降低自动化安全测试的误报率,但需警惕对特定开源项目构建环境的过度依赖风险。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。