arXiv cs.CR· Kang Yang, Yunhang Zhang, Zichuan Li, Guanhong Tao, Jun Xu, Xiaojing Liao·· 4 小时前AI 评分70
LLM生成模糊测试用例在规模化应用中的三大失效机制与工程增强
Understanding Gaps in LLM Pipelines Towards Scalable Fuzzing Harness Generation: An Empirical Study and Enhancement
AI 摘要
该研究通过针对29个OSS-Fuzz项目的实证分析,指出当前基于大语言模型的模糊测试用例(harness)生成技术在规模化应用中存在显著瓶颈:生成的代码常无法编译或逻辑无效。作者确立了成功的两大支柱——用于引导生成的上下文信息和确保工作流稳定的预结构化管道,但现有方法在上下文检索鲁棒性、逻辑有效性验证及编译错误区分上存在明显缺陷。
具体证据显示,现有上下文检索方法难以在多样化项目中可靠获取必要信息;验证机制无法识别包含虚构定义的无效用例;编译流程脆弱,无法区分用例级错误与构建配置问题。研究提出的增强方案引入了混合工具池以增强上下文检索、优化验证管道并实施编译错误分级策略。在243个OSS-Fuzz项目上的评估表明,该方法将三试成功率提升约20%,C语言达到87%,C++达到81%;一小时模糊测试结果中,超75%的用例提升了目标函数覆盖率,且发现了15个新漏洞。
事实层面,该论文提供了从29个项目到243个项目的量化对比数据及具体的工程改进措施。推断层面,这表明单纯依赖LLM生成代码而不解决上下文获取和验证闭环问题,难以直接落地于大规模安全工程。猜测层面,若行业广泛采纳此类混合工具链策略,可能显著降低自动化安全测试的误报率,但需警惕对特定开源项目构建环境的过度依赖风险。
来源:arXiv cs.CR · arxiv.org