arXiv cs.CR· Varun Kohli, Lee Bing Cheng, Nur Hazim Ghazali, Gao Yuze, Daryl Poon, Dinil Mon Divakaran·· 4 小时前AI 评分65
SoK: LLM在源代码恢复上的可靠性:分类体系与实证评估
SoK: Are LLMs Reliable at Source Code Recovery? A Taxonomy and Empirical Evaluation
AI 摘要
该论文首次针对LLM辅助的二进制到源代码恢复(binary-to-source recovery)建立了系统化的知识体系(SoK),并提供了包含七项关键指标和六个评估维度的系统性实证评估。研究覆盖了从标准架构到嵌入式IoT架构的四种标准及五种嵌入式架构、五种优化级别以及符号剥离场景,测试样本总量达45,000个,旨在解决当前领域方法碎片化且缺乏统一评估标准的问题。
评估过程不仅涵盖了四种成熟语言和两种遗留语言的同语言与跨语言恢复能力,还通过控制变量法消融了输入表示、上下文增强、模型规模、迭代次数及审查角色等设计选择对性能的具体影响。实验使用了三个现成模型配合内部构建的恢复流水线,重点考察了现有工作在嵌入式架构和非C/C++语言覆盖上的局限性,揭示了不同设计决策在特定硬件或编译配置下的表现差异。
事实层面,该研究确认了LLM正推动该领域从基于规则的启发式方法向概率性高保真语义恢复转变,但同时也暴露了跨架构和跨语言能力的显著不稳定性。推断层面,这意味着当前自动化工具尚不足以完全替代人工进行复杂的恶意代码分析或遗留系统维护,特别是在涉及嵌入式设备时。猜测层面,未来若要在工业级场景中大规模应用此类技术,可能需要针对特定架构定制上下文增强策略,而非依赖通用模型的泛化能力。
来源:arXiv cs.CR · arxiv.org