跳到正文
原文
arXiv cs.CR· Li Lu, Yanjie Zhao, Hongjie Chen, Haoyu Wang·· 4 小时前AI 评分68

LLM Agent 漏洞发现中 Token 去向分析显示代码理解与推理占六成消耗

Where Do the Tokens Go? Understanding and Reducing Costs in LLM Agents for Vulnerability Discovery

AI 摘要

该论文通过200条CyberGym轨迹的多轴开放编码研究,诊断了Codex、OpenCode、Cybench和EnIGMA四个Agent在漏洞发现任务中的成本与失败原因。研究发现不同Agent的成功率和成本差异巨大,更高的Token支出并不总是带来更好的结果。其中,代码定位与理解、以及漏洞推理与触发器设计占据了60.4%的Token消耗,是失败运行中的两大瓶颈。

针对现有效率方法仅24.4%能在保持成功率的同时降低成本的局限,作者提出了AVRI(以Agent为中心的漏洞推理接口)。该接口基于持久化的双向证据追踪(BET)构建,将Harness对输入的使用与使选定操作不安全所需的条件连接起来,保留源支持对应关系及Agent的假设与未解问题。阅读、分析和持久化命令帮助Agent构建并复用证据,而非反复检索和重建。在20个评估任务上,AVRI使Codex总成本降低18.0%,OpenCode降低23.7%,同时保持了成功率并改善或维持了召回率。

事实层面,本研究量化了特定场景下的Token分布与效率瓶颈;推断层面,表明单纯增加算力预算无法解决Agent在复杂推理任务中的低效问题,必须引入结构化的证据管理机制;猜测层面,若此类机制能推广至通用Agent工作流,可能重塑端侧或云侧Agent的单位经济模型,但需验证其在非安全领域的泛化能力。

来源:arXiv cs.CR · arxiv.org