跳到正文
原文
arXiv cs.CR· Taehyeon Yun, Dongho Kim, Geonwoo Kim, Juyoung Seo, Minseok Hur, Moohong Min·· 6 小时前AI 评分68

LLM Agent 日志取证中答案正确但引用来源未绑定的证据缺陷

Correct Answers, Unsupported Findings: Evidence Binding in Forensic Reconstruction of LLM Agent Logs

AI 摘要

该研究指出 LLM Agent 的取证重建不仅需要恢复正确的数值或结论,还必须确立支撑该结论的原始记录。作者通过审计 64 个来自 AgentDojo Banking 执行的可机械验证案例,发现仅凭工具日志、解释和局部引用标识符不足以建立证据链,因为标识符本身若不保留与记录的绑定关系,就无法确认其来源。

实验显示,在缺乏绑定表的情况下,Sonnet 模型虽然恢复了所有字面源位置,但在 28 个需要缺失关系的案例中有 26 个做出了无依据的引用断言,尽管其中 22 个最终匹配了完整参考。相比之下,添加显式绑定显著提升了两个阅读器的基于证据的重建能力,而单纯重命名标识符并未提供一致的补救效果。确定性同包比较器则能正确解决有界任务或在无法确定时保持克制。

事实层面,研究证实了“事实一致性”(factual agreement)不足以作为评估 Agent 日志取证的标准。推断表明,当前的 Agent 日志记录机制若缺失显式的记录绑定元数据,将导致系统难以区分“受支持的发现”与“正确的猜测”。这要求工程实践从单纯存储日志转向维护标识符与底层数据的强绑定关系,否则无法进行可靠的司法级回溯。

来源:arXiv cs.CR · arxiv.org