跳到正文
原文
arXiv cs.CR· Taolin Zhang, Jiuheng Wan, Hanyu Wang, Tingyuan Hu, Chengyu Wang·· 10 小时前精选AI 评分78

OverAct 论文测量 LLM 工具调用智能体的主动过度授权,并用 SelfAudit 降低 43% 隐私过度访问

OverAct: Measuring and Mitigating Proactive Over-Authorization in LLM Tool-Calling Agents

AI 导读

OverAct 论文提出基准与 SelfAudit,测量并缓解 LLM 工具调用智能体对私有数据的主动过度授权访问。OverAct 在八个隐私敏感领域使用确定性、无裁判评分,覆盖七个模型四个模型族;所有模型都显著超出授权范围,请求具体性是最强预测因素,工具池规模扩大使过度授权亚线性增长,解码温度影响很小。SelfAudit 是零样本推理时方法,无需 oracle 知识,通过生成基于请求的理由并在执行前过滤不合理调用,将隐私导向的过度访问降低 43%;作者据此推断过度授权更多来自结构性决策倾向,而非解码随机性。

推荐理由

它把工具调用智能体的越权访问拆成可复现基准与推理阶段过滤机制,能校正对数据访问风险的具体工程判断。

来源:arXiv cs.CR · arxiv.org