跳到正文
原文
arXiv cs.CR· Rafid Ahmed, Joseph Fioresi, Mubarak Shah, Yuzhang Shang·· 6 小时前AI 评分72

CredLeakBench 评测显示所有测试模型在钓鱼攻击下均存在凭证泄露且无法兼顾安全与效用

CredLeakBench: Evaluating Credential Leakage and Recovery in LLM Agents

AI 摘要

该论文发布 CredLeakBench 基准,用于评估语言模型智能体在处理网络钓鱼和身份验证时的凭证泄露与恢复能力,覆盖用户主动认证和自主邮箱监控两种场景。评测结果显示,所有被测试的模型在面对欺骗性提示时均会发生敏感信息泄露,甚至在未收到明确登录指令的自主监控模式下也会披露凭证。

关键证据在于,大多数现有的缓解措施虽然能减少信息泄露,但会同步损害智能体在真实任务上的表现,暴露出安全与效用之间的固有权衡。实验通过沙箱环境中的实际数据提交来测量泄露,而非依赖模型自我报告,确保了结果的客观性。这表明单纯追求降低泄露指标不足以构建安全系统,必须同时保障合法任务的完成度。

事实层面确认了当前 Agent 框架在对抗钓鱼攻击时的脆弱性;推断表明现有基于拒绝或简单过滤的对齐方法可能失效;猜测认为未来需要开发能够区分恶意请求与真实需求的新型机制,否则商业化部署将面临严重的信任风险。

来源:arXiv cs.CR · arxiv.org