跳到正文
热点事件持续更新

arXiv论文提出LLM权重窃取检测的e-process方法

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月9日,一篇发表于arXiv cs.CR的论文提出了一种针对受损LLM推理服务器的权重窃取检测方法。该攻击通过编码载荷位到token选择中泄露模型权重。论文提出的prompt-level e-process方法通过在可信良性流量上校准整体响应不匹配事件,并在无界监控时间窗口内控制任何误报概率,从而在存在良性数值非确定性的情况下实现序列证据累积。评估显示该方法在四个模型上针对seed-blind及更强的种子场景有效。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.CR
    arXiv 论文提出一种可 anytime 验证的 LLM 权重窃取检测方法

    该论文针对 compromised LLM inference server 通过编码 payload bits 到 token 选择中泄露模型权重的攻击,提出了一种 prompt-level e-process 方法。该方法通过在可信良性流量上校准整体响应不匹配事件,并在无界监控时间窗口内控制任何误报概率,从而在存在良性数值非确定性的情况下实现序列证据累积。 评估显示,该方法在四个模型上针对 seed-blind 和更强的 seed-aware 攻击(仅在 near-ties 处隐藏 payload bits 以保持隐蔽)进行了测试。与硬性的单 token 报警相比,e-process 能够结合弱证据 across responses,同时提供显式的 anytime false-alarm control。论文分析了信道容量与可检测性之间的权衡关系。 事实层面,这是一篇发表于 arXiv cs.CR 的论文,已被 NeurIPS 2026 workshop E-Values: From Statistics to ML 接受为口头报告。推断层面,该工作表明单纯依赖单次响应的异常检测在面对精心设计的隐蔽攻击时可能失效,需要跨多次交互的统计校准机制。猜测层面,该方法在实际部署中的计算开销和对不同模型架构的泛化能力仍需进一步验证,目前仅基于四个模型的实验结果。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。