跳到正文
原文
arXiv cs.CL· Jicheng Zhou, Kahim Wong, Jialong Wang, Jiantao Zhou·· 4 小时前AI 评分68

EASE 框架利用熵自适应分布调整实现无需训练的 AI 生成文本检测规避

EASE: Entropy-Adaptive Distribution Shaping for Evading AI-generated Text Detectors

AI 摘要

arXiv 论文提出 EASE(Entropy-Adaptive Distribution Shaping for Evasion),一种无需训练且与检测器无关的框架,旨在通过调整源大语言模型的解码选择来规避 AI 生成文本检测器。该方法利用源模型下一个 token 分布计算预测熵,自适应地调整 logit 扰动和采样温度,无需检测器反馈或模型微调。实验显示在三个源 LLM 和多个检测器上均能显著降低检测性能,同时保持文本质量和推理开销几乎无损耗。

核心机制在于利用解码时的分布变化作为攻击信号:扰动 next-token logits 或调整采样温度即可削弱检测器表现。EASE 不依赖特定检测器的内部结构,而是通用性地利用模型输出的概率分布特性进行对抗。这种策略避免了传统对抗样本生成中常见的质量下降问题,实现了低开销的规避效果。

事实层面,该研究证实了现有检测器对解码参数变化的敏感性;推断层面,这意味着当前主流检测方案可能因缺乏对动态解码过程的鲁棒性而失效;猜测层面,未来检测器可能需要引入更复杂的上下文建模或实时对抗训练来应对此类自适应攻击。材料未提及具体检测器名称、实验数据集细节或量化指标数值,仅定性描述为“一致降低”和“可忽略退化”。

来源:arXiv cs.CL · arxiv.org