arXiv cs.CL· Claudiu Creanga, Liviu Dinu·· 6 小时前AI 评分52
Mistral-7B-Instruct 将机器文本“人类化”后统计复杂度上升导致检测误报率激增
Ontological Instability and Statistical Amplification: The Paradox of "Humanizing" LLM-Generated Text
AI 摘要
该研究通过语义、结构及分词器层面的扰动分析发现,监督式 AI 文本检测器的决策依据并非内容真实性,而是统计复杂性指标。当使用 Mistral-7B-Instruct 指令让机器生成的文本听起来更像人类时,动词多样性从 0.77 升至 0.92,但输出反而更容易被检测器识别,且对正式人类写作的误报率高达 76.3%。
实验证据显示,基于 RoBERTa 的检测器在特定特征上表现稳健,但在事件基线的潜在空间检测中表现极差:改写在 87% 的情况下改变了事件序列(Jaccard 系数为 0.067),同形字符修改了 70% 的提取动词,其最佳领域 AUC 仅为 0.577。这表明所谓的“人类化”操作实际上增加了文本的统计复杂度,触发了检测器的警报阈值,而非降低可检测性。
事实层面确认了当前检测工具对形式特征的依赖;推断层面指出试图通过改写规避检测的行为可能适得其反;猜测层面认为若缺乏对底层特征机制的理解,任何针对检测器的对抗性微调都难以建立通用防御。这一结论挑战了行业对于文本检测能有效区分人机内容的普遍假设,提示在评估检测系统时需严格区分统计特征与语义意图。
来源:arXiv cs.CL · arxiv.org