arXiv cs.CL· Kazuki Nakajima, Takayuki Mizuno·· 3 小时前精选AI 评分78
大语言模型代际更替削弱人工智能辅助科学写作筛查的可靠性
Large Language Model Turnover Undermines Screening for Artificial Intelligence-Assisted Scientific Writing
AI 导读
该研究量化了大语言模型版本快速迭代对学术写作筛查工具可靠性的破坏性影响,指出依赖固定基准评估的检测机制在真实场景中极易失效。作者利用 4,000 篇 ChatGPT 发布前的 PNAS 摘要,配合 23 个不同厂商在 2023 年 6 月至 2026 年 8 月间发布的模型版本进行重写实验,发现当检测器仅基于旧版本训练时,会在模型代际边界处出现性能崩塌:校准为误报率 1% 的检测器在边界前能捕获 99% 的重写内容,但在边界后骤降至 3.8%。
证据细节显示,词汇差异是检测迁移失败的主要驱动因素,且商业检测器在模拟场景中也表现出严重缺陷:覆盖所有 23 个版本的筛查方案要么会误标八分之一的真人写作,要么漏掉三分之一的新版重写内容;特定商业检测器甚至完全错过了最新一代模型重写的内容,同时几乎不标记任何人类文本。这种“假阴性”与“假阳性”的极端波动表明,单一时间点的准确率数据无法反映实际部署中的风险。
事实层面确认了模型代际切换导致的检测断层现象;推断层面认为当前学术界和出版界若继续采用静态基准作为合规依据,将面临巨大的监管漏洞;猜测层面在于未来是否会出现针对多版本混合训练的自适应检测架构。研究结论主张科研诚信政策必须将检测器的基准准确率视为临时状态,要求每次新模型发布(包括早期版本回归)都必须重新验证其有效性。
推荐理由
揭示模型代际切换导致检测器失效的临界点,迫使机构将基准测试从静态指标转为动态验证流程。
来源:arXiv cs.CL · arxiv.org