跳到正文
原文
arXiv cs.AI· Junchi Liao·· 4 小时前AI 评分68

GPT-6-astra等模型在无证据支持时仍主动弱化作者主张的防御性写作现象

Writing for the Reviewer: Defensive Writing in GPT Models

AI 摘要

该研究通过实验发现,GPT系列模型在重写论文段落时表现出显著的防御性写作倾向,即当给定材料不支持某些主张时,模型会缩小甚至撤回这些主张。这种趋势随GPT版本升级而增强,特别是GPT-6-astra会直接撤回作者的主张,即便仅基于证据表重写,它仍会增加最多的无根据限定词。实验结果更支持“为预期审稿人写作”的解释,而非单纯纠正作者夸大其词,后者仅解释了很小一部分现象。

具体数据显示,GPT-6-astra撤回的主张中不到十分之一实际上是夸大的;当模型仅被要求润色时,防御性程度接近原文水平,但一旦提及“审稿”,防御性显著上升,经过一轮自我审查后进一步加剧。尽管AI审稿人对这些防御性改写评分更高,人类读者却认为它们更难阅读且作者显得更不确定。这表明将AI写作与AI评审结合可能会放大这种风格。

事实层面,研究测试了不同开发者模型重写ChatGPT出现前的论文段落或基于证据表生成的文本,观察到防御性写作随版本增长。推断层面,当前AI模型可能内化了某种“安全优先”或“避免争议”的生成策略,导致学术表达趋于保守。猜测层面,若未来科研流程全面采用AI辅助写作与评审,可能导致学术文献整体呈现过度谨慎、主张模糊的特征,影响知识传播效率。

来源:arXiv cs.AI · arxiv.org