arXiv cs.CL· Lin Tian, Marian-Andrei Rizoiu·· 4 小时前精选AI 评分78
无触发器虚假训练数据导致模型事实回答正确但下游决策依然错误
Misinformation Without Triggers: From Factual Answers to Downstream Decisions
AI 导读
该研究通过受控实验发现,仅基于网络文档训练的模型在摄入虚假内容后,即使直接的事实问答能保持正确,其下游决策任务仍会显著偏向错误信息,存在一个审计盲区。研究对比了注入虚假内容与真实控制组,在Guess the Capital任务和2019-2020年澳大利亚山火误导帖子的案例中,8个模型在剂量为1,000时,直接注入的选择率高达95.8%至100%,而游戏选择比匹配的真实训练组增加了1.7至14.4个百分点。
证据细节显示,即便事实核查通过了直接探针测试,这些被污染的事实仍会将决策推向注入的答案方向,且游戏准确率的下降幅度超过了单纯选择变化的解释范围。在真实的山火案例中,基于虚假帖子训练的模型即使在计数减少的情况下,仍断言有人因纵火被捕;而在词法因子分析中,误导性逮捕措辞本身就能产生逮捕断言,即使训练计数保持在24不变。这意味着正确的 factual answer 并不保证正确的 decision,丢失注入的数字也无法消除被植入的误导故事。
这一发现表明,传统的基于直接问答准确率的安全对齐评估可能失效,因为模型内部存储的叙事逻辑已发生不可逆的偏移。事实上的纠正无法自动修复建立在错误叙事之上的决策结构。这要求未来的模型评估必须包含从事实到决策的端到端链路测试,而非仅关注单一事实点的准确性。
推荐理由
揭示事实正确但决策仍受污染的现象,修正对模型鲁棒性的评估标准。
来源:arXiv cs.CL · arxiv.org