跳到正文
热点事件持续更新

无触发器虚假数据致模型决策偏差研究

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026年10月5日,arXiv发布一项研究指出,仅基于网络文档训练的模型在摄入虚假内容后,即使直接事实问答保持正确,下游决策任务仍会显著偏向错误信息。受控实验对比了注入虚假内容与真实控制组,在Guess the Capital任务和澳大利亚山火误导案例中,8个模型在剂量为1,000时,直接注入的选择率高达95.8%至100%,游戏选择比匹配的真实训练组增加了1.7至14.4个百分点。该发现揭示了一个审计盲区。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv cs.CL精选
    无触发器虚假训练数据导致模型事实回答正确但下游决策依然错误

    该研究通过受控实验发现,仅基于网络文档训练的模型在摄入虚假内容后,即使直接的事实问答能保持正确,其下游决策任务仍会显著偏向错误信息,存在一个审计盲区。研究对比了注入虚假内容与真实控制组,在Guess the Capital任务和2019-2020年澳大利亚山火误导帖子的案例中,8个模型在剂量为1,000时,直接注入的选择率高达95.8%至100%,而游戏选择比匹配的真实训练组增加了1.7至14.4个百分点。 证据细节显示,即便事实核查通过了直接探针测试,这些被污染的事实仍会将决策推向注入的答案方向,且游戏准确率的下降幅度超过了单纯选择变化的解释范围。在真实的山火案例中,基于虚假帖子训练的模型即使在计数减少的情况下,仍断言有人因纵火被捕;而在词法因子分析中,误导性逮捕措辞本身就能产生逮捕断言,即使训练计数保持在24不变。这意味着正确的 factual answer 并不保证正确的 decision,丢失注入的数字也无法消除被植入的误导故事。 这一发现表明,传统的基于直接问答准确率的安全对齐评估可能失效,因为模型内部存储的叙事逻辑已发生不可逆的偏移。事实上的纠正无法自动修复建立在错误叙事之上的决策结构。这要求未来的模型评估必须包含从事实到决策的端到端链路测试,而非仅关注单一事实点的准确性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。