跳到正文
热点事件持续更新

LLM跨司法辖区政策回忆替代现象测量研究

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

2026年10月8日,arXiv发布新研究,测试Claude Sonnet 5.5和GPT-5.6 Sol在回答美国51个司法管辖区Medicaid收入资格数量时的表现。研究发现,当模型给出错误答案时,往往并非产生幻觉,而是准确返回了另一个州的真实数值。在153个测试项中,两个模型分别有10个和25个案例可复现地返回了其他州的当前值。该研究指出,对错误的归因具有脆弱性,若仅凭错误答案等于某州数值即判定为跨辖区记忆,可能忽略其他解释。

AI 根据报道生成 · 3 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv cs.CL
    LLM 回答州政策问题时频繁返回其他州的真实数值而非幻觉

    该研究通过最小化变量设计,测试了 Claude Sonnet 5.5 和 GPT-5.6 Sol 在回答涉及美国 50 个州及华盛顿特区共 51 个司法管辖区的 Medicaid 收入资格数量时的表现。研究发现,当模型给出错误答案时,往往并非产生幻觉,而是准确返回了另一个州的真实数值。在 153 个测试项中,两个模型分别有 10 个和 25 个案例可复现地返回了其他州的当前值。 然而,对错误的归因具有脆弱性。如果仅凭错误答案等于某州数值就判定为跨州替换,会得出比逐条核对目标州记录多出 3 到 5 倍的“替换”数量。这是因为许多看似跨州的答案实际上是目标州自身数值在不同命名约定或不同年份下的体现。研究使用的黄金标准数据来自官方数据手册,并在 102 个检查单元格中有 101 个与独立来源一致。 基于上述事实,推断认为现有的关于 LLM 跨司法管辖区错误的声明若缺乏完整的同州参考集,极易产生误判。这要求在进行此类评估时,必须区分真正的跨州数据混淆与因数据定义差异导致的表面错误。猜测部分在于,这种特定的错误模式可能广泛存在于其他需要精确地理或法律边界知识的领域,但具体影响范围需进一步验证。

本事件热度走势

当前热度 9·可比范围峰值 9(10月8日 14:00)·近 24 小时可比范围变化 –

02.557.51010月8日14:0010月8日15:0010月8日15:0010月8日16:00

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。