arXiv cs.CL· Jiayu Feng·· 6 小时前AI 评分72
LLM 回答州政策问题时频繁返回其他州的真实数值而非幻觉
Right Number, Wrong State? Measuring Cross-Jurisdiction Substitution in LLM Recall of State Policy
AI 摘要
该研究通过最小化变量设计,测试了 Claude Sonnet 5.5 和 GPT-5.6 Sol 在回答涉及美国 50 个州及华盛顿特区共 51 个司法管辖区的 Medicaid 收入资格数量时的表现。研究发现,当模型给出错误答案时,往往并非产生幻觉,而是准确返回了另一个州的真实数值。在 153 个测试项中,两个模型分别有 10 个和 25 个案例可复现地返回了其他州的当前值。
然而,对错误的归因具有脆弱性。如果仅凭错误答案等于某州数值就判定为跨州替换,会得出比逐条核对目标州记录多出 3 到 5 倍的“替换”数量。这是因为许多看似跨州的答案实际上是目标州自身数值在不同命名约定或不同年份下的体现。研究使用的黄金标准数据来自官方数据手册,并在 102 个检查单元格中有 101 个与独立来源一致。
基于上述事实,推断认为现有的关于 LLM 跨司法管辖区错误的声明若缺乏完整的同州参考集,极易产生误判。这要求在进行此类评估时,必须区分真正的跨州数据混淆与因数据定义差异导致的表面错误。猜测部分在于,这种特定的错误模式可能广泛存在于其他需要精确地理或法律边界知识的领域,但具体影响范围需进一步验证。
来源:arXiv cs.CL · arxiv.org