arXiv cs.CL· Riju Marwah, Ritvik Garimella, Khusham Bansal, Atishay Jain, Amit Sheth·· 4 小时前AI 评分72
多语言提示污染下输出语言混淆导致 LLM 幻觉率被高估
Output Language Confusion under Multilingual Prompt Contamination
AI 摘要
该论文指出标准事实基准假设的纯净单语提示和精确匹配评分在多语言部署中失效,提出多语言干扰器(MDI)协议评估五款指令微调大模型。研究发现核心指标混淆:Llama-3.1-8B 在印地语干扰下 58% 响应切换至天城文脚本,原始幻觉代理值达 0.710,但人工复核显示其中 120 个正确响应仅因脚本错误被误判,调整后语义幻觉率降至 0.470。其他模型未出现幻觉增加,而是通过拒绝回答升级来应对干扰。
实验细节显示,段落长度的英语干扰触发所有模型近乎普遍的拒绝回答(0.806-0.998),这与阅读理解混淆一致,对多语言检索增强生成(RAG)管道有直接后果。TruthfulQA 多项选择题准确率在所有单句条件下均未受影响。这些结果表明,混合语言环境下的精确匹配幻觉率应分解为脚本切换和语义错误组件,才能得出关于模型可靠性的结论。
事实层面确认了脚本切换是主要干扰源而非语义错误;推断层面认为现有评估体系可能系统性高估多语言场景下的模型不可靠性;猜测层面涉及未来对齐策略需显式处理脚本一致性而非仅关注语义内容。
来源:arXiv cs.CL · arxiv.org