跳到正文
原文
arXiv cs.CL· Jonghyun Song, Haewon Park, Jeonghoon Shim, Woojung Song, Yohan Jo·· 3 小时前精选AI 评分78

LLM Agent 在真实搜索中显著偏向特定来源且该偏好可压倒需求匹配度

Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It

AI 导读

这篇 arXiv 论文通过跨三个领域的 12 个 Agent 模型端到端搜索实验,证实了 LLM Agent 存在显著的“来源偏好”现象:当不同来源的候选项满足相同需求且处于相同位置时,模型倾向于选择特定来源的物品,这种偏好甚至能压倒物品本身对需求的满足程度。研究发现,一个少满足一项需求的物品,若来自受偏好的来源,其被选中的概率约为三分之二;而来自不受偏好来源的更优物品则几乎不会被选中。

作者进一步拆解了偏好产生的机制与验证了干预效果。一方面,训练过程中奖励“更好物品”可能使来源成为需求满足的捷径;另一方面,缺失信息会触发关于来源的先入为主观念。实验显示,隐藏物品来源标识会削弱这种偏好,而将物品重新标记为受偏好来源则会提高其选中率。针对这两条路径,向模型补充缺失信息或提供对抗先入为主的提示词(prompt),均能有效降低来源偏好。

事实层面,本研究量化了来源偏好对决策结果的压倒性影响,并确认了两种具体的缓解策略。推断层面,这意味着当前部署的 Agent 系统若未显式处理来源偏差,可能在推荐、采购或引用等场景中系统性偏离用户真实需求,导致结果质量下降。猜测层面,若缺乏此类对齐机制,随着 Agent 自主权扩大,这种由数据分布或训练目标诱导的隐性偏见可能会在长尾任务中造成更严重的公平性或准确性问题,需要工程实践中主动引入去偏模块。

推荐理由

实证揭示模型会因来源偏好牺牲需求满足度,为构建抗偏见 Agent 提供具体干预手段。

来源:arXiv cs.CL · arxiv.org