arXiv cs.CL· Ang Li, Yue Lin, Feifei Kou, Zhan Su, Prayag Tiwari, Wenhao Li, Shuhui Zhu, Hongyuan Zha, Baoxiang Wang·· 6 小时前AI 评分65
论文提出可操作不确定性框架并构建基准,发现 LLM 在确定场景下仍会错误请求澄清或行动
Ask, Relax, or Act? Evaluating Actionable Indeterminacy in LLM Preference Reasoning
AI 摘要
该论文形式化定义了“可操作的不确定性”(actionable indeterminacy),指出大语言模型智能体虽能识别不确定性,却常做出错误的下一步选择:在已有可行行动时仍选择询问,或在约束必须变更时才寻求澄清。作者构建了涵盖对象分配、会议调度、公寓选择和稳定匹配的求解器 grounded 基准,将评估细分为决策正确性、匹配对可靠性及完全正确响应三个维度。
研究发现一个反复出现的缺陷:模型难以识别何时无需干预,即便确认需要澄清或修复的场景,当已存在合理的既定行动时仍会进行干预。此外,正确的决策标签并不能保证生成的行动、问题或修复方案是可用的。更关键的是,响应要求不仅影响决策的表达方式,还会改变实际做出的决策;显式规定所需内容能显著提高完全正确响应的比例,甚至改变干预决定,即使输出本身已是可解析的。
事实层面,该研究提出了新的定义与基准,并观察到模型在特定任务中的系统性偏差。推断层面,这表明当前 Agent 的可靠性评估若仅关注最终结果的正确性,可能掩盖了中间决策逻辑的冗余与错误。猜测层面,未来若要在复杂环境中部署 Agent,需将“最小必要干预”作为核心优化目标,而不仅仅是提升单一任务的准确率。
来源:arXiv cs.CL · arxiv.org