跳到正文
原文
arXiv cs.CL· Kamile Dementaviciute, Julija Vaitonyte, Tijl De Bie·· 6 小时前AI 评分62

LLM 说服能力评估结果取决于评测任务设定而非模型本身

LLM Persuasion Is in the Eye of the Evaluation

AI 摘要

该研究将九种已发表的自动化方法统一适配到相同设置中,在十五个 LLM 上运行后发现,不同方法对模型的说服能力排名仅呈现微弱一致性(Spearman ρ = 0.25)。这一结果表明,当前广泛使用的说服性评估缺乏跨方法的稳定性,单一分数难以反映模型在不同场景下的真实表现。

分析指出两个关键因素导致这种不一致:一是模型的任务拒绝行为,即模型在某些任务(尤其是操纵类任务)上拒绝执行而在其他任务上响应,直接降低了约四分之一的评估一致性;二是通用能力的影响,大多数理性说服(非操纵)的方法能追踪模型的一般能力,而大多数操纵类方法则不能。这意味着评估得分实际上混合了模型的“说服能力”与“执行意愿”,而非单纯的能力度量。

事实层面,研究证实了现有自动化方法在统一测试下的一致性极低。推断层面,说服评分的数值更多反映了评测任务的具体设定(如是否包含操纵指令),而非模型固有的说服属性。猜测层面,由于仅分析了八种可用方法,这一模式可能具有局限性,但足以提示开发者在构建对齐或安全系统时,不能仅依赖单一的自动化说服分数作为决策依据,需结合具体任务上下文进行多维评估。

来源:arXiv cs.CL · arxiv.org