arXiv cs.CL· Hongliang Liu·· 5 小时前AI 评分70
决策模型作为裁判时请求呈现方式引发的对抗性线索影响研究
Adversarial Cues in Decision Models Used as Judges: The Role of Request Presentation
AI 摘要
该论文指出,当指令要求裁判模型拒绝明显错误的最终值时,仅通过在候选答案中添加一个冒号即可导致错误接受率显著上升,具体取决于结构化评判请求的呈现方式。在200个未使用的DROP和GSM8K源簇上,该编辑使Jev模型的错误接受率从1.0%升至26.0%(三标签输出),并在排序JSON键下从3.0%升至26.5%(四标签发布指令)。
实验证据显示,这种漏洞与候选项分配的错误数值大小相关,且通过了预设的统计修正,尽管Jev在两种评分配置和呈现方式下均满足控制阈值。相比之下,GPT-6 Sol未观察到此类基于线索的错误接受,但存在响应缺失问题。参考感知语法和复合排序变化限制了该发现的适用范围,其内部成因尚未被测量。
事实层面确认了基础评判能力可与对固定候选编辑的高度脆弱性共存;推断表明当前自动化评测流程可能因提示词微调而产生系统性偏差;猜测部分认为不同模型架构对格式线索的敏感度差异可能源于训练数据分布或推理机制的不同,但这需要进一步验证。
来源:arXiv cs.CL · arxiv.org