热点事件持续更新
决策模型裁判中请求呈现方式引发对抗线索
1 篇报道1 个报道来源4 小时前更新
先了解这件事
AI 综述
2026年10月9日,arXiv发布研究指出,当指令要求裁判模型拒绝明显错误的最终值时,仅在候选答案中添加冒号会导致错误接受率显著上升。该漏洞与结构化评判请求的呈现方式相关。在200个未使用的DROP和GSM8K源簇上,Jev模型的错误接受率在两种评分配置下均从约1%-3%升至26.0%-26.5%。实验证据显示这种漏洞与候选项分配的错误数值大小相关,且通过了预设的统计修正。
AI 根据报道生成 · 1 小时前更新
最新进展10月9日 12:00
研究显示仅添加冒号即可使Jev模型错误接受率从1%升至26%。报道时间线
沿着报道,了解事件的不同侧面。
10月9日
- arXiv cs.CL决策模型作为裁判时请求呈现方式引发的对抗性线索影响研究
该论文指出,当指令要求裁判模型拒绝明显错误的最终值时,仅通过在候选答案中添加一个冒号即可导致错误接受率显著上升,具体取决于结构化评判请求的呈现方式。在200个未使用的DROP和GSM8K源簇上,该编辑使Jev模型的错误接受率从1.0%升至26.0%(三标签输出),并在排序JSON键下从3.0%升至26.5%(四标签发布指令)。 实验证据显示,这种漏洞与候选项分配的错误数值大小相关,且通过了预设的统计修正,尽管Jev在两种评分配置和呈现方式下均满足控制阈值。相比之下,GPT-6 Sol未观察到此类基于线索的错误接受,但存在响应缺失问题。参考感知语法和复合排序变化限制了该发现的适用范围,其内部成因尚未被测量。 事实层面确认了基础评判能力可与对固定候选编辑的高度脆弱性共存;推断表明当前自动化评测流程可能因提示词微调而产生系统性偏差;猜测部分认为不同模型架构对格式线索的敏感度差异可能源于训练数据分布或推理机制的不同,但这需要进一步验证。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。