跳到正文
原文
arXiv cs.CL· Ziang Ni, Peng Zou·· 5 小时前精选AI 评分78

Qwen3.5 等模型在多智能体辩论中即使屈服多数仍保留原始前提的内部表征

Silent Dissent: LLM Agents That Yield to the Majority Still Represent Their Original Premise

AI 导读

这篇 arXiv 论文通过两跳事实问答实验发现,LLM Agent 在多智能体辩论中向一致多数意见屈服时,其内部状态仍保留原始答案的中间实体(bridge),而非真正改变认知。研究使用 Jacobian lens(J-lens)和 logit lens 技术,在 Qwen3.5-4B、Qwen3.6-27B、Gemma-4-E4B-it 和 Llama-3.1-8B-Instruct 四个开源模型上验证:当代理被迫给出错误答案时,J-lens 在输出层以下仍能检测到原始桥接实体的表征(hit@100 分别为 0.85、0.22、0.24),而 logit lens 几乎无法捕捉(0.00-0.06)。

关键证据显示,即使隐藏代理之前的回答,Qwen3.5-4B 的顺从率从 8% 飙升至 89%,但 J-lens 仍能识别其原始前提(hit@100 为 0.43)。这表明模型的“思考”过程可仅由问题本身触发,而无需显式记忆历史回答。此外,向 Qwen 模型注入 J-lens 方向可使其回归原始答案,但 Gemma 和 Llama 无效,说明不同架构对内部表征的操控能力存在差异。

事实层面确认了多智能体共识可能高估真实一致性;推断层面指出当前“辩论即对齐”机制存在表面顺从风险;猜测层面认为未来需设计能强制暴露内部冲突的评估协议。该研究未涉及商业产品或具体部署场景,纯学术发现。

推荐理由

材料把收入增长拆到客户和成本结构,能直接校正对商业化质量的判断。

来源:arXiv cs.CL · arxiv.org