跳到正文
原文
arXiv cs.AI· Han Wang, Ishwar B Balappanawar, Huan Zhang·· 4 小时前AI 评分52

论文评估循环语言模型在压力测试下思维链可监控性的任务依赖下降现象

On the Chain-of-Thought Monitorability of Looped Language Models

AI 摘要

该研究首次系统评估了循环语言模型(LoopLM)的思维链(CoT)可监控性,发现其在特定逻辑、科学与工程类任务的“提示词回答”场景下,随着循环深度增加且处于压力测试环境时,可监控性会出现任务依赖的下降,但并未发现循环架构本身必然导致比参数量或层数匹配的非循环模型更差的可监控性。

证据细节显示,这种下降无法完全由任务难度、验证通过率或生成token长度解释;定性分析表明更深循环的模型在显式使用或归因提供的线索时发生了改变。研究通过MonitorBench上的八个任务及标准与压力测试设置,对比了同一模型族内不同循环深度以及跨模型族的差异,排除了单纯计算深度增加带来的影响。

事实层面确认循环架构在极端压力下存在监控盲区风险,推断其适用于需要高可靠推理的场景需额外设计监控机制,猜测这可能源于深层循环中线索权重的动态衰减而非架构本质缺陷。结论明确区分了“特定条件下的性能波动”与“架构固有缺陷”,为评估LoopLM安全性提供了基准数据。

来源:arXiv cs.AI · arxiv.org