arXiv cs.AI· Tong Che, Yilong Li·· 5 小时前AI 评分68
LLM 内部特征追踪行为不等于模型在使用该特征的实证检验
Does the Model Use the Feature? Separating Steering from Mechanism in LLMs
AI 摘要
这篇论文指出,仅凭内部特征能追踪概念且操纵该特征能改变相关行为,不足以证明模型在自然计算中使用了该特征,因为干预可能将特征推离其自然分布范围。作者提出一个实证契约,要求仅在自然输入上观测到的特征值范围内进行测试,以验证特征是否真正被模型使用。
该契约包含两个核心测试:安装(installation)和移除(removal),以及下游救援(downstream rescue)。安装测试将一个显示特定行为的输入中的特征值复制到未显示该行为的匹配输入中,衡量该特征是否足以产生行为;移除测试则相反,衡量模型在缺失该特征时是否仍依赖它。下游救援测试在修改上游后恢复特征值,进一步评估特征的必要性。实验发现,已发布的未知实体潜变量虽能强力引导知识弃权行为,但将其从已知输入安装到匹配提示词中,仅转移了很小一部分自然的已知 - 未知弃权对比度;Gemma 和 Llama 中的密集已知 - 未知方向在安装与移除之间表现出相反的不对称性;而发布的主谓一致特征集能否完全复现和恢复行为,取决于其值写入模型的方式。
事实层面,干预效果不能直接等同于模型内部机制,结论高度依赖于具体的干预方式。推断层面,现有的特征解释方法若忽略自然分布约束,可能高估了某些特征的因果作用。猜测层面,未来构建可解释性工具时需严格限制干预范围至自然数据分布内,否则可能导致对模型行为的误读。
来源:arXiv cs.AI · arxiv.org