论文提出仅限运行时更新的LLM Agent自进化框架在信贷管道中通过准入门控将有害变更拦截率提升至98%
The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate
该研究针对LLM Agent在信贷审批等高风险场景中自我改进导致监管审查失效的问题,提出一种“双环引擎”架构,核心约束是仅允许运行时层(指令文本、工具调用逻辑和原语组合)发生变异,而模型权重保持固定,从而确保每次适应都能生成带因果和测试的可追溯差异。作者在模拟环境中构建了一个带有哈希链记录的门控系统,并在三个监督重解释家族及三种严重程度下进行了测试,共7449个候选变更中仅有144个被放行,且未增加历史数据的错误率,同时将误报率恢复至Oracle水平。
对比实验显示,若移除该门控并采用无界系统常见的检查机制,同一循环会放行309个有害变更,且在49次运行中漏报率超过10%;此外,当使用预移位标签评估时,门控系统拒绝了所有候选变更,表明任何重解释必须编码为重新标记历史的规则。研究发现参数和范围偏移可通过局部修复解决,但结构性问题仅能通过原语替换处理,而在最高结构性严重度下,门控的固定容差在半数种子中阻断了正确的替换操作。
文章将上述机制映射至欧盟《人工智能法案》中关于高风险信用评分的规定,并指出2026年4月美国模型风险指南已将代理式AI排除在范围之外。事实部分基于模拟数据与特定门控逻辑,推断部分涉及对现有监管框架适用性的分析,猜测部分则是对未来结构性问题处理局限性的探讨,即固定容差可能无法应对极端复杂的结构变化。
实验证明限制模型权重更新仅修改运行时逻辑,可将有害变更拦截率从4.2%提升至98%,为高合规场景提供可审计的自进化方案。
来源:arXiv cs.AI · arxiv.org