跳到正文
原文
arXiv cs.AI· Miaobo Hu, Shuhao Hu, Xiaobo Guo, Xin Wang, Bokun Wang, Yina Sa, Daren Zha, Jun Xiao·· 11 小时前AI 评分46

ContractRL:基于合约约束的组相对策略优化实现可审计工具调用修复

ContractRL: Shielded Group-Relative Policy Optimization for Auditable Tool-Call Repair

AI 摘要

ContractRL 提出一种受合约约束的顺序修复协议,将验证器引导的 JSON 修复建模为有界决策过程。在相同验证信息下,该模型以 34.4 个 token 达到 0.9362 语义成功率,优于 Patch-SFT(0.9076)和全量再生(0.9148)。策略优化后语义成功率进一步提升至 0.9375,且与 Patch-SFT 相比差异显著。

来源:arXiv cs.AI · arxiv.org