跳到正文
原文
arXiv cs.CL· Hans Schabert, Christoph Peters·· 5 小时前AI 评分75

论文提出用 MCP 分步交付替代提示词注入,以牺牲部分自主性换取可预测的执行路径和审计日志

One Step at a Time: Trading LLM Autonomy for Process Predictability

AI 摘要

该研究针对组织自动化运营中 Agent 执行过程不可预测、无法逐步骤审计的问题,提出一种基于 Model Context Protocol (MCP) 的分步交付机制。该机制由服务器按顺序释放步骤,Agent 执行后返回结构化 step_output,从而在架构层面确保执行路径预先确定且全程可记录,而非依赖 Agent 自行重构流程。

实验覆盖 15,475 次测试,涉及 13 个 SOP-Bench 领域及四个不同规模的开源执行器(从 Kimi K2.5 到 Ministral 3 8B)。结果显示,分步交付使所有执行器的流程遵循率从 76-95% 提升至 95-99%,无依据回答(即跳过 SOP 直接输出正确结果)的比例从 2.1-4.5% 降至 0.2-0.3%。对于轻量级模型,外部提供流程消除了其重建负担,使有依据准确率提升 6.5 个百分点;而高性能模型虽在原始准确率上略有下降,但获得了可审计的过程保障。

事实层面,该方法通过 MCP 协议实现了执行路径的预定义和结构化日志生成。推断层面,这种模式适合对合规性要求极高的金融、医疗等垂直场景,但可能增加系统延迟和复杂度。猜测层面,若未来 MCP 成为标准接口,此类“过程优先”的架构可能重塑 Agent 在 B 端落地时的评估体系,从单纯看结果准确率转向同时考核过程可解释性。

来源:arXiv cs.CL · arxiv.org