arXiv cs.AI· Daksh Raghuvanshi, Ved Vedere, Yifan Wang·· 4 小时前AI 评分75
StoreBench 评估显示 DeepSeek-V4-Pro 在动态电商环境中表现不及人类专家与启发式策略
StoreBench: A Live-Commerce Environment for Evaluating and Training Autonomous Operator Agents
AI 摘要
arXiv 发布的 StoreBench 是一个用于评估和训练自主运营智能体的实时电商环境,该基准通过模拟全天候客户下单、供应商调价与突发市场冲击,测试模型在长周期规划与经济判断下的能力。评估结果显示,包括 DeepSeek-V4-Pro 在内的七款前沿大语言模型在 11 个场景及完整模拟年中均未达到脚本化启发式策略的通过率(最佳模型仅达 49%,启发式策略为 97%),且人类专家使用相同工具与预算时的综合得分(0.708)高于所有模型(0.700)。
实验细节表明,该环境采用窗口化操作预算机制,使模拟时间取决于动作而非模型延迟,并针对奖励黑客行为进行了加固。在 GRPO 后训练实验中,Qwen3.5-27B 仅在五个不相关任务上训练,其在保留评估任务上的平均综合得分从 0.136 提升至 0.373,显示出特定任务微调的有效性,但整体性能距离通用商业运营仍有差距。
事实层面,该基准已发布五个训练集任务和十条轨迹样本,但完整环境与评估套件被 withheld 以防止污染。推断层面,这暗示当前 Agent 在应对非结构化、高不确定性的长期经济决策时,其泛化能力尚未突破静态基准的局限。猜测层面,若未来模型能结合更多样化的动态反馈数据,或许能缩小与人类专家的差距,但这需要验证其是否会导致过拟合特定场景。
来源:arXiv cs.AI · arxiv.org