StoreBench评估显示DeepSeek-V4-Pro等模型在电商环境中不及人类与启发式策略
先了解这件事
2026年10月9日,arXiv发布StoreBench基准,用于评估自主智能体在实时电商环境中的能力。该基准模拟全天候客户下单、供应商调价与市场冲击,测试模型的长周期规划与经济判断能力。评估结果显示,包括DeepSeek-V4-Pro在内的七款前沿大语言模型在11个场景及完整模拟年中,均未达到脚本化启发式策略的通过率,最佳模型仅达49%,而启发式策略为97%。此外,人类专家在使用相同工具与预算时的综合得分(0.708)高于所有模型。
AI 根据报道生成 · 1 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.AIStoreBench 评估显示 DeepSeek-V4-Pro 在动态电商环境中表现不及人类专家与启发式策略
arXiv 发布的 StoreBench 是一个用于评估和训练自主运营智能体的实时电商环境,该基准通过模拟全天候客户下单、供应商调价与突发市场冲击,测试模型在长周期规划与经济判断下的能力。评估结果显示,包括 DeepSeek-V4-Pro 在内的七款前沿大语言模型在 11 个场景及完整模拟年中均未达到脚本化启发式策略的通过率(最佳模型仅达 49%,启发式策略为 97%),且人类专家使用相同工具与预算时的综合得分(0.708)高于所有模型(0.700)。 实验细节表明,该环境采用窗口化操作预算机制,使模拟时间取决于动作而非模型延迟,并针对奖励黑客行为进行了加固。在 GRPO 后训练实验中,Qwen3.5-27B 仅在五个不相关任务上训练,其在保留评估任务上的平均综合得分从 0.136 提升至 0.373,显示出特定任务微调的有效性,但整体性能距离通用商业运营仍有差距。 事实层面,该基准已发布五个训练集任务和十条轨迹样本,但完整环境与评估套件被 withheld 以防止污染。推断层面,这暗示当前 Agent 在应对非结构化、高不确定性的长期经济决策时,其泛化能力尚未突破静态基准的局限。猜测层面,若未来模型能结合更多样化的动态反馈数据,或许能缩小与人类专家的差距,但这需要验证其是否会导致过拟合特定场景。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。