Microsoft 与 Hugging Face 发布 ThinkingBox 基准:用终端数据库状态评估 AI Agent 的可靠性与成本
The Agent Said It Was Done. The Database Disagreed.
Microsoft 与 Hugging Face 联合推出 ThinkingBox 基准,该工具不再仅依据模型生成的文本或工具调用次数来评分,而是通过检查智能体执行后留下的终端后端状态和副作用(如数据库记录变更)来判定任务是否真正完成。该基准包含 507 个有状态的商业工作流任务,每个任务独立运行 20 次,旨在评估智能体在真实业务场景下的可靠性和一致性。
评测结果显示,单次尝试成功率(pass@1)与长期稳定性之间存在显著差距。例如,Kimi-K3 虽然解决了 93.89% 的任务至少一次,但在所有 20 次尝试中均成功的任务比例仅为 13.41%;而 Claude Opus 5 虽然解决的任务总数较少,但其 20/20 通过率高达 47.53%。此外,分析指出约 80% 的失败源于工具处理问题而非推理能力不足。在单位经济方面,GPT-6 Astra 以 $7.45 的成本完成了最多的可信赖任务,而 DeepSeek-V4-Pro 等模型在保持高准确率的同时,其单次成功成本较低,但完全可靠的成本较高。
事实层面,ThinkingBox 已作为开源项目发布在 Hugging Face 上,基于 OpenEnv 环境运行。推断层面,这表明当前大模型在涉及写操作的业务场景中仍存在严重的“幻觉”风险,即模型可能自信地报告错误结果。猜测层面,企业级应用若直接采用此类模型进行自动化决策,需引入额外的验证层或人工审批机制,否则可能导致数据污染或业务逻辑错误。
材料通过 20 次重复测试揭示模型在状态一致性上的巨大差异,并给出单位经济成本,能校正对 Agent 生产可用性的判断。
来源:Hugging Face Blog · huggingface.co