跳到正文
原文
Hacker News · AI· felix089·· 10 小时前AI 评分55

Jevman 开源基准允许任意 HTTP 模型在 Pac-Man 中测试实时决策能力

Show HN: Jevman – AI decision models play Pac-Man

AI 摘要

Jevman 是一个开源基准工具,允许任何通过 HTTP 端点运行的 AI 模型(包括托管服务、微调版本或本地运行模型)参与 Pac-Man 游戏对抗。该工具让六个模型各进行 100 场经典幽灵对战,记录得分并生成排行榜,同时开放了自我报告机制供社区提交新模型。

其核心机制在于将迷宫状态以 JSON 格式发送给模型,要求模型在每个路口返回方向选择及概率分布;若响应超过 2 秒则触发备用规则并计入备份移动次数。评分标准采用平均分加 95% 置信区间(±2 标准误),分数重叠即视为并列,且所有游戏过程均可回放验证以确保结果可复现。材料未提及具体模型的最终排名数值,仅展示了测试框架的运行逻辑与数据校验方式。

这一设计将模型推理延迟、实时决策质量与游戏表现直接关联,为评估端侧或小参数模型的动态规划能力提供了低成本验证路径。事实层面确认了工具支持任意 HTTP 模型接入及 CI 自动重放机制;推断层面表明该基准可能成为衡量 Agent 在受限时间窗口内处理多模态状态(迷宫、鬼魂、豆子)的新指标;猜测层面是未来可能出现针对特定架构优化的专用模型,但当前材料未披露具体性能差异或商业应用计划。

来源:Hacker News · AI · opper.ai