跳到正文
热点事件持续更新

Jevman 开源 Pac-Man AI 决策模型基准

1 篇报道1 个报道来源9 小时前更新

先了解这件事

AI 综述

2026-10-09,Hacker News 报道 Jevman 开源了一个允许任意 HTTP 模型在 Pac-Man 中测试实时决策能力的基准工具。该工具支持托管服务、微调版本或本地运行模型参与对抗,让六个模型各进行 100 场经典幽灵对战并记录得分生成排行榜。其核心机制是将迷宫状态以 JSON 格式发送给模型,要求模型在每个路口返回方向选择及概率分布;若响应超过 2 秒则触发备用规则并计入备份移动次数。评分标准采用平均分加 95,同时开放了自我报告机制供社区提交新模型。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. Hacker News · AI
    Jevman 开源基准允许任意 HTTP 模型在 Pac-Man 中测试实时决策能力

    Jevman 是一个开源基准工具,允许任何通过 HTTP 端点运行的 AI 模型(包括托管服务、微调版本或本地运行模型)参与 Pac-Man 游戏对抗。该工具让六个模型各进行 100 场经典幽灵对战,记录得分并生成排行榜,同时开放了自我报告机制供社区提交新模型。 其核心机制在于将迷宫状态以 JSON 格式发送给模型,要求模型在每个路口返回方向选择及概率分布;若响应超过 2 秒则触发备用规则并计入备份移动次数。评分标准采用平均分加 95% 置信区间(±2 标准误),分数重叠即视为并列,且所有游戏过程均可回放验证以确保结果可复现。材料未提及具体模型的最终排名数值,仅展示了测试框架的运行逻辑与数据校验方式。 这一设计将模型推理延迟、实时决策质量与游戏表现直接关联,为评估端侧或小参数模型的动态规划能力提供了低成本验证路径。事实层面确认了工具支持任意 HTTP 模型接入及 CI 自动重放机制;推断层面表明该基准可能成为衡量 Agent 在受限时间窗口内处理多模态状态(迷宫、鬼魂、豆子)的新指标;猜测层面是未来可能出现针对特定架构优化的专用模型,但当前材料未披露具体性能差异或商业应用计划。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。