跳到正文
热点事件持续更新

Jebadiah v2.1 发布:Decision Index 提升但 When2Call 退化

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

2026-10-11,开发者 /u/WebDevToday 发布了基于 Qwen 基座的 Jebadiah v2.1 开源权重(27B 和 9B)。该模型将决策建模为闭集评分问题,直接输出 logits。在 Decision Index 0.3 基准上,27B 版本得分 57.03(较 v2 提升 2.34),9B 版本得分 47.20(较 v2 提升 3.11)。然而报道指出,在 When2Call 测试项上出现显著回归,27B 版本表现下滑。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月11日
  1. Reddit · MachineLearning
    Jebadiah v2.1 开源模型发布并披露 Decision Index 基准结果与工具调用退化细节

    开发者 /u/WebDevToday 发布了基于 Qwen 基座的 Jebadiah v2.1 开源权重(27B 和 9B),该模型将决策建模为闭集评分问题而非文本生成,直接输出各选项的概率 logits。在作者自建的 Decision Index 0.3 公开套件上,27B 版本得分 57.03(较 v2 提升 2.34),9B 版本得分 47.20(较 v2 提升 3.11),但在 When2Call 测试项上出现显著回归,27B 下降 6.38,9B 下降 7.44。 评估显示模型在知识、语言、检索等维度有明确增益,但工具使用能力受损;作者指出尚未找到回归原因且数据未达统计显著性。量化方面,27B 模型在 Q8_0 量化下于 260 道保留题中达到 259/260 的一致性,9B 模型在 MLX 4-bit 量化下达到 237/260。训练数据污染检查通过文本匹配扫描未发现重叠,但无法排除改写后的重复内容。 事实层面,该模型采用 Apache-2.0 协议并在 Hugging Face 和 GitHub 开源了权重、数据集及代码;推断层面,这种非生成式的决策架构可能更适合结构化任务但对动态工具链的泛化存在风险;猜测层面,当工具调用成为主要瓶颈时,单纯增加参数量或微调通用能力未必能解决特定场景下的性能回退。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。