Reddit · MachineLearning· /u/WebDevToday·· 6 小时前AI 评分63
Jebadiah v2.1 开源模型发布并披露 Decision Index 基准结果与工具调用退化细节
[P] Pecision models that score every allowed label from the logits: Jebadiah v2.1 (27B, 9B), open weights and self-run benchmark results [P]
AI 摘要
开发者 /u/WebDevToday 发布了基于 Qwen 基座的 Jebadiah v2.1 开源权重(27B 和 9B),该模型将决策建模为闭集评分问题而非文本生成,直接输出各选项的概率 logits。在作者自建的 Decision Index 0.3 公开套件上,27B 版本得分 57.03(较 v2 提升 2.34),9B 版本得分 47.20(较 v2 提升 3.11),但在 When2Call 测试项上出现显著回归,27B 下降 6.38,9B 下降 7.44。
评估显示模型在知识、语言、检索等维度有明确增益,但工具使用能力受损;作者指出尚未找到回归原因且数据未达统计显著性。量化方面,27B 模型在 Q8_0 量化下于 260 道保留题中达到 259/260 的一致性,9B 模型在 MLX 4-bit 量化下达到 237/260。训练数据污染检查通过文本匹配扫描未发现重叠,但无法排除改写后的重复内容。
事实层面,该模型采用 Apache-2.0 协议并在 Hugging Face 和 GitHub 开源了权重、数据集及代码;推断层面,这种非生成式的决策架构可能更适合结构化任务但对动态工具链的泛化存在风险;猜测层面,当工具调用成为主要瓶颈时,单纯增加参数量或微调通用能力未必能解决特定场景下的性能回退。
来源:Reddit · MachineLearning · reddit.com