Red Hat 实测显示 Jev 等决策模型在 AI 护栏任务中未优于传统分类器或 LLM-as-a-judge
Decision models like Jev don't beat LLM-as-a-judge or traditional classifiers
Red Hat AI Safety 团队通过 EvalHub 框架对九种护栏方法进行了基准测试,结论是 TypeSafe 推出的 Jev 等决策模型并未在速度、成本或准确性上显著超越现有的预训练预测模型或 LLM-as-a-judge 方案。在提示词注入检测任务中,Qwen3.6-35B 以 89.31% 的准确率排名第一,而预训练的 deberta-v3-base-prompt-injection-v2 紧随其后达到 89.01%,两者均优于 Jev 的 86.35%;在内容安全任务中,Jev 以 86.20% 的准确率位列第一,但 Qwen3.6-35B 仅差 0.73 个百分点且延迟更低。
实验细节揭示了不同架构的适用边界:预训练的 CPU 级模型(如 granite-guardian-hap-125m)在内容安全任务中延迟低至 33.2ms,远低于 Jev 的 360.4ms,证明了针对特定风险定制的小模型在已知场景下的极致效率。同时,开源替代方案 Laya 在原始策略下表现不佳(57.87%),但经过针对性提示词调优后准确率提升至 75.20%,而将同样的调优策略应用于 Jev 反而导致其性能下降至 82.53%,表明不同决策模型的提示词工程存在互不兼容的特性。
事实层面,测试覆盖了本地 CPU 与云环境下的多种模型,包括 Shieldstral、Nemotron-3.5 和 DiffusionGemma,结果明确显示网络延迟对 API 调用型模型影响显著。推断层面,虽然决策模型提供了零样本泛化能力,但在拥有充足标注数据的护栏场景中,其优势被预训练模型的精度和低成本所抵消。猜测层面,未来若能在更高维度的嵌入架构上优化或结合 OpenAI 新发布的 Decisions API,可能会改变当前的性能格局,但目前该范式尚未成为通用解决方案。
实测数据证明决策模型在速度与精度上未超越专用小模型,可校正对新技术的盲目乐观预期。
来源:Hacker News · AI · developers.redhat.com