MARS框架研究:LLM直接分类优于声明评分
先了解这件事
2026年10月8日,arXiv发布关于MARS框架的研究论文。该研究对比了大语言模型通过直接判定(verdict)与基于外部规则对行为声明(claims)进行评分两种恶意软件分流路径。在涵盖1,195个PE和ELF二进制文件及六个模型的评估中,直接分类在所有测试模型上均表现出更高的准确率,优势幅度介于3.7至20.9个百分点之间,且所有差异的95%置信区间均大于零。此外,直接分类在十二种平台与模型组合中有十种实现了更高的恶意警报召回率。
AI 根据报道生成 · 3 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CRMARS 论文显示大语言模型直接分类在恶意软件研判中比声明评分更准确
该研究提出 MARS 框架,对比了大语言模型通过直接判定(verdict)与基于外部规则对行为声明(claims)进行评分两种恶意软件分流路径。在涵盖 1,195 个 PE 和 ELF 二进制文件及六个模型的评估中,直接分类在所有测试模型上均表现出更高的准确率,优势幅度介于 3.7 至 20.9 个百分点之间,且所有差异的 95% 置信区间均大于零。此外,直接分类在十二种平台与模型组合中有十种实现了更高的恶意警报召回率。 证据细节显示,声明中介化并未带来跨模型性能波动的一致降低;当移除预定义指标字段时,声明路径的召回损失更大。虽然家族识别探针发现声明在准确性上高于判定标签但低于证据文本,但核心结论在于:若仅需最终判定结果,直接分类显著优于声明路径。然而,保留声明具有独特价值,它能暴露判定计算所需的输入,允许在不重新调用模型的情况下进行策略审查与修订,研究团队成功复现了归档判定并应用了修订后的策略。 事实层面,直接分类在准确率与召回率上全面胜出是实验观测结果;推断层面,这意味着当前依赖 LLM 生成详细行为描述再经规则引擎处理的架构可能引入不必要的精度损耗;猜测层面,未来针对需要可解释性或动态策略调整的安全场景,混合模式(直接判定为主、声明为辅用于审计)可能成为更优解,但这需进一步验证策略修订带来的实际收益是否足以抵消精度损失。
本事件热度走势
当前热度 9·可比范围峰值 9(10月8日 14:00)·近 24 小时可比范围变化 –
趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。