跳到正文
原文
arXiv cs.AI· Ramin Pishehvar, Andrea Morandi, Mahesh Viswanathan·· 5 小时前AI 评分68

论文揭示语义熵在 LLM 路由中的真实表现及五种自我欺骗陷阱

Evaluating Escalation Signals for LLM Routing: Targets, Controls, and Five Ways to Fool Yourself

AI 摘要

该论文测试了语义熵作为小模型向大模型升级查询的廉价信号,在 GSM8K 等基准上,该信号能可靠区分小模型的错误(AUROC 0.871),并在匹配成本下将路由准确率比随机升级提高九个百分点。然而,作者指出早期合成基准上的强结果具有误导性,因为仅基于问题难度的简单规则就能几乎完美匹配语义熵的表现。

文章核心贡献在于提出了一套验证检查清单,用于识别评估中的常见错误:首先,将廉价的纯问题难度估计与任何信号并列评分,可揭示该信号是否真正提供了信息增量还是仅仅追踪了问题的表面难度;其次,对“升级成功”的不同定义会导致同一数据产生截然不同的结果;第三,某些基准可能几乎没有空间让任何信号优于直接使用大模型;第四,实时采样的真实成本可能使路由策略比直接调用大模型更昂贵。此外,对于复用缓存结果的替代方案,论文展示了如何提前预测其在新数据集上的有效性,并成功预测了 AUROC 从 0.908 跌至随机水平(0.518)的情况。

事实层面,论文确认了语义熵在特定场景下的有效性及其计算成本限制。推断层面,这意味着当前许多关于路由信号的研究可能混淆了问题难度与模型能力信号,导致高估了信号价值。猜测层面,若行业继续忽视这些验证检查,可能会在大规模部署中因错误的路由决策而增加不必要的算力开支,但具体影响程度取决于各团队采用的基准和成本结构。

来源:arXiv cs.AI · arxiv.org