跳到正文
原文
Hacker News · AI· matt_d·· 19 小时前AI 评分68

基于两家公司生产轨迹的研究显示 LLM 前缀缓存中 LRU 优于复杂替换算法

When Fancy Eviction Fails: Rethinking Cache Replacement for LLM Prefix Reuse

AI 摘要

该论文通过分析两家公司的生产轨迹并评估 14 种驱逐算法,发现尽管 Belady 最优解与现有策略存在巨大差距,但在智能体工作负载下,针对传统缓存设计的复杂策略并未比 LRU 提供显著收益。核心原因在于前缀重用主要由活跃会话的规律节奏主导,使得最近使用记录(recency)具有异常高的预测性。

研究揭示了前缀缓存引入的新挑战,包括重尾分布的会话足迹以及随序列长度增长而急剧增加的注意力计算导致的可变缺失成本。作者引入了“计算节省率”指标和两个离线预言机来量化这些效应,并提出有效的管理策略应保留以近期性为基础,同时选择性添加对单次命中前缀的快速降级、针对高成本缺失的计算感知部分驱逐以及依赖容量的驱逐粒度调整。

事实层面,论文已公开相关轨迹数据和模拟器供后续研究使用;推断层面,这意味着当前许多试图用复杂算法优化 LLM 前缀缓存的工程投入可能收效甚微,应回归以 LRU 为基线的架构;猜测层面,若未来会话模式从规律节奏转向高度随机,上述结论可能需要重新评估,但基于当前数据,简单策略在 HBM 受限和大内存池设置下均表现稳健。

来源:Hacker News · AI · arxiv.org