Galahad-KV实现50M token长时记忆且无需重算
先了解这件事
2026年10月9日,一项研究测试了开源包galahad-kv。该方案通过将每块约16,000 token的KV状态加密存储至本地NVMe磁盘,并在后续请求中精确加载,从而避免了对提示词进行重新计算。实验在单张NVIDIA H100上使用vLLM服务Gemma 4 12B和31B模型,处理了50,000,000 token的真实公开文本。结果显示,所有深度从0到50M token的查询块均实现了100%的无重计算加载。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- arXiv cs.CL精选Gemma 4 在 5000 万 token 流上通过 galahad-kv 实现无重计算记忆加载
该研究测试了开源包 galahad-kv,它通过将每块约 16,000 token 的 KV 状态加密存储至本地 NVMe 磁盘并在后续请求中精确加载,从而避免了对提示词进行重新计算。实验在单张 NVIDIA H100 上使用 vLLM 服务 Gemma 4 12B 和 31B 模型,处理了 50,000,000 token 的真实公开文本,所有深度从 0 到 50M token 的查询块均实现了 100% 的无重计算加载。 性能数据显示,加载一个块的耗时比重新计算快 2.8 倍至 4.3 倍,GPU 能耗降低 8.8 倍至 12.3 倍,且在整个 50M token 流过程中 GPU 显存保持平稳。在事实检索能力方面,当被问及数百万 token 前植入的事实时,12B 模型正确回答 82/100 次,31B 模型为 98/100 次,且未出现幻觉。该机制并非扩展注意力窗口,而是分块复用存储的状态,写入是一次性成本,存储占用需达 TB 级。 事实层面确认了单卡环境下利用本地 NVMe 实现超长上下文记忆复用的可行性及显著能效优势;推断层面表明该方法可能改变长上下文应用的部署架构,将显存瓶颈转移至本地存储带宽与容量;猜测层面在于大规模生产环境中多节点协同或高并发场景下的具体表现仍需验证,原文未涉及分布式扩展细节。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。