FLEET提出记忆增强搜索替代盲采样
先了解这件事
2026年10月2日,Reddit MachineLearning 出现关于 FLEET 算法的讨论。作者提出,在奖励最大化任务中,不应只依赖 Best-of-N 盲采样,而应给搜索加入记忆。FLEET 先将外部奖励归因到具体 token,再用修改版 MCTS 在下一轮生成时调整 logits,使模型利用此前获得的奖励信息。方法上,FLEET 追踪高熵和高 varentropy 的 logits,将这些不确定状态视为分支点;对应的归一化 hidden states 存入向量库,并与奖励历史、节点转移等元数据关联。检索和更新基于余弦相似度,报道在解释“因为高相”处截断,未给出完整依据。目前进展是 FLEET 被描述为用记忆增强搜索替代重复采样,以改进奖励最大化生成。
AI 根据报道生成 · 2 小时前更新
报道时间线
沿着报道,了解事件的不同侧面。
- Reddit · MachineLearningFLEET 用奖励记忆和 MCTS 调整 logits,减少 Best-of-N 盲采样
FLEET 的作者提出,在奖励最大化任务中给搜索加入记忆,而不是只依赖重复采样。该算法先把外部奖励归因到具体 token,再用修改版 MCTS 在下一轮生成时调整 logits,使模型能利用此前获得的奖励信息。 方法上,FLEET 追踪高熵和高 varentropy 的 logits,把这些不确定状态视为分支点;对应的归一化 hidden states 存入向量库,并与奖励历史、节点转移等元数据关联。检索和更新基于余弦相似度,因为高相似状态下 KL divergence 足够低,可保留多数有意义 token。它不直接选择 token,而是对 top-k token 和探索集合排序,并惩罚次优 token,再交给解码策略。作者称在 GSM8K 和 LiveCodeBench v6 easy split 上用 Llama 3.2 3B 测试:GSM8K 只多解出 7 道题,但用一半迭代达到采样基线;LiveCodeBench 在相同预算下把分数从 0.59 提到 0.69,并用 9 次迭代达到基线,而基线需要 32 次。 事实是作者给出了方法、代码、预印本和两项基准结果。推断是这类记忆化搜索可能把 Best-of-N 从盲搜索推向可复用经验,但材料未提供更大模型或更多任务上的验证;其跨任务复用、作为 SFT/RL 先验的价值仍属作者设想,需要更多实验确认。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。