arXiv cs.AI· Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira Jr., Marlos C. Machado·· 9 小时前AI 评分42
GITA 如何学习多时间尺度以优化目标条件强化学习
Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning
AI 摘要
论文提出通用隐式时间抽象(GITA)方法,通过让单一价值函数适应不同时间步长 k,解决离线目标条件强化学习中长程任务信号衰减问题。该方法在 OGBench 基准上平均成功率提升 25 个百分点,相对 HIQL 基线改善 73%,并超越最强固定 k 方法 OTA 7 个百分点。
来源:arXiv cs.AI · arxiv.org