跳到正文
原文
arXiv cs.AI· Pedro Robles Dutenhefner, Dikshant Shehmar, Wagner Meira Jr., Marlos C. Machado·· 9 小时前AI 评分42

GITA 如何学习多时间尺度以优化目标条件强化学习

Learning Multiple Timescales for Goal-Conditioned Reinforcement Learning

AI 摘要

论文提出通用隐式时间抽象(GITA)方法,通过让单一价值函数适应不同时间步长 k,解决离线目标条件强化学习中长程任务信号衰减问题。该方法在 OGBench 基准上平均成功率提升 25 个百分点,相对 HIQL 基线改善 73%,并超越最强固定 k 方法 OTA 7 个百分点。

来源:arXiv cs.AI · arxiv.org