今天,读了IN-CONTEXT REINFORCEMENT LEARNING WITH ALGORITHM DISTILLATION。其将强化学习建模成了顺序预测问题,通过历史预测下一个动作,同时历史可以看成context。算法步骤就是通过source RL算法生成数据,然后在给定先前learning history作为context,通过自回归与预测action,来训练causal Trasnformer(这个过程就是文中说地算法蒸馏)。然后,又看了离线强化学习经典论文CQL。
2024-03-20
在牛客打卡4天,今天也很努力鸭!
全部评论

相关推荐

不知道怎么取名字_:看来现在卷的,这种单位都开始提高要求了
点赞 评论 收藏
分享
不愿透露姓名的神秘牛友
03-09 19:13
求你们别卷了的大学生...:你不骂他,我就要骂你了
今天你投了哪些公司?
点赞 评论 收藏
分享
评论
点赞
收藏
分享

创作者周榜

更多
牛客网
牛客网在线编程
牛客网题解
牛客企业服务