In-Context Reinforcement Learning From Suboptimal Historical Data
基于次优历史数据的上下文强化学习
机构 * Department of Electrical and Computer Engineering, Duke University, Durham, US(电气与计算机工程系,杜克大学,达勒姆,美国) ; Department of Biostatistics and Bioinformatics, Duke University, Durham, US(生物统计学与生物信息学系,杜克大学,达勒姆,美国) ; Department of Statistics and Data Science, Yale University, New Haven, US(统计学与数据科学系,耶鲁大学,新 Haven,美国)
AI总结 DIT框架通过结合价值函数估计和加权最大似然估计,有效提升在次优历史数据下的强化学习性能。
Comments Accepted to Forty-Second International Conference on Machine Learning (ICML2025)