Trust Region Inverse Reinforcement Learning: Explicit Dual Ascent using Local Policy Updates
信任区域逆强化学习:利用局部策略更新的显式双上升
Anish Diwan, Davide Tateo, Christopher E. Mower, Haitham Bou-Ammar, Jan Peters, Oleg Arenz
机构
*
Technical University of Darmstadt(达姆斯塔特技术大学)
;
Lund University(隆德大学)
;
German Research Center for AI (DFKI)(人工智能研究中心(DFKI))
;
Robotics Institute Germany (RIG)(德国机器人研究所(RIG))
;
Huawei, Noah’s Ark Lab(华为诺亚实验室)
;
University College London(伦敦大学学院)
LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models
LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习
Weibin Liao, Xin Gao, Tianyu Jia, Rihong Qiu, Yifan Zhu, Yang Lin, Xinyu Ma, Junfeng Zhao, Yasha Wang
机构
*
School of Computer Science, Peking University(北京大学计算机科学系)
;
Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室)
;
Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心)
;
National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心)
;
Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海))
;
School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系)
;
Huawei Technologies Co., Ltd(华为技术有限公司)
;
Seed, ByteDance Inc.(字节跳动公司)