机构
*
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
Xi’an Jiaotong University(西安交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Tsinghua University(清华大学)
;
Huazhong University of Science and Technology(华中科技大学)
机构
*
Ruhr University Bochum(波鸿鲁尔大学)
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
University of Liverpool(利物浦大学)
专题命中
后训练与偏好优化
:language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)
Co-Evolution of Policy and Internal Reward for Language Agents
语言代理中策略与内部奖励的共演化
Xinyu Wang, Hanwei Wu, Jingwei Song, Shuyuan Zhang, Jiayi Zhang, Fanqi Kong, Tung Sum Thomas Kwok, Xiao-Wen Chang, Yuyu Luo, Chenglin Wu, Bang Liu
机构
*
McGill University(麦吉尔大学)
;
McMaster University(麦克马斯特大学)
;
The University of Hong Kong(香港大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Peking University(北京大学)
;
University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
;
DeepWisdom(深度智慧)
;
Université de Montréal(蒙特利尔大学)
;
Mila(米拉研究所)
专题命中
后训练与偏好优化
:language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
机构
*
Ant Group(蚂蚁集团)
;
Renmin University of China(中国人民大学)
;
Zhejiang University(浙江大学)
;
Westlake University(西湖大学)
;
HongKong University of Science and Technology(香港科学与技术大学)
专题命中
后训练与偏好优化
:language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)
AVC-DPO: Aligned Video Captioning via Direct Preference Optimization
Jiyang Tang, Hengyi Li, Yifan Du, Wayne Xin Zhao
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
;
College of Artificial Intelligence, Nankai University(南开大学人工智能学院)
;
School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)