机构
*
University of Southern California(南加州大学)
;
Iowa State University(爱荷华州立大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
UT Austin(德克萨斯大学奥斯汀分校)
;
Independent Researcher(独立研究员)
;
University of Notre Dame(圣母大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Baseline-Free Policy Optimization for Neural Combinatorial Optimization
无基线的神经组合优化策略优化
Carlos S. Sepúlveda, Gonzalo A. Ruz
机构
*
Facultad de Ingeniería y Ciencias, Universidad Adolfo Ibáñez(阿道夫·伊瓦涅斯大学工程与科学学院)
;
Dirección de Programas, Investigación y Desarrollo, Armada de Chile(智利海军计划、研究与发展局)
;
Millennium Nucleus for Social Data Science (SODAS)(千禧年社会数据科学核心(SODAS))
;
Millennium Nucleus in Data Science for Plant Resilience (PhytoLearning)(千禧年植物韧性数据科学核心(PhytoLearning))
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Towards Reasonable Molecular Structure Elucidation from Infrared Spectroscopy with Chemical Feedback
基于化学反馈的红外光谱合理分子结构解析研究
Yusen Tan, Hongyu Zhan, Hai-tao Yu, Changxi Chi, Wenjie Du, Jun Xia
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Westlake University(西湖大学)
;
University of Science and Technology of China(中国科学技术大学)
TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models
TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法
Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang
机构
*
Peking University(北京大学)
;
Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
;
University of Science and Technology of China(中国科学技术大学)
;
Southeast University(东南大学)
;
Southern University of Science and Technology(南方科技大学)
;
Beijing University of Aeronautics and Astronautics(北京航空航天大学)
;
Beijing Language and Culture University(北京语言大学)
;
Sichuan University(四川大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)