Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li
机构
*
Imperial College London(帝国理工学院)
;
University College London(伦敦大学学院)
;
SambaNova(桑巴诺瓦公司)
;
KAUST(阿卜杜拉国王科技大学)
;
Stanford University(斯坦福大学)
;
University of Oxford(牛津大学)
;
University of Waterloo(滑铁卢大学)
;
RadixArk(基数方舟公司)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI
Learning More from Less: Reinforcement Learning from Hindsight
从更少中学习更多:事后诸葛亮式强化学习
Iris Xu, Sunshine Jiang, John Marangola, Nitish Dashora, Richard Li, Thomas Liu, Zexue He, Yuheng Zhi, Alex Pentland, Pulkit Agrawal, Zhang-Wei Hong
机构
*
Massachusetts Institute of Technology(麻省理工学院)
;
MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室)
;
Stanford University(斯坦福大学)
;
University of California, San Diego(加利福尼亚大学圣地亚哥分校)
机构
*
School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系)
;
Ant International, Ant Group(蚂蚁集团蚂蚁国际)
;
Shanghai Innovation Institute(上海创新研究院)
;
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
机构
*
National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家级重点实验室)
;
Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)
;
MiLM Plus
;
Xiaomi Inc(小米公司)
;
Zhongguancun Academy(中关村学院)
;
Beijing, China(北京市)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.AI
机构
*
National Engineering Research Center of Software Engineering, Peking University(北京大学软件工程国家工程研究中心)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室)
;
GRG Banking Equipment Co., Ltd.(广电运通金融电子股份有限公司)
;
Center on Frontiers of Computing Studies, Peking University(北京大学计算前沿研究中心)
;
Peking University Information Technology Institute (Tianjin Binhai)(北京大学(天津滨海)信息技术研究院)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.LG
PepALD: Macrocyclic Peptide Generation via Autoregressive Latent Diffusion
PepALD: 通过自回归潜在扩散生成大环肽
Junming Zhang, Siyu Yi, Wei Ju, Zhonghui Gu
机构
*
College of Computer Science, Sichuan University(四川大学计算机科学学院)
;
School of Mathematics, Sichuan University(四川大学数学学院)
;
School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)
;
Lingang Laboratory(临港实验室)
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
Simons Institute for the Theory of Computing(西蒙斯计算理论研究所)
;
Department of Electrical Engineering and Computer Sciences, University of California, Berkeley(加州大学伯克利分校电气工程与计算机科学系)
机构
*
Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队)
;
Renmin University of China(中国人民大学)
;
Peking University(北京大学)
;
ETH Zürich(苏黎世联邦理工学院)
;
University of Zurich(苏黎世大学)
;
The Chinese University of Hong Kong(香港中文大学)
Effective Reinforcement Learning for Agentic Search by Recycling Zero-Variance Queries During Training
通过训练期间回收零方差查询实现智能体搜索的有效强化学习
João Coelho, João Magalhães, Bruno Martins, Chenyan Xiong
机构
*
Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
;
Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学理工学院和INESC-ID)
;
NOVA LINCS, NOVA School of Science and Technology(NOVA科学与技术学院LINCS)
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
S-Lab, Nanyang Technological University(南洋理工大学S实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
University of Science and Technology of China(中国科学技术大学)
;
Stanford University(斯坦福大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
Fudan University(复旦大学)
;
CPII under InnoHK(InnoHK下的CPII)
;
Adobe Research(Adobe研究)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.LG