UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning
UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用
Feng Zhang, Shijia Li, Chunmao Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu, Han Liu
机构
*
Meituan(美团)
;
Peking University(北京大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Dalian University of Technology(大连理工大学)
Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo, li yuan, Lingling Zhang, Rui Mao, Qika Lin, Jun Liu
机构
*
Xi’an Jiaotong University(西安交通大学)
;
Nanyang Technological University(南洋理工大学)
;
National University of Singapore(国立新加坡大学)
;
South China University of Technology(华南理工大学)
When Single-Agent with Skills Replace Multi-Agent Systems and When They Fail
当单智能体与技能取代多智能体系统以及何时会失败
Xiaoxiao Li
机构
*
Trusted and Efficient AI (TEA) Lab(可信高效人工智能实验室)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Vector Institute(向量研究所)
;
CIFAR AI Chair(CIFAR人工智能 chair)
See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval
看清更多,存储更少:视频时刻检索的内存高效解决方案
Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim
机构
*
Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)
;
Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)