机构
*
National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术实验室,南京大学)
;
School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学)
专题命中
后训练与偏好优化
:RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
CommentsNeurIPS 2025; The first two authors contributed equally
LLaDA 1.5: Variance-Reduced Preference Optimization for Large Language Diffusion Models
Fengqi Zhu, Rongzhen Wang, Shen Nie, Xiaolu Zhang, Chunwei Wu, Jun Hu, Jun Zhou, Jianfei Chen, Yankai Lin, Ji-Rong Wen, Chongxuan Li
机构
*
Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院)
;
Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室)
;
Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心)
;
Tsinghua University(清华大学)
;
Ant Group(蚂蚁集团)
RPO: Retrieval Preference Optimization for Robust Retrieval-Augmented Generation
Shi-Qi Yan, Quan Liu, Zhen-Hua Ling
机构
*
National Engineering Research Center of Speech and Language Information Processing, University of Science and Technology of China(语音与语言信息处理国家工程研究中心,中国科学技术大学)
;
State Key Laboratory of Cognitive Intelligence, iFLYTEK Research(认知智能国家重点实验室,iFLYTEK研究院)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
SEE-DPO: Self Entropy Enhanced Direct Preference Optimization
Shivanshu Shekhar, Shreyas Singh, Tong Zhang
机构
*
Siebel School of Computing and Data Science(计算与数据科学学院)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Fractal AI Research(Fractal AI研究院)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
机构
*
National University of Singapore(新加坡国立大学)
;
Fudan University(复旦大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Eastern Institute of Technology(东方技术研究所)
机构
*
School of Engineering, Westlake University, Hangzhou, China(西湖大学工程学院)
;
School of Cyberspace Security, Nanjing University of Science and Technology, Nanjing, China(南京理工大学网络安全学院)
专题命中
后训练与偏好优化
:preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
;
Peking University(北京大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Tsinghua University(清华大学)
专题命中
后训练与偏好优化
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
RollPacker: Mitigating Long-Tail Rollouts for Fast, Synchronous RL Post-Training
Wei Gao, Yuheng Zhao, Dakai An, Tianyuan Wu, Lunxi Cao, Shaopan Xiong, Ju Huang, Weixun Wang, Siran Yang, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang
机构
*
Hong Kong University of Science and Technology(香港理工大学)
;
Alibaba Group(阿里巴巴集团)
;
Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)
专题命中
后训练与偏好优化
:post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
机构
*
Tsinghua University(清华大学)
;
Meituan(美团)
;
Northeastern University(东北大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Meta AI
;
Wuhan University(武汉大学)
机构
*
Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航天信息安全部门、教育部、网络安全科学与工程学院、武汉大学)
专题命中
后训练与偏好优化
:language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI
CheXPO: Preference Optimization for Chest X-ray VLMs with Counterfactual Rationale
Xiao Liang, Jiawei Hu, Di Wang, Zhi Ma, Lin Zhao, Ronghan Li, Bo Wan, Quan Wang
机构
*
The Key Laboratory of Smart Human-Computer Interaction(智能人机交互关键实验室)
;
Wearable Technology of Shaanxi Province, Xidian University, Xi'an, China(陕西 wearable 技术, 西安电子科技大学, 中国)
;
Nanjing University of Science and Technology(南京理工大学)