机构
*
State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
;
State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training
对齐的艺术:细调方法如何有效地对齐和重新对齐训练后的LLM
Rui Zhang, Hongwei Li, Yun Shen, Xinyue Shen, Wenbo Jiang, Guowen Xu, Yang Liu, Michael Backes, Yang Zhang
机构
*
University of Electronic Science and Technology of China(电子科技大学)
;
Flexera
;
CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)
;
Nanyang Technological University(南洋理工大学)
RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment
RE-PO:一种用于大语言模型对齐的鲁棒增强策略优化通用框架
Xiaoyang Cao, Zelai Xu, Mo Guang, Kaiwen Long, Michiel A. Bakker, Yu Wang, Chao Yu
机构
*
IDSS, Massachusetts Institute of Technology(IDSS,麻省理工学院)
;
EE, Tsinghua University(电子工程系,清华大学)
;
Li Auto Inc.(力汽车公司)
;
SIGS, Tsinghua University(系统工程系,清华大学)
Path Drift in Large Reasoning Models:How First-Person Commitments Override Safety
Yuyi Huang, Runzhe Zhan, Lidia S. Chao, Ailin Tao, Derek F. Wong
机构
*
The Second Affiliated Hospital, Guangdong Provincial Key Laboratory of Allergy and Clinical Immunology, Guangzhou Medical University(广东省过敏与临床免疫学重点实验室,广州医科大学第二附属医院)
;
NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系NLP2CT实验室)
Free Lunch Alignment of Text-to-Image Diffusion Models without Preference Image Pairs
Jia Jun Cheng Xian, Muchen Li, Haotian Yang, Xin Tao, Pengfei Wan, Leonid Sigal, Renjie Liao
机构
*
University of British Columbia(不列颠哥伦比亚大学)
;
Vector Institute for AI(人工智能向量研究所)
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
;
Kling Team, Kuaishou Technology(快手科技 Kling 团队)
;
NSERC CRC Chair(加拿大NSERC CRC主席)
Mitigating Reward Over-optimization in Direct Alignment Algorithms with Importance Sampling
Phuc Minh Nguyen, Ngoc-Hieu Nguyen, Duy H. M. Nguyen, Anji Liu, An Mai, Binh T. Nguyen, Daniel Sonntag, Khoa D. Doan
机构
*
VinUniversity(文大学)
;
VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心)
;
University of Stuttgart(斯图加特大学)
;
University of California Los Angeles (UCLA)(加州大学洛杉矶分校)
;
International University - VNUHCM(国际大学 - VNUHCM)
;
University of Science - VNUHCM(科学大学 - VNUHCM)
;
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
Oldenburg University(奥尔登堡大学)
;
Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校)