机构
*
University of Southern California(南加州大学)
;
Iowa State University(爱荷华州立大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
UT Austin(德克萨斯大学奥斯汀分校)
;
Independent Researcher(独立研究员)
;
University of Notre Dame(圣母大学)
The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model
中性面具:RLHF如何提供浅层对齐而保留大语言模型中的党派结构
Wendy K. Tam
机构
*
Vanderbilt University(范德堡大学)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
National Center for Supercomputing Applications(国家超级计算应用中心)
TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue
TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化
Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang
机构
*
Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所)
;
MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心)
;
College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
;
Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院)
;
State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室)
;
Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)
ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs
ADAPT: 通过偏好调优实现注意力动态对齐以增强多模态大模型的忠实性
Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Huawei Technologies Ltd.(华为技术有限公司)
;
State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民网传播内容认知国家重点实验室)