Energy-Based Reward Models for Robust Language Model Alignment
机构 * Department of Computer Science(计算机科学系) ; Purdue University(普渡大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG
Comments Accepted by COLM 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Department of Computer Science(计算机科学系) ; Purdue University(普渡大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG
Comments Accepted by COLM 2025
机构 * Bilibili Inc.(哔哩哔哩公司) ; Xi’an Jiaotong University(西安交通大学) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE)(可信分布式计算与服务重点实验室)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Hawaii at Mānoa(夏威夷大学马诺阿分校)
专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL
机构 * AIM Intelligence(AIM智能研究所) ; University of Seoul(首尔大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; Seoul National University(首尔国立大学) ; Yonsei University(延世大学) ; Korea Institute of Science and Technology(韩国科学技术院) ; Kyung Hee University(庆熙大学)
专题命中 红队测试 :jailbreak(title,abstract);red teaming(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to ACL 2025 (Main Track). Camera-ready version
Journal ref Proc. ACL 2025 (Vol. 1: Long Papers), pp. 16489-16507, Vienna, Austria, 2025
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI
机构 * Nanyang Technological University, Singapore(南洋理工大学) ; National University of Singapore, Singapore(国立新加坡大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
机构 * Xinhui Li(李新会) ; Xiaojie Guo(郭小杰)
专题命中 幻觉与事实性 :alignment(abstract)
机构 * Cisco Systems(思科系统) ; MIT(麻省理工学院) ; Unify Dynamics ; Tata Consultancy Services(塔塔咨询公司) ; CMU(卡内基梅隆大学)
专题命中 隐私与版权 :trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.CY、cs.LG
Comments 15 pages main text, 4 figures, 1 table
Journal ref Commun Med 5, 332 (2025)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
Comments 25 pages
机构 * Fangyi Yu
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
机构 * URA Research Group, Ho Chi Minh City University of Technology (HCMUT), Vietnam ; Ho Chi Minh City International University (HCMIU), Vietnam ; University of South-Eastern Norway, Norway ; Japan Advanced Institute of Science ; Univ. Bordeaux, CNRS, Bordeaux INP, LaBRI, UMR 5800, F-33400 Talence, France ; University of Naples Parthenope, Italy ; VNU Information Technology Institute, Vietnam National University, Vietnam ; Visual Intelligence Lab, School of Computer Science \& Insight Center for Data Analyitcs, University of Galway, Ireland ; Sapienza University of Rome, Italy
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments The XAI Challenge @ TRNS-AI Workshop, IJCNN 2025: Explainable AI for Educational Question Answering. Website: https://sites.google.com/view/trns-ai/challenge/
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory, China(鹏城实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
Comments 8 pages (excluding references), accepted by Findings of ACL 2025
Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pages 2762-2778, July 2025, Vienna, Austria
专题命中 安全评测 :safety(abstract);分类 cs.LG
Comments published at Transactions on Machine Learning Research (TMLR)
机构 * University of California San Diego(加州大学圣地亚哥分校) ; Plaksha University(Plaksha大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of South Florida(佛罗里达州立大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
Comments Accepted at IEEE International Conference on Robotics and Automation (ICRA) 2025. Author Accepted Manuscript
机构 * IBM Research(IBM研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
专题命中 安全评测 :safety(abstract);分类 cs.CL
Comments 20 pages
专题命中 安全评测 :safety(abstract);分类 cs.CL
专题命中 安全评测 :safety(abstract);分类 cs.CY
Comments Accepted to AIES 2024 proceedings
机构 * Karlsruhe Institute of Technology, Karlsruhe, Germany(卡尔斯鲁厄理工学院) ; Helmholtz Information and Data Science School for Health, Germany(海德堡信息与数据科学健康学校) ; Department of Nuclear Medicine, University of Duisburg-Essen(杜伊斯堡-埃森大学核医学系) ; German Cancer Consortium (DKTK)- University Hospital Essen, Essen, Germany(德国癌症研究中心(DKTK)-埃森大学医院)
专题命中 安全评测 :alignment(abstract)
Comments Accepted at 16th MICCAI Workshop on Machine Learning in Medical Imaging (MLMI2025)
机构 * Department of Electrical Engineering and Computer Science, University of California, Irvine(电气工程与计算机科学系,加州大学伊文斯顿分校)
专题命中 安全评测 :safety(abstract)
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Tencent AI Lab(腾讯人工智能实验室)
专题命中 安全评测 :alignment(abstract)
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 安全评测 :alignment(abstract)
机构 * Johannes Kepler University (JKU)(约翰内斯·开普勒大学) ; Linz Institute of Technology (LIT)(林茨技术研究所) ; University of Innsbruck(因斯布鲁克大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
Comments Under Review
机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学) ; School of Business, Jiangnan University(商学院,江南大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
Comments A shorter conference version is published in IJCAI 2025, titled 'Game Theory Meets Large Language Models: A Systematic Survey'
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Waterloo(滑铁卢大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted in UIST 2025
机构 * University of Michigan(密歇根大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI
Comments ACM ASSETS 2025