Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning
Guozhi Liu, Qi Mu, Tiansheng Huang, Xinhua Wang, Li Shen, Weiwei Lin, Zhang Li
机构
*
School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)
;
School of Computer Science at Georgia Institute of Technology(佐治亚理工学院计算机科学系)
;
School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)
;
Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院)
;
China and Pengcheng Laboratory(中 Pengcheng 实验室)
The 2025 OpenAI Preparedness Framework does not guarantee any AI risk mitigation practices: a proof-of-concept for affordance analyses of AI safety policies
Sam Coggins, Alexander K. Saeri, Katherine A. Daniell, Lorenn P. Ruster, Jessie Liu, Jenny L. Davis
Unlocking LLM Safeguards for Low-Resource Languages via Reasoning and Alignment with Minimal Training Data
Zhuowei Chen, Bowei Zhang, Nankai Lin, Tian Hou, Lianxi Wang
机构
*
Guangdong University of Foreign Studies(广东外语外贸大学)
;
Guangzhou Key Laboratory of Multilingual Intelligent Processing(广州多语智能处理重点实验室)
;
University of Pittsburgh(匹兹堡大学)
机构
*
Peking University(北京大学)
;
Northeastern University(东北大学)
;
Sydney Smart Technology College(悉尼智能技术学院)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
The State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室)
Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs
Suyang Xi, Chenxi Yang, Hong Ding, Yiqing Ni, Catherine C. Liu, Yunhao Liu, Chengqi Zhang
机构
*
Emory University(埃默里大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
University of Illinois Chicago(伊利诺伊大学香槟分校)
;
The Hong Kong Polytechnic University(香港理工大学)
机构
*
Nanjing University of Information Science \& Technology Nanjing China
;
East China Normal University Shanghai China
;
The Hong Kong University of Science
;
Brown University Providence America
;
Southwest Jiaotong University Chengdu China
;
Nanjing University of Information Science \& Technology
;
East China Normal University
;
Brown University
;
Southwest Jiaotong University
专题命中
安全评测
:alignment(abstract);分类 cs.CL、cs.AI
Comments10 pages, 5 figures, accepted to appear in the Proceedings of the 33rd ACM International Conference on Multimedia (MM '25)
机构
*
Department of Computer Science, Northwestern University(西北大学计算机科学系)
;
Department of Computer Science and Engineering, Texas A&M University(德克萨斯农工大学计算机科学与工程系)
;
Department of Computer Science, Illinois Institute of Technology(伊利诺伊理工学院计算机科学系)
;
Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系)
;
Department of Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系)
;
Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电气工程与计算机科学系)
;
Department of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系)
;
Department of Medicine at Brigham and Women’s Hospital and Harvard Medical School(布里格姆和妇女医院及哈佛医学院医学系)
Retrieval is Not Enough: Enhancing RAG Reasoning through Test-Time Critique and Optimization
Jiaqi Wei, Hao Zhou, Xiang Zhang, Di Zhang, Zijie Qiu, Wei Wei, Jinzhe Li, Wanli Ouyang, Siqi Sun
机构
*
Zhejiang University(浙江大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
South China University of Technology(华南理工大学)
;
University of British Columbia(不列颠哥伦比亚大学)
;
Fudan University(复旦大学)
;
University of Hong Kong(香港大学)
PACEbench: A Framework for Evaluating Practical AI Cyber-Exploitation Capabilities
Zicheng Liu, Lige Huang, Jie Zhang, Dongrui Liu, Yuan Tian, Jing Shao
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
SS-DPPN: A self-supervised dual-path foundation model for the generalizable cardiac audio representation
Ummy Maria Muna, Md Mehedi Hasan Shawon, Md Jobayer, Sumaiya Akter, Md Rakibul Hasan, Md. Golam Rabiul Alam
机构
*
Department of Computer Science and Engineering(计算机科学与工程系)
;
BRAC University(布拉克大学)
;
Department of Electricial and Electronic Engineering(电气与电子工程系)
;
Department of Biomedical Engineering(生物医学工程系)
;
Linköping University(林肯堡大学)
;
Department of Electrical and Computer Engineering(电气与计算机工程系)
;
University of Maryland(马里兰大学)
;
School of Electrical Engineering, Computing and Mathematical Sciences(电气工程、计算与数学科学学院)
DITING: A Multi-Agent Evaluation Framework for Benchmarking Web Novel Translation
Enze Zhang, Jiaying Wang, Mengxi Xiao, Jifei Liu, Ziyan Kuang, Rui Dong, Eric Dong, Sophia Ananiadou, Min Peng, Qianqian Xie
机构
*
School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)
;
Center for Language and Information Research, Wuhan University(武汉大学语言信息研究中心)
;
Jiangxi Normal University(江西师范大学)
;
The University of Manchester(曼彻斯特大学)
;
Yunnan Trrans Technology Co., Ltd.(云南翻译技术有限公司)
;
Malvern College Chengdu(成都马尔伯学院)
MFTCXplain: A Multilingual Benchmark Dataset for Evaluating the Moral Reasoning of LLMs through Multi-hop Hate Speech Explanation
Jackson Trager, Francielle Vargas, Diego Alves, Matteo Guida, Mikel K. Ngueajio, Ameeta Agrawal, Yalda Daryani, Farzan Karimi-Malekabadi, Flor Miriam Plaza-del-Arco
机构
*
University of Southern California(南加州大学)
;
São Paulo State University(圣保罗州立大学)
;
Saarland University(萨尔兰大学)
;
University of Melbourne(墨尔本大学)
;
Howard University(霍华德大学)
;
Portland State University(波特兰州立大学)
;
Leiden University(莱顿大学)
专题命中
安全评测
:alignment(abstract);分类 cs.CL
CommentsJackson Trager and Francielle Vargas contributed equally
Journal refFindings of the Association for Computational Linguistics: EMNLP 2025
Leveraging Large Language Models for Cybersecurity Risk Assessment -- A Case from Forestry Cyber-Physical Systems
Fikret Mert Gultekin, Oscar Lilja, Ranim Khojah, Rebekka Wohlrab, Marvin Damschen, Mazen Mohamad
机构
*
Chalmers University of Technology(楚德斯技术大学)
;
University of Gothenburg(哥德堡大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
RISE Research Institutes of Sweden(瑞典RISE研究机构)
专题命中
安全评测
:safety(abstract);分类 cs.AI
CommentsAccepted at Autonomous Agents in Software Engineering (AgenticSE) Workshop, co-located with ASE 2025