The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning
良性多语言微调的安全影响异质性
Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm, Stratis Tsirtsis, Zihao Fu, Greta Warren, Ryan Brown, Eoin Delaney, Sandra Wachter, Brent Mittelstadt, Chris Russell
CommentsThis work was accepted for presentation at the 32nd IEEE ICE/ITMC Conference, Porto, Portugal, 2026 but was subsequently withdrawn prior to publication due to submission volume limits. It is currently under consideration for publication elsewhere
Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax
基于语义奖励的强化学习实现低资源语言扩展而不产生对齐税
Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang
机构
*
Minzu University of China(中国民族大学)
;
Ant Group(蚂蚁集团)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of Macau(澳门大学)
;
Peking University(北京大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hainan International College, Minzu University of China(中国民族大学海南国际学院)
机构
*
School of Computer Science, Peking University(北京大学计算机科学系)
;
Tongyi Lab, Alibaba Group(阿里集团通义实验室)
;
School of Computer Science, Wuhan University(武汉大学计算机科学系)
Zhanyu Liu, Qingguo Hu, Ante Wang, Chenqing Liu, Zhishang Xiang, Hui Li, Delai Qiu, Jinsong Su
机构
*
School of Informatics, Xiamen University(厦门大学信息学院)
;
Tsinghua University(清华大学)
;
Xiamen Unisound Intelligence Technology Co., Ltd(厦门Unisound智能科技有限公司)
;
Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)
GRAIL: Goal Recognition Alignment through Imitation Learning
GRAIL:通过模仿学习进行目标识别对齐
Osher Elhadad, Felipe Meneguzzi, Reuth Mirsky
机构
*
Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系)
;
Department of Computer Science, Aberdeen University(阿伯丁大学计算机科学系)
;
Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)