Learning diverse attacks on large language models for robust red-teaming and safety tuning
针对大语言模型学习多样化攻击以用于鲁棒红队测试与安全调优
Seanie Lee, Minsu Kim, Lynn Cherif, David Dobre, Juho Lee, Sung Ju Hwang, Kenji Kawaguchi, Gauthier Gidel, Yoshua Bengio, Esmeralda S. Whitammer, Moksh Jain
机构
*
KAIST(韩国科学技术院)
;
Mila – Québec AI Institute(米拉-魁北克人工智能研究所)
;
Université de Montréal(蒙特利尔大学)
;
McGill University(麦吉尔大学)
;
National University of Singapore(新加坡国立大学)
;
University of Edinburgh(爱丁堡大学)
;
CIFAR(加拿大高级研究所)
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Wuhan University(武汉大学)
;
University of North Texas(北卡罗来纳州立大学)
;
Fudan University(复旦大学)
MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models
MVC-Bench:医学视觉-语言模型的校准基准测试
Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir, Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan
机构
*
Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学)
;
Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学)
;
Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)
Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych
机构
*
UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI))
;
Zuse School ELIZA(Zuse学院ELIZA)
;
National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
;
Indian Institute of Technology Delhi(印度德里理工学院)
;
Yardi School of Artificial Intelligence(Yardi人工智能学院)
;
University of Louisville(路易斯维尔大学)
;
University of Toledo(托莱多大学)