Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型
Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
People’s Public Security University of China(中国人民公安大学)
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
East China Normal University(华东师范大学)
;
The Chinese University of Hong Kong(香港中文大学)
A Vision-Language Foundation Model for Zero-shot Clinical Collaboration and Automated Concept Discovery in Dermatology
一种用于零样本临床协作和皮肤病自动概念发现的视觉-语言基础模型
Siyuan Yan, Xieji Li, Dan Mo, Philipp Tschandl, Yiwen Jiang, Zhonghua Wang, Ming Hu, Lie Ju, Cristina Vico-Alonso, Yizhen Zheng, Jiahe Liu, Juexiao Zhou, Camilla Chello, Jen G. Cheung, Julien Anriot, Luc Thomas, Clare Primiero, Gin Tan, Aik Beng Ng, Simon See, Xiaoying Tang, Albert Ip, Xiaoyang Liao, Adrian Bowling, Martin Haskett, Shuang Zhao, Monika Janda, H. Peter Soyer, Victoria Mar, Harald Kittler, Zongyuan Ge
机构
*
AIM for Health Lab(AIM for Health实验室)
;
Faculty of Information Technology, Monash University(信息技术学院,墨尔本大学)
;
Department of Dermatology, Medical University of Vienna(皮肤科,维也纳医学大学)
;
Faculty of Engineering, Monash University(工程学院,墨尔本大学)
;
Institute of Ophthalmology, University College London(眼科研究所,伦敦大学学院)
;
Dermatology Department. Fundacion Hospital 12 de Octubre(皮肤科部门,12月12日基金会医院)
;
School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))
;
Frazer Institute, The University of Queensland(弗拉泽研究所,昆士兰大学)
;
Dermatology Research Centre, Brisbane, Australia(皮肤科研究中心,澳大利亚布里斯班)
;
Department of Medical and Cardiovascular Sciences, Sapienza University of Rome(医学与心血管科学系,罗马萨皮恩扎大学)
;
Victorian Melanoma Service, Alfred Care Group, Bayside Health, Melbourne, Australia(维多利亚黑色素瘤服务,阿尔弗雷德护理集团,墨尔本布里斯班健康中心,澳大利亚)
;
SkIIN Discovery Program, Monash University(SkIIN发现计划,墨尔本大学)
;
Claude Bernard Lyon-1 University(克劳德·伯纳德里昂-1大学)
;
Centre Léon Berard, Lyon, France(莱昂·贝拉德中心,法国里昂)
;
Dermatology department, Hôpital Lyon Sud, Hospices Civils de Lyon, Lyons, France(皮肤科部门,里昂南医院,里昂民事医院,法国里昂)
;
Cancer Research Center of Lyon, Lyons, France(里昂癌症研究中心,法国里昂)
;
eResearch Centre, Monash University(eResearch研究中心,墨尔本大学)
;
NVIDIA AI Techno(NVIDIA AI技术)
机构
*
School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
;
School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)
ProAPO: Progressively Automatic Prompt Optimization for Visual Classification
ProAPO:逐步自动提示优化用于视觉分类
Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
School of Information Engineering, Minzu University of China(民族大学信息工程学院)
;
University of Science and Technology Beijing(北京科技大学)
MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering
MTBench: 一种多模态时间序列基准,用于时间推理和问答
Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying
机构
*
Yale University, New Haven, CT, USA(耶鲁大学)
;
McGill University, Montreal, QC, Canada(麦吉尔大学)
;
University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)
Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance
通过文本引导增强弱监督多模态视频异常检测
Shengyang Sun, Jiashen Hua, Junyi Feng, Xiaojin Gong
机构
*
School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)
;
Alibaba Cloud(阿里云)
;
College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)
机构
*
Key Laboratory of Image Processing and Intelligent Control, Ministry of Education, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(图像处理与智能控制重点实验室、教育部、自动化学院、华中科技大学)
;
Wuhan Institute of Digital Engineering(武汉数字工程研究所)
;
Shanghai Jiao Tong University(上海交通大学)
Multimodal Priors-Augmented Text-Driven 3D Human-Object Interaction Generation
多模态先验增强的文本驱动3D人-物交互生成
Yin Wang, Ziyao Zhang, Zhiying Leng, Haitian Liu, Frederick W. B. Li, Mu Li, Xiaohui Liang
机构
*
State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)
;
Beihang University(北京航空航天大学)
;
Department of Computer Science, University of Durham(杜伦大学计算机科学系)
;
Zhongguancun Laboratory(中关村实验室)
Interactive LLM-assisted Curriculum Learning for Multi-Task Evolutionary Policy Search
多任务策略搜索中的交互式LLM辅助课程学习
Berfin Sakallioglu, Giorgia Nadizar, Eric Medvet
机构
*
MIGe - University of Trieste(MIGe - 乌迪内大学)
;
University Toulouse Capitole, IRIT - CNRS UMR5505(图卢兹大学,IRIT - CNRS UMR5505)
;
DIA - University of Trieste(DIA - 乌迪内大学)
机构
*
College of Computer Science, Chongqing University(重庆大学计算机科学学院)
;
Heavy Rainfall Research Center of China(中国强降水研究中心)
;
CMA Key Open Laboratory of Transforming Climate Resources to Economy, Chongqing Institute of Meteorological Sciences(中国气象局气候资源转化经济重点开放实验室、重庆气象科学研究院)
;
Chongqing Metropolitan College of Science(重庆科学理工学院)
;
School of Intelligence Science(智能科学学院)
;
College of Artificial Intelligence, Harbin Institute of Technology(人工智能学院、哈尔滨工业大学)
;
BNU-UIC Institute of Artificial Intelligence(北京师范大学-国际学院人工智能与未来网络研究院)
;
Future Networks, Beijing Normal University at Zhuhai(未来网络、北京师范大学珠海分校)