AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty
AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法
Yan Ma, Lizhuo Zhang
机构
*
School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院)
;
School of Education, Hunan Agricultural University(湖南农业大学教育学院)
;
School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)
Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?
Shuo Liu, Di Yao, Yan Lin, Gao Cong, Jingping Bi
机构
*
University of Chinese Academy of Sciences(中国科学院大学)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
Department of Computer Science, Aalborg University(奥胡斯大学计算机科学系)
;
College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs
Sheng Zhang, Yanbo Xu, Naoto Usuyama, Hanwen Xu, Jaspreet Bagga, Robert Tinn, Sam Preston, Rajesh Rao, Mu Wei, Naveen Valluri, Cliff Wong, Andrea Tupini, Yu Wang, Matt Mazzola, Swadheen Shukla, Lars Liden, Jianfeng Gao, Angela Crabtree, Brian Piening, Carlo Bifulco, Matthew P. Lungren, Tristan Naumann, Sheng Wang, Hoifung Poon
专题命中
图文多模态
:multimodal(title,abstract);image-text(title,abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL
VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence
VLT:用于工业智能的视觉-语言-时间序列多模态基础模型
Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren
机构
*
School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院)
;
Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)
;
State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室)
;
School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)
专题命中
图文多模态
:multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.AI
机构
*
Hubei Key Laboratory of Transportation Internet of Things, Wuhan University of Technology(武汉理工大学交通物联网湖北省重点实验室)
;
State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理全国重点实验室)
Red-teaming the Multimodal Reasoning: Jailbreaking Vision-Language Models via Cross-modal Entanglement Attacks
多模态推理的红队测试:通过跨模态纠缠攻击劫持视觉-语言模型
Yu Yan, Sheng Sun, Shengjia Cheng, Teli Liu, Mingfeng Li, Min Liu
机构
*
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
People’s Public Security University of China(中国人民公安大学)