Seeing Symbols, Missing Cultures: Probing Vision-Language Models' Reasoning on Fire Imagery and Cultural Meaning
识别符号,缺失文化:探究视觉-语言模型在火 imagery 和文化意义上的推理
Haorui Yu, Yang Zhao, Yijia Chu, Qiufeng Yi
机构
*
Duncan of Jordanstone College of Art & Design (DJCAD), University of Dundee(邓迪大学邓迪艺术与设计学院(DJCAD))
;
Guangzhou Institute of Science and Technology (GZIST)(广州科学技术研究院)
;
Faculty of Arts, Xiamen University(厦门大学艺术学院)
;
University of Birmingham(伯明翰大学)
机构
*
Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))
;
Hong Kong Baptist University, China(香港 Baptist大学)
;
City University of Hong Kong, China(香港城市大学)
Residual Cross-Modal Fusion Networks for Audio-Visual Navigation
残差跨模态融合网络用于音频视觉导航
Yi Wang, Yinfeng Yu, Bin Ren
机构
*
School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院)
;
Joint International Research Laboratory of Silk Road Multilingual Cognitive(丝绸之路多语认知联合国际实验室)
;
School of Mechatronic Engineering and Automation Shanghai University, Shanghai, China(上海大学机电工程与自动化学院)
机构
*
X-LANCE Lab, School of Computer Science, MoE Key Lab of Artificial Intelligence Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学)
;
Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)
;
Peng Cheng Laboratory(鹏城实验室)
;
University of Texas at Austin(德克萨斯大学奥斯汀分校)
;
Tianjin University(天津大学)
;
Hong Kong University of Science and Technology(香港科学大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
Nanyang Technological University(南洋理工大学)
;
Shanghai Innovation Institute(上海创新研究院)
Afri-MCQA: Multimodal Cultural Question Answering for African Languages
Afri-MCQA:面向非洲语言的多模态文化问答
Atnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin A. Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio
机构
*
MBZUAI
;
AI4Bharat
;
Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)
;
Saarland University(萨尔兰大学)
;
Aston University(阿斯顿大学)
;
Addis Ababa University(亚的斯亚贝巴大学)
;
Lesan AI
;
Friedrich-Alexander University(弗里德里希-亚历山大大学)
;
University of Pretoria(比勒陀利亚大学)
;
University of Minneosta -Twin Cities(明尼苏达大学-双城分校)
;
Lelapa AI
;
Tshwane University of Technology(茨瓦内技术大学)
;
Digital Umuganda
;
University of Botswana(博茨瓦纳大学)
;
Mila, McGill University & Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)
MATS: An Audio Language Model under Text-only Supervision
MATS: 一种基于纯文本监督的音频语言模型
Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen
机构
*
Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院))
;
University of Chinese Academy of Sciences, China(中国科学院大学)
See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval
看清更多,存储更少:视频时刻检索的内存高效解决方案
Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim
机构
*
Department of Artificial Intelligence, Chung-Ang University(人工智能系, Chung-Ang 大学)
;
Electronics and Telecommunications Research Institute (ETRI)(电子与电信研究院)
GI-Bench: A Panoramic Benchmark Revealing the Knowledge-Experience Dissociation of Multimodal Large Language Models in Gastrointestinal Endoscopy Against Clinical Standards