Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
人为区域适应于多模态视觉-语言模型
Samuel Cahyawijaya, Peerat Limkonchotiwat, Tack Hwa Wong, Hitesh Laxmichand Patel, Amit Agarwal, Manuel Antonio Rufino, Carlos Rafael Catalan, Muhammad Reza Qorib, Vicky Feliren, Holy Lovenia, Aye Hninn Khine, Frederikus Hudi, David Anugraha, Alham Fikri Aji, Romrawin Chumpu, Viet-Thanh Pham, Minghan Wang, Mohamed Fazli Imam, Ruochen Zhang, Joseph Marvin Imperial, Khumaisa Nur'aini, Do Xuan Long, Musa Izzanardi Wijanarko, Joel Ruben Antony Moniz, Patrick Amadeus Irawan, Hanif Muhammad Zhafran, Isaiah Flores, Salsabila Zahirah Pranida, Jun Kevin, Jostin Jerico Rosal, Patricia Nicole Monderin, Kun Kerdthaisong, Ahmad Mustafid, My Chiffon Nguyen, Natchapon Jongwiriyanurak, Siva Worajitwannakul, Haochen Li, Adrian Xuan Wei Lim, Bin Wang, Muhammad Ravi Shulthan Habibi, Lynnette Hui Xian Ng, Mithil Bangera, Yeshil Bangera, Priyaranjan Pattnayak, Dun Li Chan, Sherissa Caren Djuniwar, Cho Chan Myei Oo, Hee Ming Shan
机构
*
Cohere
;
SEACrowd
;
AI Singapore
;
Universiti Teknologi PETRONAS
;
Oracle
;
Carnegie Mellon University(卡内基梅隆大学)
;
Monash University, Indonesia(莫纳什大学(印尼))
;
King Mongkut’s University of Technology Thonburi(泰国孔敬大学)
;
Nara Institute of Science and Technology(奈良科学技術大學)
;
Stanford University(斯坦福大学)
;
MBZUAI
;
National University of Singapore(新加坡国立大学)
;
Monash University, Australia(莫纳什大学(澳大利亚))
;
Brown University(布朗大学)
;
University of Bath(巴斯大学)
;
Mila - Quebec AI Institute(蒙特利尔AI研究所)
;
Institut Teknologi Bandung(Bandung 工程技术大学)
;
Ateneo de Manila University(马尼拉亚特内奥大学)
;
Universitas Pelita Harapan(Pelita Harapan 大学)
;
Seoul National University of Science and Technology(首尔科学技术大学)
;
Thammasat University(泰国 Thammasat 大学)
;
Independent(独立)
;
University College London(伦敦大学学院)
;
Nanyang Technological University(南洋理工大学)
;
MiroMind AI
;
University of Indonesia(印度尼西亚大学)
;
University of New Haven(纽黑文大学)
;
INTI International University and Colleges(INTI 国际大学和学院)
;
Binus University(Binus 大学)
;
National University Philippines(菲律宾国家大学)
;
ThoughtFull
ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling
ForestPrune: 通过时空森林建模实现视频多模态大语言模型的高比率视觉令牌压缩
Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji
机构
*
Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)
;
National University of Defense Technology(国防科技大学)
专题命中
VLM训练与架构
:multimodal large language model(title);LLaVA(abstract);分类 cs.CV、cs.AI
A Patch-based Cross-view Regularized Framework for Backdoor Defense in Multimodal Large Language Models
基于补丁的跨视图正则化框架用于多模态大语言模型中的后门防御
Tianmeng Fang, Yong Wang, Zetai Kong, Zengzhen Su, Jun Wang, Chengjin Yu, Wei Wang
机构
*
Singapore Management University(新加坡管理大学)
;
China University of Mining and Technology(中国矿业大学)
;
The University of Melbourne(墨尔本大学)
;
Anhui University(安徽大学)
;
Xi’an Jiaotong University(西安交通大学)
;
Sun Yat-sen University(中山大学)
专题命中
VLM训练与架构
:multimodal large language model(title,abstract);分类 cs.CV、cs.LG
机构
*
The Open University of China(中国开放大学)
;
Engineering Research Center of Integration and Application of Digital Learning Technology, Ministry of Education(数字化学习技术集成与应用教育部工程研究中心)
;
OUC-online(国开在线)
专题命中
VLM训练与架构
:vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI
Fairness-Aware Fine-Tuning of Vision-Language Models for Medical Glaucoma Diagnosis
面向医疗青光眼诊断的公平性感知视觉语言模型微调
Zijian Gu, Yuxi Liu, Zhenhao Zhang, Song Wang
机构
*
Department of Computer Science, University of Rochester, NY, USA(罗切斯特大学计算机科学系)
;
Biostatistics and Health Data Science, School of Medicine, Indiana University, Indianapolis, IN, USA(印第安纳大学医学院生物统计学与健康数据科学系)
;
Department of Computer Science, University of Central Florida, FL, USA(佛罗里达州立大学计算机科学系)
3D Modality-Aware Pre-training for Vision-Language Model in MRI Multi-organ Abnormality Detection
面向MRI多器官异常检测的3D模态感知预训练
Haowen Zhu, Ning Yin, Xiaogen Zhou
机构
*
School of Electronic, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子电气工程学院)
;
School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院)
;
Department of Medical Imaging, Suzhou Traditional Chinese Medicine Hospital, China(苏州中医医院影像科)
MOSAIC: A Unified Platform for Cross-Paradigm Comparison and Evaluation of Homogeneous and Heterogeneous Multi-Agent RL, LLM, VLM, and Human Decision-Makers
MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台
Abdulhamid M. Mousa, Yu Fu, Rakhmonberdi Khajiev, Jalaledin M. Azzabi, Abdulkarim M. Mousa, Peng Yang, Yunusa Haruna, Ming Liu
机构
*
School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院)
;
School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院)
;
Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)