Reasoning-Aligned Perception Decoupling for Scalable Multi-modal Reasoning
面向可扩展多模态推理的推理对齐感知解耦
Yunhao Gou, Kai Chen, Zhili Liu, Lanqing Hong, Xin Jin, Zhenguo Li, James T. Kwok, Yu Zhang
机构
*
Southern University of Science and Technology(南方科技大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Huawei Noah’s Ark Lab(华为诺亚实验室)
;
Huawei Cloud Project(华为云项目)
LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models
LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全
Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen
机构
*
Southeast University(东南大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Zhejiang University of Technology(浙江工业大学)
;
Tsinghua University(清华大学)
;
RealAI
MGCR-Net:Multimodal Graph-Conditioned Vision-Language Reconstruction Network for Remote Sensing Change Detection
MGCR-Net:多模态图条件视觉-语言重建网络用于遥感变化检测
Chengming Wang, Guodong Fan, Jinjiang Li, Min Gan, C. L. Philip Chen
机构
*
School of Computer Science and Technology, Shandong Technology and Business University(山东科技职业大学计算机科学与技术学院)
;
School of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院)
;
School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)
Dynamic Pyramid Network for Efficient Multimodal Large Language Model
动态金字塔网络用于高效多模态大语言模型
Hao Ai, Kunyi Wang, Zezhou Wang, Hao Lu, Jin Tian, Yaxin Luo, Peng Xing, Jen-Yuan Huang, Huaxia Li, Gen luo
机构
*
Beihang University(北航大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
KAUST(卡塔尔大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Technical University Of Denmark(丹麦技术大学)
;
Nanjing University of Science and Technology(南京理工大学)
;
Peking University(北京大学)
;
Xiaohongshu Inc(小红书公司)
CIEC: Coupling Implicit and Explicit Cues for Multimodal Weakly Supervised Manipulation Localization
CIEC: 通过隐式和显式线索耦合实现多模态弱监督操作定位
Xinquan Yu, Wei Lu, Xiangyang Luo, Rui Yang
机构
*
School of Computer Science and Engineering(计算机科学与工程学院)
;
MoE Key Laboratory of Information Technology(信息技术关键实验室)
;
Key Laboratory of Information Security Technology(信息安全技术重点实验室)
;
Sun Yat-sen University(中山大学)
;
State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)
;
Alibaba Group(阿里巴巴集团)
机构
*
State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Aerospace Information Research Institute(航天信息研究所)
;
Chinese Academy of Sciences(中国科学院)
;
School of Geographical Sciences(地理科学学院)
;
Hunan Normal University(湖南师范大学)
SCMM: Calibrating Cross-modal Representations for Text-Based Person Search
SCMM:基于文本的人脸搜索的跨模态表示校准
Jing Liu, Donglai Wei, Yang Liu, Sipeng Zhang, Tong Yang, Wei Zhou, Weiping Ding, Victor C. M. Leung
机构
*
College of Future Information Technology, Fudan University(复旦大学未来信息技术学院)
;
Department of Electrical and Computer Engineering, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系)
;
College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院)
;
MEGVII Technology(MEGVII技术)
;
School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)
;
School of AI and CS, Nantong University(南通大学人工智能与计算机科学学院)
;
Academy of Artificial Intelligence, SMBU(SMBU人工智能学院)
;
College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
From Classification to Cross-Modal Understanding: Leveraging Vision-Language Models for Fine-Grained Renal Pathology
Zhenhao Guo, Rachit Saluja, Tianyuan Yao, Quan Liu, Junchao Zhu, Haibo Wang, Daniel Reisenbüchler, Yuankai Huo, Benjamin Liechty, David J. Pisapia, Kenji Ikemura, Steven Salvatoree, Surya Seshane, Mert R. Sabuncu, Yihe Yang, Ruining Deng
机构
*
New York University(纽约大学)
;
Cornell Tech(康奈尔科技)
;
Vanderbilt University(范德比大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of Regensburg(莱茵河畔大学)
;
Weill Cornell Medicine(韦尔·科恩医学中心)
;
Northwell Health(北well健康)
GeoLLaVA-8K: Scaling Remote-Sensing Multimodal Large Language Models to 8K Resolution
Fengxiang Wang, Mingshuo Chen, Yueying Li, Di Wang, Haotian Wang, Zonghao Guo, Zefan Wang, Boqi Shan, Long Lan, Yulin Wang, Hongzhen Wang, Wenjing Yang, Bo Du, Jing Zhang
机构
*
College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院)
;
Beijing University of Posts and Telecommunications, China(北京邮电大学)
;
School of Computer Science, Wuhan University, China(武汉大学计算机学院)
;
Zhongguancun Academy, China(中关村学院)
;
Tsinghua University, China(清华大学)
;
Beihang University, China(北航大学)
专题命中
图文多模态
:multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CV
Defending Multimodal Backdoored Models by Repulsive Visual Prompt Tuning
Zhifang Zhang, Shuo He, Haobo Wang, Bingquan Shen, Lei Feng
机构
*
Southeast University(东南大学)
;
University of Queensland(昆士兰大学)
;
Nanyang Technological University(南洋理工大学)
;
Zhejiang University(浙江大学)
;
National University of Singapore(新加坡国立大学)
DistilCLIP-EEG: Enhancing Epileptic Seizure Detection Through Multi-modal Learning and Knowledge Distillation
Zexin Wang, Lin Shi, Haoyu Wu, Junru Luo, Xiangzeng Kong, Jun Qi
机构
*
Aliyun School of Big Data, Changzhou University(阿里云大数据学院,长洲大学)
;
Department of Computing, Xi’an JiaoTong-Liverpool University(计算系,西安交通大学-利物浦大学)
;
Department of Computer Science, University of Liverpool(计算机科学系,利物浦大学)
;
Center for Artificial Intelligence in Agriculture, Fujian Agriculture and Forestry University(农业人工智能中心,福建农林大学)