Re-purposing SAM into Efficient Visual Projectors for MLLM-Based Referring Image Segmentation
机构 * Zhejiang University(浙江大学)
专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
机构 * Zhejiang University(浙江大学)
专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI
专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.MM
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 14 pages 7 images 2 tables
Journal ref 11760_2025_4734_Article
机构 * Institute of Neuroinformatics University of Zurich and ETH Zurich(神经信息学研究所(苏黎世大学和苏黎世联邦理工学院)) ; Digital Society Initiative University of Zurich(数字社会倡议(苏黎世大学))
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
机构 * Li Auto Inc.(力汽车公司) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
机构 * Inria(法国国家信息与自动化技术研究所) ; Université Côte d’Azur(蔚蓝海岸大学) ; PhySense(PhySense公司) ; Department of Information and Communication Technologies(信息与通信技术系) ; Universitat Pompeu Fabra(庞培法布拉大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI