arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-24 至 2026-02-24 共收录 8 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2511.15690 2026-02-24 cs.CV cs.CL 84%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18811 2026-02-24 cs.CV 79%

Learning Multi-Modal Prototypes for Cross-Domain Few-Shot Object Detection

跨域少样本目标检测中的多模态原型学习

Wanqi Wang, Jingcai Guo, Yuxiang Cai, Zhi Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学) The University of Southern Queensland(昆士兰大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出LMP方法,通过结合文本和视觉信息,提升跨域少样本目标检测的精度和性能。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14979 2026-02-24 cs.CV cs.AI 73%

From Pixels to Words -- Towards Native Vision-Language Primitives at Scale

从像素到词语 -- 向大规模原生视觉-语言原始语义迈进

Haiwen Diao, Mingxuan Li, Silei Wu, Linjun Dai, Xiaohua Wang, Hanming Deng, Lewei Lu, Dahua Lin, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院) Xi’an Jiaotong University(西安交通大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 NEO通过原生视觉-语言基础构建,实现了从零开始的视觉感知发展,有效缓解了视觉-语言冲突,推动了大规模原生VLM的发展。

Comments 21 pages, 8 figures, Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16175 2026-02-24 cs.CV cs.AI 62%

Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight

Mantis:一种具有解耦视觉前瞻性能力的多功能视觉-语言-动作模型

Yi Yang, Xueqi Li, Yiyang Chen, Jin Song, Yihan Wang, Zipeng Xiao, Jiadi Su, You Qiaoben, Pengfei Liu, Zhijie Deng

机构 * SJTU(上海交通大学) SII(上海信息所) SUSTech(四川大学) NJUPT(南京工业大学) FDU(福建大学) BOSCH(博世)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 Mantis通过解耦视觉前瞻性模块提升视觉-语言-动作模型的性能,实现高成功率和快速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19418 2026-02-24 cs.CV 57%

PA-Attack: Guiding Gray-Box Attacks on LVLM Vision Encoders with Prototypes and Attention

PA-Attack: 通过原型和注意力引导LVLM视觉编码器的灰盒攻击

Hefei Mei, Zirui Wang, Chang Xu, Jianyuan Guo, Minjing Dong

机构 * City University of Hong Kong(香港城市大学) The University of Sydney(悉尼大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 PA-Attack通过原型和注意力机制提升灰盒攻击效果,实现对LVLM视觉编码器的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06820 2026-02-24 cs.CV cs.LG 57%

Efficient Discriminative Joint Encoders for Large Scale Vision-Language Reranking

大规模视觉-语言重排序的高效判别联合编码器

Mitchell Keren Taraday, Shahaf Wagner, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本·古里安内盖夫大学INSIGHT实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 EDJE通过离线预计算和轻量级注意力适配器,实现了高效视觉-语言重排序,显著降低存储和计算成本,提升大规模检索性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15886 2026-02-24 cs.CV 57%

RangeSAM: On the Potential of Visual Foundation Models for Range-View represented LiDAR segmentation

RangeSAM: 视觉基础模型在基于视距表示的激光雷达分割中的潜力

Paul Julius Kühn, Duc Anh Nguyen, Arjan Kuijper, Saptarshi Neil Sinha

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 RangeSAM利用视觉基础模型SAM2改进基于视距的激光雷达分割,通过高效2D特征提取和定制架构优化,实现高效的3D分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17779 2026-02-24 cs.CV cs.LG 57%

U2-BENCH: Benchmarking Large Vision-Language Models on Ultrasound Understanding

U2-BENCH:在超声理解上评估大视觉-语言模型的基准测试

Anjie Le, Henan Liu, Yue Wang, Zhenyu Liu, Rongkun Zhu, Taohan Weng, Jinze Yu, Boyang Wang, Yalun Wu, Kaiwen Yan, Quanlin Sun, Meirui Jiang, Jialun Pei, Siya Liu, Haoyun Zheng, Zhoujun Li, Alison Noble, Jacques Souquet, Xiaoqing Guo, Manxi Lin, Hongcheng Guo

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 U2-BENCH首次提出评估大视觉-语言模型在超声理解上的基准测试,涵盖分类、检测、回归和文本生成任务,评估23种最新模型,揭示其在图像分类上的优势及在空间推理和临床语言生成上的挑战。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏