arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-15 至 2025-12-15 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2512.11680 2025-12-15 cs.CV 88%

Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing

跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解

Xu Zhang, Jiabin Fang, Zhuoming Ding, Jin Yuan, Xuan Liu, Qianjun Zhang, Zhiyong Li

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11683 2025-12-15 cs.CV 79%

Depth-Copy-Paste: Multimodal and Depth-Aware Compositing for Robust Face Detection

深度复制-粘贴:多模态和深度感知的复合技术用于鲁棒人脸检测

Qiushi Guo

机构 * Coffee AI Lab, Great Wall Motor(GWM), China(咖啡AI实验室,长城汽车(GWM),中国)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 深度复制-粘贴通过多模态和深度感知的增强方法,生成多样且物理一致的训练数据,提升人脸检测的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21451 2025-12-15 cs.CV 79%

MM-SeR: Multimodal Self-Refinement for Lightweight Image Captioning

MM-SeR: 多模态自反思用于轻量级图像描述

Junha Song, Yongsik Jo, So Yeon Min, Quanting Xie, Taehwan Kim, Yonatan Bisk, Jaegul Choo

机构 * KAIST(韩国科学技术院) UNIST(全南国立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 MM-SeR通过轻量级多模态自反思框架,在减少计算成本的同时,实现了与大规模模型相当的图像描述性能,并扩展到长距离视频问答任务。

Comments Project page: https://sites.google.com/view/junha/mm-ser

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09348 2025-12-15 cs.CL cs.AI cs.CV 67%

MOAT: Evaluating LMMs for Capability Integration and Instruction Grounding

MOAT:评估LMMs在能力整合和指令接地方面的表现

Zhoutong Ye, Mingze Sun, Huan-ang Gao, Xutong Wang, Xiangyang Wang, Yu Mei, Chang Liu, Qinwei Li, Chengwen Zhang, Qinghuan Lan, Chun Yu, Yuanchun Shi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 MOAT通过1005个复杂现实视觉问题评估LMMs在能力整合和指令接地方面的表现,发现最佳模型仅达44%准确率,揭示了LMMs在复杂任务中的不足。

Comments Project page: https://cambrian-yzt.github.io/MOAT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11167 2025-12-15 cs.CV cs.AI 62%

Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context

图像分块用于高分辨率推理:在局部细节与全局上下文之间取得平衡

Anatole Jacquin de Margerie, Alexis Roger, Irina Rish

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过图像分块技术实现高分辨率图像理解,验证了局部细节恢复的有效性,并探讨了全局上下文对模型性能的影响。

Comments Accepted in AAAI 2025 Workshop on Reproducible AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11015 2025-12-15 cs.CV cs.AI cs.LG 62%

Leveraging Text Guidance for Enhancing Demographic Fairness in Gender Classification

利用文本引导提升面部性别分类中的群体公平性

Anoop Krishnan

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过文本引导方法提升面部性别分类中的群体公平性,利用图像文本匹配和融合策略减少偏见并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17982 2025-12-15 cs.CV 57%

Few-Shot Learning from Gigapixel Images via Hierarchical Vision-Language Alignment and Modeling

通过层次化视觉-语言对齐和建模实现高像素图像的少样本学习

Bryan Wong, Jong Woo Kim, Huazhu Fu, Mun Yong Yi

机构 * KAIST(韩国科学技术院) IHPC, A*STAR(A*STAR研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 HiVE-MIL通过层次化视觉-语言对齐和建模,提升高像素图像的少样本学习性能,实现4.1%的宏F1提升。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11060 2025-12-15 cs.CV 57%

Synthetic Vasculature and Pathology Enhance Vision-Language Model Reasoning

合成血管和病理增强视觉-语言模型推理

Chenjun Li, Cheng Wan, Laurin Lux, Alexander Berger, Richard B. Rosen, Martin J. Menten, Johannes C. Paetzold

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔·康奈尔医学) Technical University of Munich(慕尼黑技术大学) New York Eye and Ear Infirmary of Mount Sinai(圣文森特医院) Cornell Tech(康奈尔科技)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本研究提出合成血管推理框架,通过生成具有糖尿病视网膜病变特征的图像和文本,提升视觉-语言模型在OCTA图像诊断中的推理能力与病理定位精度。

Comments 23 pages, 8 figures, 6 tables. Full paper under review for MIDL 2026 (Medical Imaging with Deep Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11109 2025-12-15 cs.LG 50%

Limits and Gains of Test-Time Scaling in Vision-Language Reasoning

视觉语言推理中测试时扩展的极限与收益

Mohammadjavad Ahmadpour, Amirmahdi Meighani, Payam Taebi, Omid Ghahroodi, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究探讨了测试时扩展在视觉语言推理中的效果,发现其在不同任务和模型上表现不一,需根据具体需求定制策略。

Comments Mohammadjavad Ahmadpour and Amirmadhi Meighani contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏