arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-11 至 2025-09-11 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2509.08742 2025-09-11 q-fin.CP cs.AI 83%

FinZero: Launching Multi-modal Financial Time Series Forecast with Large Reasoning Model

Yanlong Wang, Jian Xu, Fei Ma, Hongkang Zhang, Hang Yu, Tiantian Gao, Yu Wang, Haochen You, Shao-Lun Huang, Danny Dongning Sun, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Guangming Laboratory(光明实验室) Ant Group(蚂蚁集团) Columbia University(哥伦比亚大学) Southern University of Science and Technology(南方科技大学)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08715 2025-09-11 cs.CV 83%

BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion

Sike Xiang, Shuang Chen, Amir Atapour-Abarghouei

机构 * Department of Computer Science, Durham University(计算机科学系,杜伦大学)

专题命中 图文多模态 :cross-modal(title);multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10160 2025-09-11 cs.CV cs.AI 81%

PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval

Jiancheng Pan, Muyuan Ma, Qing Ma, Cong Bai, Shengyong Chen

机构 * IEEE Publication Technology Department(IEEE出版技术部)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV、cs.AI

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08618 2025-09-11 cs.CV 79%

CLAPS: A CLIP-Unified Auto-Prompt Segmentation for Multi-Modal Retinal Imaging

Zhihao Zhao, Yinzheng Zhao, Junjie Yang, Xiangtong Yao, Quanmin Liang, Shahrooz Faghihroohi, Kai Huang, Nassir Navab, M. Ali Nasseri

机构 * Technical University of Munich(慕尼黑技术大学) Sun Yat-Sen University(中山大学)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

Comments BIBM

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08570 2025-09-11 cs.CV 70%

Vision-Language Semantic Aggregation Leveraging Foundation Model for Generalizable Medical Image Segmentation

Wenjun Yu, Yinchen Zhou, Jia-Xuan Jiang, Shubin Zeng, Yuee Li, Zhong Wang

机构 * organization= School of Information Science \& Engineering, Lanzhou University , addressline= , city= Lanzhou , postcode= 730000 , country= China

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments 29 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08490 2025-09-11 cs.CV cs.AI 62%

A Structured Review of Underwater Object Detection Challenges and Solutions: From Traditional to Large Vision Language Models

Edwine Nabahirwa, Wei Song, Minghua Zhang, Yi Fang, Zhou Ni

机构 * Shanghai Ocean University(上海海洋大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 72 Pages, 11 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06130 2025-09-11 cs.CV cs.CL 62%

Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models

Ce Zhang, Zifu Wan, Zhehan Kan, Martin Q. Ma, Simon Stepputtis, Deva Ramanan, Russ Salakhutdinov, Louis-Philippe Morency, Katia Sycara, Yaqi Xie

机构 * School of Computer Science, Carnegie Mellon University(计算机科学系,卡内基梅隆大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICLR 2025. Project page: https://zhangce01.github.io/DeGF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15108 2025-09-11 cs.LG cs.AI cs.RO 57%

VIPER: Visual Perception and Explainable Reasoning for Sequential Decision-Making

Mohamed Salim Aissi, Clemence Grislain, Mohamed Chetouani, Olivier Sigaud, Laure Soulier, Nicolas Thome

机构 * Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03521 2025-09-11 cs.CV 57%

Have Large Vision-Language Models Mastered Art History?

Ombretta Strafforello, Derya Soydaner, Michiel Willems, Anne-Sofie Maerten, Stefanie De Winter

机构 * KU Leuven(库勒韦恩大学) Leiden University(莱顿大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏