arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-26 至 2025-08-26 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2505.16258 2025-08-26 cs.CL cs.AI cs.CV 85%

IRONIC: Coherence-Aware Reasoning Chains for Multi-Modal Sarcasm Detection

Aashish Anantha Ramakrishnan, Aadarsh Anantha Ramakrishnan, Dongwon Lee

机构 * College of Information Sciences and Technology(信息科学与技术学院) The Pennsylvania State University(宾夕法尼亚州立大学) Department of Computer Science and Engineering(计算机科学与工程系) National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)

专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

Comments Accepted in the COLM First Workshop on Pragmatic Reasoning in Language Models (PragLM), Montreal, Canada, October 2025, https://sites.google.com/berkeley.edu/praglm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17037 2025-08-26 cs.CV 83%

F4-ITS: Fine-grained Feature Fusion for Food Image-Text Search

Raghul Asokan

机构 * HyperVerge

专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16762 2025-08-26 cs.CL cs.CY 83%

Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation

Arka Mukherjee, Shreya Ghosh

机构 * KIIT Deemed University(KIIT大学) Indian Institute of Technology (IIT) Bhubaneswar(印度理工学院(Bhubaneswar分校))

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

Comments Accepted at ASI @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15969 2025-08-26 cs.CV cs.AI cs.CL 82%

Forgotten Polygons: Multimodal Large Language Models are Shape-Blind

William Rudman, Michal Golovanevsky, Amir Bar, Vedant Palit, Yann LeCun, Carsten Eickhoff, Ritambhara Singh

机构 * Brown University(布朗大学) Tel Aviv University(特拉维夫大学) IIT Kharagpur(印度理工学院卡里帕尔分校) New York University(纽约大学) University of Tübingen(图宾根大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10075 2025-08-26 cs.CV cs.AI cs.LG cs.MM 75%

Robust Change Captioning in Remote Sensing: SECOND-CC Dataset and MModalCC Framework

Ali Can Karaca, M. Enes Ozelbas, Saadettin Berber, Orkhan Karimli, Turabi Yildirim, M. Fatih Amasyali

机构 * Department of Computer Engineering, Yildiz Technical University(计算机工程系,伊兹密尔技术大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

Comments This work has been submitted to the IEEE Transactions on Geoscience and Remote Sensing journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18179 2025-08-26 cs.AI cs.CV 73%

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models

Zhenwei Tang, Difan Jiao, Blair Yang, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Coolwei AI Lab(Coolwei人工智能实验室)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17595 2025-08-26 cs.CV 57%

TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints

Vinh-Thuan Ly, Hoang M. Truong, Xuan-Huong Nguyen

机构 * University of Science, VNU-HCM(越南胡志明市国家大学) Vietnam National University(越南国家大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted for presentation at the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, 2025

Journal ref IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, Hawaii, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13045 2025-08-26 cs.LG cs.CV 57%

Continual Learning for Generative AI: From LLMs to MLLMs and Beyond

Haiyang Guo, Fanhu Zeng, Fei Zhu, Jiayi Wang, Xukai Wang, Jingang Zhou, Hongbo Zhao, Wenzhuo Liu, Shijie Ma, Da-Han Wang, Xu-Yao Zhang, Cheng-Lin Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港科学与创新研究院人工智能与机器人中心) School of Computer and Information Engineering, Xiamen University of Technology(厦门理工大学计算机与信息工程学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15798 2025-08-26 cs.CV 57%

MM-Retinal V2: Transfer an Elite Knowledge Spark into Fundus Vision-Language Pretraining

Ruiqi Wu, Na Su, Chenran Zhang, Tengfei Ma, Tao Zhou, Zhiting Cui, Nianfeng Tang, Tianyu Mao, Yi Zhou, Wen Fan, Tianxing Wu, Shenqi Jing, Huazhu Fu

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Ophthalmology, The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院眼科部) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(科技研究局高性能计算研究所)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 9 篇

2508.17502 2025-08-26 cs.CV 83%

Social-MAE: A Transformer-Based Multimodal Autoencoder for Face and Voice

Hugo Bohy, Minh Tran, Kevin El Haddad, Thierry Dutoit, Mohammad Soleymani

机构 * Numediart Institute, ISIA Lab, University of Mons(Numediart研究院、ISIA实验室、蒙斯大学) Institute for Creative Technologies, University of Southern California(创意技术研究所、南加州大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CV

Comments 5 pages, 3 figures, IEEE FG 2024 conference

Journal ref 2024 IEEE 18th International Conference on Automatic Face and Gesture Recognition (FG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11804 2025-08-26 cs.CR cs.AI cs.LG 83%

Adversarial Illusions in Multi-Modal Embeddings

Tingwei Zhang, Rishi Jha, Eugene Bagdasaryan, Vitaly Shmatikov

机构 * Cornell University(康奈尔大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Cornell Tech(康奈尔科技)

专题命中 音频语音多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

Comments In USENIX Security'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16606 2025-08-26 cs.HC cs.AI cs.LG 79%

Multimodal Appearance based Gaze-Controlled Virtual Keyboard with Synchronous Asynchronous Interaction for Low-Resource Settings

Yogesh Kumar Meena, Manish Salvi

机构 * Human-AI Interaction (HAIx) Lab, IIT Gandhinagar(人机交互(HAIx)实验室,印度加尔各答理工学院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15632 2025-08-26 cs.SD 78%

ASCMamba: Multimodal Time-Frequency Mamba for Acoustic Scene Classification

Bochao Sun, Dong Wang, ZhanLong Yang, Jun Yang, Han Yin

机构 * School of Marine Science and Technology, Northwestern Polytechnical University, Xi’an, China(海洋科学与技术学院,西北工业大学,西安,中国) School of Automation, Northwestern Polytechnical University, Xi’an, China(自动化学院,西北工业大学,西安,中国) School of Electrical Engineering, KAIST, Daejeon, Republic of Korea(电气工程学院,韩国成均馆大学,大田,韩国)

专题命中 音频语音多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01263 2025-08-26 cs.MM cs.CV cs.SD eess.AS 67%

FlowDubber: Movie Dubbing with LLM-based Semantic-aware Learning and Flow Matching based Voice Enhancing

Gaoxiang Cong, Liang Li, Jiadong Pan, Zhedong Zhang, Amin Beheshti, Anton van den Hengel, Yuankai Qi, Qingming Huang

机构 * Institute of Computing Technology, Chinese Academy of Sciences \& University of Chinese Academy of Sciences Beijing China Institute of Computing Technology, Chinese Academy of Sciences Beijing China Hangzhou Dianzi University Hangzhou China Macquarie University Sydney Australia University of Adelaide Adelaide Australia University of Chinese Academy of Sciences Beijing China Institute of Computing Technology, Chinese Academy of Sciences \& University of Chinese Academy of Sciences Institute of Computing Technology, Chinese Academy of Sciences Hangzhou Dianzi University Macquarie University University of Adelaide University of Chinese Academy of Sciences

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13237 2025-08-26 eess.AS cs.CL cs.SD 62%

SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information

Chih-Kai Yang, Neo Ho, Yen-Ting Piao, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、eess.AS

Comments Accepted to Interspeech 2025 (Oral). Update acknowledgement in this version. Project page: https://github.com/ckyang1124/SAKURA

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16789 2025-08-26 cs.CV cs.CL 62%

Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation

Jungeun Kim, Hyeongwoo Jeon, Jongseong Bae, Ha Young Kim

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Information, Yonsei University(信息研究生院,延世大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07354 2025-08-26 cs.SD cs.IR cs.LG cs.MM eess.AS 62%

SoccerNet-Echoes: A Soccer Game Audio Commentary Dataset

Sushant Gautam, Mehdi Houshmand Sarkhoosh, Jan Held, Cise Midoglu, Anthony Cioppa, Silvio Giancola, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Mubarak Shah

机构 * SimulaMet OsloMet Forzasys University of Central Florida(佛罗里达中央大学) University of Liège(列日大学) KAUST(科威特大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17124 2025-08-26 cs.HC cs.SY eess.SY 50%

Towards Deeper Understanding of Natural User Interactions in Virtual Reality Based Assembly Tasks

Ryan Ghamandi, Yahya Hmaiti, Mykola Maslych, Ravi Kiran Kattoju, Joseph J. LaViola

专题命中 音频语音多模态 :multimodal(abstract)

Comments To be submitted in a future conference, this is the author version pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2410.23266 2025-08-26 cs.CV cs.AI cs.CL 89%

TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models

Ziyao Shangguan, Chuhan Li, Yuxuan Ding, Yanan Zheng, Yilun Zhao, Tesca Fitzgerald, Arman Cohan

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17890 2025-08-26 cs.CV 79%

UniAPO: Unified Multimodal Automated Prompt Optimization

Qipeng Zhu, Yanzhe Chen, Huasong Zhong, Yan Li, Jie Chen, Zhixin Zhang, Junping Zhang, Zhenheng Yang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17817 2025-08-26 cs.CV 79%

TemCoCo: Temporally Consistent Multi-modal Video Fusion with Visual-Semantic Collaboration

Meiqi Gong, Hao Zhang, Xunpeng Yi, Linfeng Tang, Jiayi Ma

机构 * Electronic Information School, Wuhan University, Wuhan 430072, China(武汉大学电子信息学院)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12687 2025-08-26 cs.AI cs.CV 73%

EGOILLUSION: Benchmarking Hallucinations in Egocentric Video Understanding

Ashish Seth, Utkarsh Tyagi, Ramaneswaran Selvakumar, Nishit Anand, Sonal Kumar, Sreyan Ghosh, Ramani Duraiswami, Chirag Agarwal, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17932 2025-08-26 cs.CV cs.AI 62%

See What You Need: Query-Aware Visual Intelligence through Reasoning-Perception Loops

Zixuan Dong, Baoyun Peng, Yufei Wang, Lin Liu, Xinxin Dong, Yunlong Cao, Xiaodong Wang

机构 * College of Computer, National University of Defense Technology(计算机学院,国防科技大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17160 2025-08-26 cs.CV cs.AI 62%

Beyond Play and Pause: Turning GPT-4o Spatial Weakness into a Strength for In-Depth Interactive Video Learning

Sajad Goudarzi, Samaneh Zamanifard

机构 * Clemson University(克莱姆森大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04958 2025-08-26 cs.CV cs.MM 62%

Boosting Temporal Sentence Grounding via Causal Inference

Kefan Tang, Lihuo He, Jisheng Dang, Xinbo Gao

机构 * School of Electronic Engineering, Xidian University Xi'an China School of Information Science \& Engineering, Lanzhou University Lanzhou China Xidian University Lanzhou University

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17442 2025-08-26 cs.CV 57%

Multi-Level LVLM Guidance for Untrimmed Video Action Recognition

Liyang Peng, Sihan Zhu, Yunjie Guo

机构 * Kunming University of Science and Technology(昆明理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16287 2025-08-26 cs.CV 57%

Beyond Label Semantics: Language-Guided Action Anatomy for Few-shot Action Recognition

Zefeng Qian, Xincheng Yao, Yifei Huang, Chongyang Zhang, Jiangyong Ying, Hong Sun

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) The University of Tokyo(东京大学) Shanghai AI Laboratory(上海人工智能实验室) E-surfing Vision Technology Co., Ltd(亿欧视觉科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15885 2025-08-26 cs.AI 57%

VLASCD: A Visual Language Action Model for Simultaneous Chatting and Decision Making

Zuojin Tang, Bin Hu, Chenyang Zhao, De Ma, Gang Pan, Bin Liu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Home Robotics Lab, E-surfing Digital Life Technology Co., Ltd., China Telecom(E-surfing数字生活技术有限公司) Zhejiang Lab(浙江实验室) Trinity College Dublin(都柏林大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments Accepted by EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16648 2025-08-26 cs.LG cs.AI physics.flu-dyn 57%

LatentFlow: Cross-Frequency Experimental Flow Reconstruction from Sparse Pressure via Latent Mapping

Junle Liu, Chang Liu, Yanyu Ke, Qiuxiang Huang, Jiachen Zhao, Wenliang Chen, K. T. Tse, Gang Hu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.AI

Comments The paper is submitted to IAAI26. Total 9 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 12 篇

2508.17079 2025-08-26 cs.IR cs.AI 88%

Zero-shot Multimodal Document Retrieval via Cross-modal Question Generation

Yejin Choi, Jaewoo Park, Janghan Yoon, Saejin Kim, Jaehyun Jeon, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(title);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏