arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-25 至 2025-09-25 共收录 59 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2508.12587 2025-09-25 cs.CV 83%

Multimodal Chain of Continuous Thought for Latent-Space Reasoning in Vision-Language Models

Tan-Hanh Pham, Chris Ngo

机构 * Harvard Medical School, Harvard University(哈佛医学院、哈佛大学) Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提尼乌拉A.马丁努斯生物医学成像中心、麻省总医院) Knovel Engineering Lab, Singapore(Knovel工程实验室、新加坡)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16180 2025-09-25 cs.CV cs.CL 81%

Redemption Score: A Multi-Modal Evaluation Framework for Image Captioning via Distributional, Perceptual, and Linguistic Signal Triangulation

Ashim Dahal, Ankit Ghimire, Saydul Akbar Murad, Nick Rahimi

机构 * University of Southern Mississippi(密苏里州南方大学)

专题命中 图文多模态 :multi-modal(title);image-text(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19480 2025-09-25 cs.RO cs.LG 78%

OmniVLA: An Omni-Modal Vision-Language-Action Model for Robot Navigation

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

专题命中 图文多模态 :omni-modal(title,abstract)

Comments 9 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20119 2025-09-25 cs.CV 70%

A Simple Data Augmentation Strategy for Text-in-Image Scientific VQA

Belal Shoer, Yova Kementchedjhieva

机构 * MBZUAI(穆罕默德·本·拉希德智能研究院)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted at WiNLP, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23745 2025-09-25 cs.CV cs.AI cs.LG 62%

To Trust Or Not To Trust Your Vision-Language Model's Prediction

Hao Dong, Moru Liu, Jian Liang, Eleni Chatzi, Olga Fink

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20196 2025-09-25 cs.CV cs.LG 57%

Universal Camouflage Attack on Vision-Language Models for Autonomous Driving

Dehong Kong, Sifan Yu, Siyuan Liang, Jiawei Liang, Jianhou Gan, Aishan Liu, Wenqi Ren

机构 * School of Cyber Science and Technology, SUN YAT-SEN UNIVERSITY(中山大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Key Laboratory of Education Informatization for Nationalities, Yunnan Normal University(云南师范大学民族教育信息化重点实验室) SCSE, Beihang University(北航软件学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18485 2025-09-25 q-bio.NC cs.CV 57%

Deciphering Functions of Neurons in Vision-Language Models

Jiaqi Xu, Cuiling Lan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted by the 31st ACM International Conference on Multimedia (ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19870 2025-09-25 cs.CV 57%

FreezeVLA: Action-Freezing Attacks against Vision-Language-Action Models

Xin Wang, Jie Li, Zejia Weng, Yixu Wang, Yifeng Gao, Tianyu Pang, Chao Du, Yan Teng, Yingchun Wang, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai AI Lab(上海人工智能实验室) Sea AI Lab(Sea人工智能实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2509.20140 2025-09-25 cs.MM cs.SD 83%

InconVAD: A Two-Stage Dual-Tower Framework for Multimodal Emotion Inconsistency Detection

Zongyi Li, Junchuan Zhao, Francis Bu Sung Lee, Andrew Zi Han Yee

机构 * Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(南洋理工大学交叉学科研究生项目) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) Wee Kim Wee School of Communication and Information, Nanyang Technological University, Singapore(南洋理工大学魏克伟通信与信息学院)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

Comments 5 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19631 2025-09-25 eess.AS cs.AI cs.CL 82%

Advancing Speech Summarization in Multi-modal LLMs with Reinforcement Learning

Shaoshi Ling, Gang Liu, Guoli Ye, Jinyu Li

机构 * Microsoft CoreAI(微软核心人工智能)

专题命中 音频语音多模态 :multi-modal(title,abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19600 2025-09-25 cs.HC 78%

vashTimer: A Multi-Purpose, Multimodal Mobile App For Maintaining Passage of Time by means of Visual, Auditory, Speech, and Haptic Alerts

Aziz N Zeidieh, Sanchita S. Kamath, JooYoung Seo

专题命中 音频语音多模态 :multimodal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2509.19757 2025-09-25 cs.DB cs.AI 57%

ARCADE: A Real-Time Data System for Hybrid and Continuous Query Processing across Diverse Data Modalities

Jingyi Yang, Songsong Mo, Jiachen Shi, Zihao Yu, Kunhao Shi, Xuchen Ding, Gao Cong

机构 * Nanyang Technological University, Singapore(南洋理工大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19892 2025-09-25 cs.RO 50%

D3Grasp: Diverse and Deformable Dexterous Grasping for General Objects

Keyu Wang, Bingcong Lu, Zhengxue Cheng, Hengdi Zhang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2509.19965 2025-09-25 cs.CV 79%

SynchroRaMa : Lip-Synchronized and Emotion-Aware Talking Face Generation via Multi-Modal Emotion Embedding

Phyo Thet Yee, Dimitrios Kollias, Sudeepta Mishra, Abhinav Dhall

机构 * IIT Ropar(印度IIT罗帕尔) Queen Mary University of London(伦敦女王玛丽大学) Monash University(墨尔本大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV

Comments Accepted at WACV 2026, project page : https://novicemm.github.io/synchrorama

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21179 2025-09-25 cs.LG cs.AI 74%

CANDLE: A Cross-Modal Agentic Knowledge Distillation Framework for Interpretable Sarcopenia Diagnosis

Yuqi Jin, Zhenhao Shuai, Zihan Hu, Weiteng Zhang, Weihao Xie, Jianwei Shuai, Xian Shen, Zhen Feng

专题命中 跨模态检索 :cross-modal(title);分类 cs.AI

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06290 2025-09-25 cs.LG cs.AI cs.CV 62%

CellCLIP -- Learning Perturbation Effects in Cell Painting via Text-Guided Contrastive Learning

Mingyu Lu, Ethan Weinberger, Chanwoo Kim, Su-In Lee

机构 * Paul G. Allen School of Computer Science & Engineering University of Washington(保罗·G·艾伦计算机科学与工程学院华盛顿大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2509.20109 2025-09-25 cs.RO cs.AI cs.CL 73%

Discrete Diffusion for Reflective Vision-Language-Action Models in Autonomous Driving

Pengxiang Li, Yinan Zheng, Yue Wang, Huimin Wang, Hang Zhao, Jingjing Liu, Xianyuan Zhan, Kun Zhan, Xianpeng Lang

机构 * LiAuto Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19090 2025-09-25 cs.CV cs.AI cs.CL 67%

Citrus-V: Advancing Medical Foundation Models with Unified Medical Image Grounding for Clinical Reasoning

Guoxin Wang, Jun Zhao, Xinyi Liu, Yanbo Liu, Xuyang Cao, Chao Li, Zhuoyun Liu, Qintian Sun, Fangru Zhou, Haoqiang Xing, Zhenhong Yang

机构 * JDH Algo(京东健康算法)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17223 2025-09-25 cs.CV 57%

DreamMix: Decoupling Object Attributes for Enhanced Editability in Customized Image Inpainting

Yicheng Yang, Pengxiang Li, Lu Zhang, Liqian Ma, Ping Hu, Siyu Du, Yunzhi Zhuge, Xu Jia, Huchuan Lu

机构 * Information and Communication Engineering(信息与通信工程) Dalian University of Technology(大连理工大学) ZMO.AI Inc.(ZMO.AI公司) University of Electronic Science and Technology of China(电子科技大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19937 2025-09-25 cs.CV 57%

GS-RoadPatching: Inpainting Gaussians via 3D Searching and Placing for Driving Scenes

Guo Chen, Jiarun Liu, Sicong Du, Chenming Wu, Deqi Li, Shi-Sheng Huang, Guofeng Zhang, Sheng Yang

机构 * Beijing Normal University China Unmanned Vehicle Dept., Cainiao, Alibaba \& State Key Lab of CAD\&CG, Zhejiang University China Unmanned Vehicle Dept., Cainiao, Alibaba China Baidu China State Key Lab of CAD\&CG, Zhejiang University China Beijing Normal University Unmanned Vehicle Dept., Cainiao, Alibaba \& State Key Lab of CAD\&CG, Zhejiang University Unmanned Vehicle Dept., Cainiao, Alibaba Baidu State Key Lab of CAD\&CG, Zhejiang University

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20136 2025-09-25 cs.SE 50%

V-GameGym: Visual Game Generation for Code Large Language Models

Wei Zhang, Jack Yang, Renshuai Tao, Lingzheng Chai, Shawn Guo, Jiajun Wu, Xiaoming Chen, Ganqu Cui, Ning Ding, Xander Xu, Hu Wei, Bowen Zhou

专题命中 多模态生成 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 14 篇

2509.19841 2025-09-25 cs.CV 83%

ThinkFake: Reasoning in Multimodal Large Language Models for AI-Generated Image Detection

Tai-Ming Huang, Wei-Tung Lin, Kai-Lung Hua, Wen-Huang Cheng, Junichi Yamagishi, Jun-Cheng Chen

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12201 2025-09-25 cs.CV 83%

OmniWorld: A Multi-Domain and Multi-Modal Dataset for 4D World Modeling

Yang Zhou, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Haoyu Guo, Zizun Li, Kaijing Ma, Xinyue Li, Yating Wang, Haoyi Zhu, Mingyu Liu, Dingning Liu, Jiange Yang, Zhoujie Fu, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Kaipeng Zhang, Tong He

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 多模态评测 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV

Comments https://yangzhou24.github.io/OmniWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04974 2025-09-25 cs.CV cs.AI cs.CL cs.LG 82%

Towards Visual Text Grounding of Multimodal Large Language Model

Ming Li, Ruiyi Zhang, Jian Chen, Chenguang Wang, Jiuxiang Gu, Yufan Zhou, Franck Dernoncourt, Wanrong Zhu, Tianyi Zhou, Tong Sun

机构 * Adobe Research(Adobe研究院) University of Maryland(马里兰大学) University at Buffalo(布法罗大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19952 2025-09-25 cs.CV cs.AI 81%

When Words Can't Capture It All: Towards Video-Based User Complaint Text Generation with Multimodal Video Complaint Dataset

Sarmistha Das, R E Zera Marveen Lyngkhoi, Kirtan Jain, Vinayak Goyal, Sriparna Saha, Manish Gupta

机构 * Indian Institute of Technology Patna(印度帕纳布理工大学) Microsoft, India(微软印度)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23601 2025-09-25 cs.CV 79%

EndoBench: A Comprehensive Evaluation of Multi-Modal Large Language Models for Endoscopy Analysis

Shengyuan Liu, Boyun Zheng, Wenting Chen, Zhihao Peng, Zhenfei Yin, Jing Shao, Jiancong Hu, Yixuan Yuan

机构 * Chinese University of Hong Kong(中国香港大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学第六附属医院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

Comments 40 pages, 22 figures; Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02876 2025-09-25 cs.CV cs.LG 79%

Multimodal Reference Visual Grounding

Yangxiao Lu, Ruosen Li, Liqiang Jing, Jikai Wang, Xinya Du, Yunhui Guo, Nicholas Ruozzi, Yu Xiang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Project page with our code and dataset: https://irvlutd.github.io/MultiGrounding

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19604 2025-09-25 cs.LG 79%

Improved Therapeutic Antibody Reformatting through Multimodal Machine Learning

Jiayi Xin, Aniruddh Raghu, Nick Bhattacharya, Adam Carr, Melanie Montgomery, Hunter Elliott

机构 * University of Pennsylvania(宾夕法尼亚大学) BigHat Biosciences(BigHat生物技术公司)

专题命中 多模态评测 :multimodal(title,abstract);multi-modal(comments)

Comments NeurIPS 2025 AI4Science Workshop and NeurIPS 2025 Multi-modal Foundation Models and Large Language Models for Life Sciences Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19345 2025-09-25 cs.CL cs.AI 62%

SCORE: A Semantic Evaluation Framework for Generative Document Parsing

Renyu Li, Antonio Jimeno Yepes, Yao You, Kamil Pluciński, Maximilian Operlejn, Crag Wolfe

机构 * Unstructured Technologies

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10836 2025-09-25 cs.CL cs.AI 62%

BAP v2: An Enhanced Task Framework for Instruction Following in Minecraft Dialogues

Prashant Jayannavar, Liliang Ren, Marisa Hudspeth, Risham Sidhu, Charlotte Lambert, Ariel Cordes, Elizabeth Kaplan, Anjali Narayan-Chen, Julia Hockenmaier

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Amazon(亚马逊) Amazon AGI(亚马逊人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

Comments major revision; few examples of changes: added contemporary LLMs and new SOTA model, improved readability, expanded related work, etc

详情

展开后加载摘要…

URL PDF HTML 收藏