arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-06 至 2025-11-06 共收录 37 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2506.04220 2025-11-06 cs.CV 70%

Struct2D: A Perception-Guided Framework for Spatial Reasoning in MLLMs

Fangrui Zhu, Hanhui Wang, Yiming Xie, Jing Gu, Tianye Ding, Jianwei Yang, Huaizu Jiang

机构 * Northeastern University(东北大学) Microsoft Research(微软研究院) University of Southern California(南加州大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2025, code link: https://github.com/neu-vi/struct2d

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08668 2025-11-06 cs.CV 57%

Hulu-Med: A Transparent Generalist Model towards Holistic Medical Vision-Language Understanding

Songtao Jiang, Yuan Wang, Sibo Song, Tianxiang Hu, Chenyi Zhou, Bin Pu, Yan Zhang, Zhibo Yang, Yang Feng, Joey Tianyi Zhou, Jin Hao, Zijian Chen, Ruijia Wu, Tao Tang, Junhui Lv, Hongxia Xu, Hongwei Wang, Jun Xiao, Bin Feng, Fudong Zhu, Kenli Li, Weidi Xie, Jimeng Sun, Jian Wu, Zuozhu Liu

机构 * College of Computer Science and Technology, Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学计算机科学与技术学院) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine(浙江大学口腔医院) Alibaba Inc(阿里巴巴集团) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Angelalign Technology Inc.(Angelalign技术有限公司) CFAR & IHPC, Agency for Science, Technology and Research(CFAR与IHPC,新加坡科技研究局) Department of Orthodontics, Shanghai Ninth People’s Hospital, College of Stomatology, Shanghai Jiao Tong University(上海第九人民医院正畸科,上海交通大学口腔医学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11772 2025-11-06 cs.CV cs.LG 57%

CLIP Meets Diffusion: A Synergistic Approach to Anomaly Detection

Byeongchan Lee, John Won, Seunghyun Lee, Jinwoo Shin

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学技术研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

Comments Accepted at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2408.15176 2025-11-06 cs.SD cs.CL eess.AS 62%

Unifying Symbolic Music Arrangement: Track-Aware Reconstruction and Structured Tokenization

Longshen Ou, Jingwei Zhao, Ziyu Wang, Gus Xia, Qihao Liang, Torin Hopkins Ye Wang

机构 * Sound and Music Computing Lab, School of Computing, NUS(新加坡国立大学计算机学院声音与音乐计算实验室) Courant Institute of Mathematical Sciences, New York University(纽约大学应用数学科学学院) Music X Lab, MBZUAI(MBZUAI音乐X实验室)

专题命中 音频语音多模态 :any-to-any(abstract);分类 cs.CL、eess.AS

Comments NeurIPS 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2511.03332 2025-11-06 cs.CV 57%

Multi-Object Tracking Retrieval with LLaVA-Video: A Training-Free Solution to MOT25-StAG Challenge

Yi Yang, Yiming Xu, Timo Kaiser, Hao Cheng, Bodo Rosenhahn, Michael Ying Yang

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) University of Twente(特文特大学) University of Bath(巴斯大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18422 2025-11-06 cs.CV 57%

Breaking the Encoder Barrier for Seamless Video-Language Understanding

Handong Li, Yiyuan Zhang, Longteng Guo, Xiangyu Yue, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MMLab, CUHK(CUHK MMLab) Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 12 pages

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 23167-23176

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13174 2025-11-06 cs.CV 57%

Manipulation Facing Threats: Evaluating Physical Vulnerabilities in End-to-End Vision Language Action Models

Hao Cheng, Erjia Xiao, Yichi Wang, Chengyuan Yu, Mengshu Sun, Qiang Zhang, Jiahang Cao, Yijie Guo, Ning Liu, Kaidi Xu, Jize Zhang, Chao Shen, Philip Torr, Jindong Gu, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Oxford(牛津大学) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学) Beijing University of Technology(北京理工大学) Duke University(杜克大学) X-Humanoid Project(X-Humanoid 项目)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2511.02946 2025-11-06 cs.CV 85%

ProM3E: Probabilistic Masked MultiModal Embedding Model for Ecology

Srikumar Sastry, Subash Khanal, Aayush Dhakal, Jiayu Lin, Dan Cher, Phoenix Jarosz, Nathan Jacobs

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);any-to-any(abstract);分类 cs.CV

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02996 2025-11-06 cs.CV 57%

SCALE-VLP: Soft-Weighted Contrastive Volumetric Vision-Language Pre-training with Spatial-Knowledge Semantics

Ailar Mahdizadeh, Puria Azadi Moghadam, Xiangteng He, Shahriar Mirabbasi, Panos Nasiopoulos, Leonid Sigal

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute for AI(人工智能向量研究所)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 4 篇

2511.03137 2025-11-06 cs.AI 83%

Using Multi-modal Large Language Model to Boost Fireworks Algorithm's Ability in Settling Challenging Optimization Tasks

Shipeng Cen, Ying Tan

机构 * School of Intelligence Science Technology, Institute for Artificial Intellignce, Peking University, Beijing, China Technology, Institute for Artificial Intellignce, National Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China

专题命中 多模态生成 :multi-modal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21448 2025-11-06 eess.AS cs.CV cs.SD 81%

ThinkSound: Chain-of-Thought Reasoning in Multimodal Large Language Models for Audio Generation and Editing

Huadai Liu, Kaicheng Luo, Jialei Wang, Wen Wang, Qian Chen, Zhou Zhao, Wei Xue

机构 * Hong Kong University of Science and Technology (HKUST)(香港理工大学) Tongyi Fun Team, Alibaba Group(阿里云团队) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、eess.AS

Comments Accepted by NeurIPS 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16495 2025-11-06 cs.CV 70%

ALTo: Adaptive-Length Tokenizer for Autoregressive Mask Generation

Lingfeng Wang, Hualing Lin, Senda Chen, Tao Wang, Changxu Cheng, Yangyang Zhong, Dong Zheng, Wuyue Zhao

机构 * Uni-Ubi Zhejiang University(浙江大学) Tongji University(同济大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06853 2025-11-06 cs.LG cs.AI cs.CE physics.chem-ph q-bio.MN 57%

DiffSpectra: Molecular Structure Elucidation from Spectra using Diffusion Models

Liang Wang, Yu Rong, Tingyang Xu, Zhenyi Zhong, Zhiyuan Liu, Pengju Wang, Deli Zhao, Qiang Liu, Shu Wu, Liang Wang, Yang Zhang

机构 * NLPR, MAIS, Institute of Automation(NLPR、MAIS、自动化研究所) School of Artificial Intelligence(人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) Hupan Lab(华普实验室) College of Intelligence and Computing(智能与计算学院) National University of Singapore(新加坡国立大学) Cancer Science Institute of Singapore(新加坡癌症科学研究所)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 7 篇

2509.18894 2025-11-06 cs.CV 79%

SmartWilds: Multimodal Wildlife Monitoring Dataset

Jenna Kline, Anirudh Potlapally, Bharath Pillai, Tanishka Wani, Rugved Katole, Vedant Patil, Penelope Covey, Hari Subramoni, Tanya Berger-Wolf, Christopher Stewart

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments Accepted to Imageomics Workshop at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03471 2025-11-06 cs.AI cs.HC 70%

Towards Scalable Web Accessibility Audit with MLLMs as Copilots

Ming Gu, Ziwei Wang, Sicen Lai, Zirui Gao, Sheng Zhou, Jiajun Bu

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

Comments 15 pages. Accepted by AAAI 2026 AISI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18140 2025-11-06 cs.CL 70%

MathOPEval: A Fine-grained Evaluation Benchmark for Visual Operations of MLLMs in Mathematical Reasoning

Xiaoyuan Li, Moxin Li, Wenjie Wang, Rui Men, Yichang Zhang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CL

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07491 2025-11-06 cs.CV 57%

SpatialLM: Training Large Language Models for Structured Indoor Modeling

Yongsen Mao, Junhao Zhong, Chuan Fang, Jia Zheng, Rui Tang, Hao Zhu, Ping Tan, Zihan Zhou

机构 * Manycore Tech Inc.(Manycore科技公司) Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03194 2025-11-06 cs.CV 57%

PETWB-REP: A Multi-Cancer Whole-Body FDG PET/CT and Radiology Report Dataset for Medical Imaging Research

Le Xue, Gang Feng, Wenbo Zhang, Yichi Zhang, Lanlan Li, Shuqi Wang, Liling Peng, Sisi Peng, Xin Gao

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02893 2025-11-06 eess.IV cs.CV 57%

Optimizing the nnU-Net model for brain tumor (Glioma) segmentation Using a BraTS Sub-Saharan Africa (SSA) dataset

Chukwuemeka Arua Kalu, Adaobi Chiazor Emegoakor, Fortune Okafor, Augustine Okoh Uchenna, Chijioke Kelvin Ukpai, Godsent Erere Onyeugbo

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12299 2025-11-06 physics.comp-ph cs.SD physics.optics 50%

High-Precision Modal Analysis of Multimode Waveguides from Amplitudes via Large-Step Nonconvex Optimization

Jingtong Li, Dongting Huang, Minhui Xiong, Mingzhi Li

机构 * School of Electronics, Peking University(北京大学电子学院)

专题命中 多模态评测 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 6 篇

2511.02834 2025-11-06 cs.AI cs.CL cs.LG 84%

Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything

Huawei Lin, Yunzhi Shi, Tong Geng, Weijie Zhao, Wei Wang, Ravender Pal Singh

机构 * Amazon(亚马逊公司) Rochester Institute of Technology(罗切斯特理工学院) University of Rochester(罗切斯特大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 7 figures, 14 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20462 2025-11-06 cs.AI 70%

TAMO: Fine-Grained Root Cause Analysis via Tool-Assisted LLM Agent with Multi-Modality Observation Data in Cloud-Native Systems

Xiao Zhang, Qi Wang, Mingyi Li, Yuan Yuan, Mengbai Xiao, Fuzhen Zhuang, Dongxiao Yu

机构 * School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06733 2025-11-06 cs.AI cs.CL cs.IR 62%

Reinforcement Learning Foundations for Deep Research Systems: A Survey

Wenjun Li, Zhi Chen, Jingru Lin, Hannan Cao, Wei Han, Sheng Liang, Zhi Zhang, Kuicai Dong, Dexun Li, Chen Zhang, Yong Liu

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments 39 pages, second version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20637 2025-11-06 cs.LG cs.AI cs.CL 62%

GDS Agent for Graph Algorithmic Reasoning

Borun Shi, Ioannis Panagiotas

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL、cs.AI

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01192 2025-11-06 q-bio.NC cs.CE cs.NE 50%

Personalized Transcranial Electrical Stimulation: A Review of Computational Modeling and Optimization

Mo Wang, Kexin Zheng, Yingyue Xin, Xiang Chen, Yiling Liu, Huichun Luo, Jingsheng Tang, Tifei Yuan, Hongkai Wen, Pengfei Wei, Quanying Liu

专题命中 多模态Agent :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05063 2025-11-06 physics.med-ph cs.NA math.NA q-bio.QM 50%

Individualizing Glioma Radiotherapy Planning by Optimization of Data and Physics-Informed Discrete Loss

Michal Balcerak, Jonas Weidner, Petr Karnakov, Ivan Ezhov, Sergey Litvinov, Petros Koumoutsakos, Tamaz Amiranashvili, Ray Zirui Zhang, John S. Lowengrub, Bene Wiestler, Bjoern Menze

专题命中 多模态Agent :multi-modal(abstract)

Comments Accepted for publication in Nature Communications (DOI: 10.1038/s41467-025-60366-4)

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 6 篇

2511.03371 2025-11-06 cond-mat.mtrl-sci physics.comp-ph 82%

Enhancing composition-based materials property prediction by cross-modal knowledge transfer

Ivan Rubtsov, Ivan Dudakov, Yuri Kuratov, Vadim Korolev

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract)

Comments 7 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04789 2025-11-06 cs.CV 79%

Object-X: Learning to Reconstruct Multi-Modal 3D Object Representations

Gaia Di Lorenzo, Federico Tombari, Marc Pollefeys, Daniel Barath

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌) Microsoft(微软)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03019 2025-11-06 cs.CV cs.AI 79%

SLIP: Structural-aware Language-Image Pretraining for Vision-Language Alignment

Wenbo Lu

机构 * Department of Data Science(数据科学系) New York University Shanghai(纽约大学上海分校)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments Capstone Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03196 2025-11-06 cs.LG stat.ML 78%

Cross-Modal Alignment via Variational Copula Modelling

Feng Wu, Tsai Hor Chan, Fuying Wang, Guosheng Yin, Lequan Yu

机构 * School of Computing and Data Science, University of Hong Kong, Hong Kong, China(计算与数据科学学院,香港大学,香港,中国)

专题命中 多模态训练与对齐 :cross-modal(title);multimodal(abstract)

Journal ref published by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏