arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-07 至 2025-11-07 共收录 41 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2504.07110 2025-11-07 cs.IR cs.LG 82%

DashCLIP: Leveraging multimodal models for generating semantic embeddings for DoorDash

Omkar Gurjar, Kin Sum Liu, Praveen Kolli, Utsaw Kumar, Mandar Rahurkar

机构 * DoorDash, Inc.(DoorDash公司)

专题命中 图文多模态 :multimodal(title);multi-modal(abstract);image-text(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23769 2025-11-07 cs.CV 79%

TextRegion: Text-Aligned Region Tokens from Frozen Image-Text Models

Yao Xiao, Qiqian Fu, Heyi Tao, Yuqun Wu, Zhen Zhu, Derek Hoiem

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图文多模态 :image-text(title,abstract);分类 cs.CV

Comments Published in TMLR, with a J2C Certification

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21849 2025-11-07 cs.LG cs.AI 70%

TowerVision: Understanding and Improving Multilinguality in Vision-Language Models

André G. Viveiros, Patrick Fernandes, Saul Santos, Sonal Sannigrahi, Emmanouil Zaranis, Nuno M. Guerreiro, Amin Farajian, Pierre Colombo, Graham Neubig, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术高级学院) Instituto de Telecomunicações(电信研究所) Carnegie Mellon University(卡内基梅隆大学) Sword Health(Sword健康) TransPerfect MICS, CentraleSupélec, Université Paris-Saclay(MICS,中央圣艾尔布里大学,巴黎萨克雷大学) ELLIS Unit Lisbon(里斯本ELLIS单位)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI

Comments 15 pages, 7 figures, submitted to arXiv October 2025. All models, datasets, and training code will be released at https://huggingface.co/collections/utter-project/towervision

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07416 2025-11-07 cs.CV cs.CL cs.LG 62%

RadZero: Similarity-Based Cross-Attention for Explainable Vision-Language Alignment in Chest X-ray with Zero-Shot Multi-Task Capability

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2511.04623 2025-11-07 cs.SD eess.AS 74%

PromptSep: Generative Audio Separation via Multimodal Prompting

Yutong Wen, Ke Chen, Prem Seetharaman, Oriol Nieto, Jiaqi Su, Rithesh Kumar, Minje Kim, Paris Smaragdis, Zeyu Jin, Justin Salamon

机构 * Adobe Research(Adobe研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT(麻省理工学院)

专题命中 音频语音多模态 :multimodal(title);分类 eess.AS

Comments Submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04211 2025-11-07 cs.DL 50%

From data to corpus: semiotic and documentary issues in audiovisual archives

Peter Stockinger

专题命中 音频语音多模态 :multimodal(abstract)

Comments in French language

Journal ref Corpus audiovisuels. Quelles approches ? Quels usages ?, Editions des archives contemporaines, 2022, 9782813003799

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2510.11321 2025-11-07 cs.RO 78%

HiMaCon: Discovering Hierarchical Manipulation Concepts from Unlabeled Multi-Modal Data

Ruizhe Liu, Pei Zhou, Qian Luo, Li Sun, Jun Cen, Yibing Song, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science(香港大学数据科学学院) The University of Hong Kong(香港大学) DAMO Academy(达摩院) Alibaba Group(阿里巴巴集团)

专题命中 视频多模态 :multi-modal(title);cross-modal(abstract)

Comments Accepted at 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04670 2025-11-07 cs.CV 61%

Cambrian-S: Towards Spatial Supersensing in Video

Shusheng Yang, Jihan Yang, Pinzhi Huang, Ellis Brown, Zihao Yang, Yue Yu, Shengbang Tong, Zihan Zheng, Yifan Xu, Muhan Wang, Daohan Lu, Rob Fergus, Yann LeCun, Li Fei-Fei, Saining Xie

机构 * New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV;MLLM(comments)

Comments Website: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04281 2025-11-07 cs.CV 57%

DINOv2 Driven Gait Representation Learning for Video-Based Visible-Infrared Person Re-identification

Yujie Yang, Shuang Li, Jun Ye, Neng Dong, Fan Li, Huafeng Li

机构 * Kunming University of Science and Technology(昆明理工大学) Chongqing University of Post and Telecommunications(重庆邮电大学) China University of Mining Technology(中国矿业大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03750 2025-11-07 stat.AP 50%

Centralized Health and Exposomic Resource (C-HER): Analytic and AI-Ready Data for External Exposomic Research

Heidi A. Hanson, Joemy Ramsay, Josh Grant, Maggie Davis, Janet O. Agbaje, Dakotah Maguire, Jeremy Logan, Marissa Taddie, Chad Melton, Midgie MacFarland, James VanDerslice

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2509.10641 2025-11-07 cs.LG cs.AI 83%

Test-Time Warmup for Multimodal Large Language Models

Nikita Rajaneesh, Thomas Zollo, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02728 2025-11-07 cs.RO 82%

Team Xiaomi EV-AD VLA: Caption-Guided Retrieval System for Cross-Modal Drone Navigation -- Technical Report for IROS 2025 RoboSense Challenge Track 4

Lingfeng Zhang, Erjia Xiao, Yuchen Zhang, Haoxiang Fu, Ruibin Hu, Yanbiao Ma, Wenbo Ding, Long Chen, Hangjun Ye, Xiaoshuai Hao

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) Georgia Institute of Technology(佐治亚理工学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Renmin University of China(中国人民大学)

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17899 2025-11-07 cs.CV 57%

What Time Tells Us? An Explorative Study of Time Awareness Learned from Static Images

Dongheng Lin, Han Hu, Jianbo Jiao

机构 * University of Birmingham(伯明翰大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

Comments Accepted by TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2511.04012 2025-11-07 cs.SE 82%

PSD2Code: Automated Front-End Code Generation from Design Files via Multimodal Large Language Models

Yongxi Chen, Lei Chen

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03227 2025-11-07 cs.HC cs.AI cs.MM 81%

Node-Based Editing for Multimodal Generation of Text, Audio, Image, and Video

Alexander Htet Kyaw, Lenin Ravindranath Sivalingam

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI、cs.MM

Comments Accepted to NeurIPS 2025, Conference on Neural Information Processing Systems, Workshop on Generative and Protective AI for Content Creation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03757 2025-11-07 cs.LG cs.AI 70%

Laugh, Relate, Engage: Stylized Comment Generation for Short Videos

Xuan Ouyang, Senan Wang, Bouzhou Wang, Siyuan Xiahou, Jinrong Zhou, Yuekang Li

机构 * University of New South Wales(新南威尔士大学) University of Sydney(悉尼大学) The University of Hong Kong(香港大学) University of Southern California(南加州大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00105 2025-11-07 cs.CY cs.AI 57%

Artificial Intelligence in Elementary STEM Education: A Systematic Review of Current Applications and Future Challenges

Majid Memari, Krista Ruggles

机构 * Department of Computer Science, Utah Valley University(计算机科学系,犹他谷大学) School of Education, Utah Valley University(教育学院,犹他谷大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21529 2025-11-07 cs.CV 57%

Chain-of-Cooking:Cooking Process Visualization via Bidirectional Chain-of-Thought Guidance

Mengling Xu, Ming Tao, Bing-Kun Bao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 16 篇

2507.13956 2025-11-07 cs.AI cs.CV cs.MM 85%

Cross-modal Causal Intervention for Alzheimer's Disease Prediction

Yutao Jin, Haowen Xiao, Junyong Zhai, Yuxiao Li, Jielei Chu, Fengmao Lv, Yuxiao Li

机构 * Southwest Jiaotong University(西南交通大学) Southeast University(东南大学) Sichuan University(四川大学)

专题命中 多模态评测 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03845 2025-11-07 cs.AI cs.LG 83%

To See or To Read: User Behavior Reasoning in Multimodal LLMs

Tianning Dong, Luyi Ma, Varun Vasudevan, Jason Cho, Sushant Kumar, Kannan Achan

机构 * Personalization Team, Walmart Global Tech(Walmart全球科技个性化团队)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

Comments Accepted by the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04016 2025-11-07 cs.CV 79%

MedDChest: A Content-Aware Multimodal Foundational Vision Model for Thoracic Imaging

Mahmoud Soliman, Islam Osman, Mohamed S. Shehata, Rasika Rajapakshe

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03907 2025-11-07 cs.HC cs.AI 79%

SnappyMeal: Design and Longitudinal Evaluation of a Multimodal AI Food Logging Application

Liam Bakar, Zachary Englhardt, Vidya Srinivas, Girish Narayanswamy, Dilini Nissanka, Shwetak Patel, Vikram Iyer

机构 * University of Washington(华盛顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

Comments 24 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03768 2025-11-07 cs.LG cs.CV 79%

What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes

Candace Ross, Florian Bordes, Adina Williams, Polina Kirichenko, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

Comments 10 pages, 6 figures. Accepted to NeurIPS Datasets & Benchmarks 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17168 2025-11-07 cs.CV 79%

EMHI: A Multimodal Egocentric Human Motion Dataset with HMD and Body-Worn IMUs

Zhen Fan, Peng Dai, Zhuo Su, Xu Gao, Zheng Lv, Jiarui Zhang, Tianyuan Du, Guidong Wang, Yang Zhang

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04040 2025-11-07 cs.LG cs.NE q-bio.BM 78%

Enhancing Multimodal Protein Function Prediction Through Dual-Branch Dynamic Selection with Reconstructive Pre-Training

Xiaoling Luo, Peng Chen, Chengliang Liu, Xiaopeng Jin, Jie Wen, Yumeng Liu, Junsong Wang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) College of Applied Technology, Shenzhen University(深圳大学应用技术学院) Laboratory for Artificial Intelligence in Design, Hong Kong(人工智能设计实验室(香港)) College of Big Data and Internet, Shenzhen Technology University(深圳技术大学大数据与互联网学院) College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院计算机科学与技术学院)

专题命中 多模态评测 :multimodal(title,abstract)

Journal ref Proceedings of the IJCAI-25, 7598--7606 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04171 2025-11-07 cs.CV cs.AI 62%

Systematic Evaluation of Preprocessing Techniques for Accurate Image Registration in Digital Pathology

Fatemehzahra Darzi, Rodrigo Escobar Diaz Guerrero, Thomas Bocklitz

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 14 pages, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04655 2025-11-07 cs.CV 61%

Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts

Ellis Brown, Jihan Yang, Shusheng Yang, Rob Fergus, Saining Xie

机构 * New York University(纽约大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV;MLLM(comments)

Comments Project page: https://cambrian-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04533 2025-11-07 eess.AS 57%

CardioPHON: Quality assessment and self-supervised pretraining for screening of cardiac function based on phonocardiogram recordings

Vladimir Despotovic, Peter Pocta, Andrej Zgank

专题命中 多模态评测 :multimodal(abstract);分类 eess.AS

Journal ref Biomedical Signal Processing and Control 113 (2026) 109047

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04347 2025-11-07 cs.CV 57%

Evaluating the Impact of Weather-Induced Sensor Occlusion on BEVFusion for 3D Object Detection

Sanjay Kumar, Tim Brophy, Eoin Martino Grua, Ganesh Sistu, Valentina Donzella, Ciaran Eising

机构 * Dept. of Electronic and Computer Engineering and the Data Driven Computer Engineering Research Centre, University of Limerick(电子与计算机工程系和数据驱动计算机工程研究中心,利默里克大学) Valeo Vision Systems(瓦莱欧视觉系统) Queen Mary University of London(伦敦女王大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23071 2025-11-07 cs.CL 57%

Text2VectorSQL: Towards a Unified Interface for Vector Search and SQL Queries

Zhengren Wang, Dongwen Yao, Bozhou Li, Dongsheng Ma, Bo Li, Zhiyu Li, Feiyu Xiong, Bin Cui, Linpeng Tang, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) OriginHub Technology(OriginHub科技) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏