arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-04 至 2025-09-04 共收录 36 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2506.19608 2025-09-04 cs.AI cs.LG 79%

ChordPrompt: Orchestrating Cross-Modal Prompt Synergy for Multi-Domain Incremental Learning in CLIP

Zhiyuan Wang, Bokui Chen

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院,清华大学,中国)

专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.AI

Comments Accepted by the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML-PKDD 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03032 2025-09-04 cs.CV 70%

Background Matters Too: A Language-Enhanced Adversarial Framework for Person Re-Identification

Kaicong Huang, Talha Azfar, Jack M. Reilly, Thomas Guggisberg, Ruimin Ke

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02805 2025-09-04 cs.LG 50%

Challenges in Understanding Modality Conflict in Vision-Language Models

Trang Nguyen, Jackson Michaels, Madalina Fiterau, David Jensen

机构 * Manning College of Information \& Computer Sciences, University of Massachusetts Amherst, Amherst, U.S.

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2509.03212 2025-09-04 cs.CV 70%

AIVA: An AI-based Virtual Companion for Emotion-aware Interaction

Chenxi Li

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21619 2025-09-04 cs.CL cs.AI cs.SD eess.AS 67%

IndexTTS2: A Breakthrough in Emotionally Expressive and Duration-Controlled Auto-Regressive Zero-Shot Text-to-Speech

Siyi Zhou, Yiquan Zhou, Yi He, Xun Zhou, Jinchao Wang, Wei Deng, Jingchen Shu

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CL、cs.AI、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02969 2025-09-04 cs.CV cs.MM cs.SI 62%

VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results

Dasong Li, Sizhuo Ma, Hang Hua, Wenjie Li, Jian Wang, Chris Wei Zhou, Fengbin Guan, Xin Li, Zihao Yu, Yiting Lu, Ru-Ling Liao, Yan Ye, Zhibo Chen, Wei Sun, Linhan Cao, Yuqin Cao, Weixia Zhang, Wen Wen, Kaiwei Zhang, Zijian Chen, Fangfang Lu, Xiongkuo Min, Guangtao Zhai, Erjia Xiao, Lingfeng Zhang, Zhenjie Su, Hao Cheng, Yu Liu, Renjing Xu, Long Chen, Xiaoshuai Hao, Zhenpeng Zeng, Jianqin Wu, Xuxu Wang, Qian Yu, Bo Hu, Weiwei Wang, Pinxin Liu, Yunlong Tang, Luchuan Song, Jinxi He, Jiaru Wu, Hanjia Lyu

机构 * Sizhuo Ma(* 作者单位) Hang Hua(* 作者单位) Wenjie Li(* 作者单位) Jian Wang(* 作者单位) Chris Wei Zhou(* 作者单位) Fengbin Guan(* 作者单位) Xin Li(* 作者单位) Zihao Yu(* 作者单位) Yiting Lu(* 作者单位) Ru-Ling Liao(* 作者单位) Yan Ye(* 作者单位) Zhibo Chen(* 作者单位) Wei Sun(* 作者单位) Linhan Cao(* 作者单位) Yuqin Cao(* 作者单位) Weixia Zhang(* 作者单位) Wen Wen(* 作者单位) Kaiwei Zhang(* 作者单位) Zijian Chen(* 作者单位) Fangfang Lu(* 作者单位) Xiongkuo Min(* 作者单位) Guangtao Zhai(* 作者单位) Erjia Xiao(* 作者单位) Lingfeng Zhang(* 作者单位) Zhenjie Su(* 作者单位) Hao Cheng(* 作者单位) Yu Liu(* 作者单位) Renjing Xu(* 作者单位) Long Chen(* 作者单位) Xiaoshuai Hao(* 作者单位) Zhenpeng Zeng(* 作者单位) Jianqin Wu(* 作者单位) Xuxu Wang(* 作者单位) Qian Yu(* 作者单位) Bo Hu(* 作者单位) Weiwei Wang(* 作者单位) Pinxin Liu(* 作者单位) Yunlong Tang(* 作者单位) Luchuan Song(* 作者单位) Jinxi He(* 作者单位) Jiaru Wu(* 作者单位) Hanjia Lyu(* 作者单位)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.MM

Comments ICCV 2025 VQualA workshop EVQA track

Journal ref ICCV 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21376 2025-09-04 cs.AI cs.CL 62%

AHELM: A Holistic Evaluation of Audio-Language Models

Tony Lee, Haoqin Tu, Chi Heem Wong, Zijun Wang, Siwei Yang, Yifan Mai, Yuyin Zhou, Cihang Xie, Percy Liang

机构 * Stanford University(斯坦福大学) University of California, Santa Cruz(加州大学圣克ruz分校) Hitachi America, Ltd.(日立美国有限公司)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13314 2025-09-04 cs.SD eess.AS 57%

I2TTS: Image-indicated Immersive Text-to-speech Synthesis with Spatial Perception

Jiawei Zhang, Tian-Hao Zhang, Jun Wang, Jiaran Gao, Xinyuan Qian, Xu-Cheng Yin

机构 * University of Science and Technology Beijing(北京科技大学) Tencent AI Lab(腾讯AI实验室) National University of Singapore(新加坡国立大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 eess.AS

Comments Accepted by APSIPA ASC2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2508.04416 2025-09-04 cs.CV 83%

Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning

Haoji Zhang, Xin Gu, Jiawen Li, Chixiang Ma, Sule Bai, Chubin Zhang, Bowen Zhang, Zhichao Zhou, Dongliang He, Yansong Tang

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02807 2025-09-04 cs.CV 79%

PixFoundation 2.0: Do Video Multi-Modal LLMs Use Motion in Visual Grounding?

Mennatullah Siam

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

Comments Work under review in NeurIPS 2025 with the title "Are we using Motion in Referring Segmentation? A Motion-Centric Evaluation"

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 1 篇

2506.18072 2025-09-04 eess.IV cs.AI cs.CV 86%

Multimodal Medical Image Binding via Shared Text Embeddings

Yunhao Liu, Suyang Xi, Shiqi Liu, Hong Ding, Chicheng Jin, Chong Zhong, Junjun He, Catherine C. Liu, Yiqing Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) Emory University(埃默里大学) The University of Hong Kong(香港大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) Johns Hopkins University(约翰霍普金斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 2 篇

2505.17879 2025-09-04 eess.SP 67%

LLM4SG: Adapting Large Language Model for Scatterer Generation via Synesthesia of Machines

Zengrui Han, Lu Bai, Ziwei Huang, Xiang Cheng

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14906 2025-09-04 eess.IV cs.CV 57%

FetalFlex: Anatomy-Guided Diffusion Model for Flexible Control on Fetal Ultrasound Image Synthesis

Yaofei Duan, Tao Tan, Zhiyuan Zhu, Yuhao Huang, Yuanji Zhang, Rui Gao, Patrick Cheong-Iao Pang, Xinru Gao, Guowei Tao, Xiang Cong, Zhou Li, Lianying Liang, Guangzhi He, Linliang Yin, Xuedong Deng, Xin Yang, Dong Ni

机构 * organization= Faculty of Applied Sciences, Macao Polytechnic University , city= Macao , country= China organization= National-Regional Key Technology Engineering Laboratory for Medical Ultrasound, School of Biomedical Engineering, Shenzhen University Medical School, Shenzhen University , city= Shenzhen , state= Guangdong , country= China organization= Shenzhen RayShape Medical Technology Co., Ltd , city= Shenzhen , state= Guangdong , country= China organization= Department of Ultrasound, Shenzhen Guangming District People’s Hospital , city= Shenzhen , state= Guangdong , country= China organization= Jinan University , city= Guangzhou , state= Guangdong , country= China organization= Center for Medical Ultrasound, The Affiliated Suzhou Hospital of Nanjing Medical University, Suzhou Municipal Hospital, Gusu School, Nanjing Medical University , city= Suzhou , state= Jiangsu , country= China organization= Medical Ultrasound Image Computing (MUSIC) Laboratory, Shenzhen University , city= Shenzhen , state= Guangdong , country= China organization= Qilu Hospital of Shandong University , city= Jinan , state= Shandong , country= China organization= Northwest Women \& Children Hospital , city= Xian , state= Shaanxi , country= China

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 11 篇

2509.02915 2025-09-04 cs.CL 83%

English Pronunciation Evaluation without Complex Joint Training: LoRA Fine-tuned Speech Multimodal LLM

Taekyung Ahn, Hosung Nam

机构 * Enuma, Inc.(Enuma公司) Korea University(韩国大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19493 2025-09-04 cs.CR cs.CV 79%

Mind the Third Eye! Benchmarking Privacy Awareness in MLLM-powered Smartphone Agents

Zhixin Lin, Jungang Li, Shidong Pan, Yibo Shi, Yue Yao, Dongliang Xu

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05779 2025-09-04 cs.CV 79%

A 3D Multimodal Feature for Infrastructure Anomaly Detection

Yixiong Jing, Wei Lin, Brian Sheil, Sinan Acikgoz

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学) Department of Geotechnical Engineering, College of Civil Engineering, Tongji University(地质工程系,同济大学土木学院) Construction Engineering, University of Cambridge(建设工程,剑桥大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15867 2025-09-04 cs.CV cs.AI 79%

TruthLens: Visual Grounding for Universal DeepFake Reasoning

Rohit Kundu, Shan Jia, Vishal Mohanty, Athula Balachandran, Amit K. Roy-Chowdhury

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03385 2025-09-04 cs.CV 70%

Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation

Reina Ishikawa, Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(庆应大学) NVIDIA(英伟达)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICCV Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01197 2025-09-04 cs.CV cs.RO 70%

A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding

Zhan Shi, Song Wang, Junbo Chen, Jianke Zhu

机构 * College of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science, Zhejiang University(浙江大学计算机科学学院)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16423 2025-09-04 cs.CV cs.LG 70%

GAEA: A Geolocation Aware Conversational Assistant

Ron Campos, Ashmal Vayani, Parth Parag Kulkarni, Rohit Gupta, Aizan Zafar, Aritra Dutta, Mubarak Shah

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments The dataset and code used in this submission is available at: https://ucf-crcv.github.io/GAEA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13037 2025-09-04 eess.IV cs.AI cs.CV 62%

Towards Cardiac MRI Foundation Models: Comprehensive Visual-Tabular Representations for Whole-Heart Assessment and Beyond

Yundi Zhang, Paul Hager, Che Liu, Suprosanna Shit, Chen Chen, Daniel Rueckert, Jiazhen Pan

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02708 2025-09-04 cs.LG cs.AI cs.CL 62%

Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios

Yunkai Dang, Mengxi Gao, Yibo Yan, Xin Zou, Yanggan Gu, Jungang Li, Jingyu Wang, Peijie Jiang, Aiwei Liu, Jia Liu, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00045 2025-09-04 cs.CV cs.PF 57%

Performance is not All You Need: Sustainability Considerations for Algorithms

Xiang Li, Chong Zhang, Hongpeng Wang, Shreyank Narayana Gowda, Yushi Li, Xiaobo Jin

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学) University of Nottingham(诺丁汉大学) University of Sydney(悉尼大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments 18 pages, 6 figures. Accepted Chinese Conference on Pattern Recognition and Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04233 2025-09-04 eess.IV cs.CV 57%

Grid-Reg: Detector-Free Gridized Feature Learning and Matching for Large-Scale SAR-Optical Image Registration

Xiaochen Wei, Weiwei Guo, Zenghui Zhang, Wenxian Yu

机构 * Shanghai Key Laboratory of Intelligent Sensing and Recognition(上海智能感知与识别重点实验室) Shanghai Jiao Tong University(上海交通大学) Center of Digital Innovation(数字创新中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 5 篇

2509.01275 2025-09-04 cs.CV 70%

Novel Category Discovery with X-Agent Attention for Open-Vocabulary Semantic Segmentation

Jiahao Li, Yang Lu, Yachao Zhang, Fangyong Wang, Yuan Xie, Yanyun Qu

专题命中 多模态Agent :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by ACMMM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13073 2025-09-04 cs.RO cs.CV 70%

Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey

Rui Shao, Wei Li, Lingsen Zhang, Renshan Zhang, Zhiyang Liu, Ran Chen, Liqiang Nie

机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(计算机科学与技术学院,哈尔滨工业大学(深圳))

专题命中 多模态Agent :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments Project Page: https://github.com/JiuTian-VL/Large-VLM-based-VLA-for-Robotic-Manipulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13266 2025-09-04 cs.AI cs.CL cs.CV cs.RO 67%

JARVIS: A Neuro-Symbolic Commonsense Reasoning Framework for Conversational Embodied Agents

Kaizhi Zheng, Kaiwen Zhou, Jing Gu, Yue Fan, Jialu Wang, Zonglin Di, Xuehai He, Xin Eric Wang

机构 * University of California(加州大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 19th International Conference on Neurosymbolic Learning and Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00218 2025-09-04 cs.RO cs.AI 57%

Embodied AI in Social Spaces: Responsible and Adaptive Robots in Complex Setting -- UKAIRS 2025 (Copy)

Aleksandra Landowska, Aislinn D Gomez Bergin, Ayodeji O. Abioye, Jayati Deshmukh, Andriana Bouadouki, Maria Wheadon, Athina Georgara, Dominic Price, Tuyen Nguyen, Shuang Ao, Lokesh Singh, Yi Long, Raffaele Miele, Joel E. Fischer, Sarvapali D. Ramchurn

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computing and Communications, The Open University(开放大学计算与通讯学院) School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) Responsible AI, University of Southampton(南安普顿大学负责任的人工智能) University of Liverpool(利兹大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18096 2025-09-04 cs.AI 57%

Deep Research Agents: A Systematic Examination And Roadmap

Yuxuan Huang, Yihang Chen, Haozheng Zhang, Kang Li, Huichi Zhou, Meng Fang, Linyi Yang, Xiaoguang Li, Lifeng Shang, Songcen Xu, Jianye Hao, Kun Shao, Jun Wang

机构 * Deep Research Agents(深度研究代理)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 7 篇

2411.19475 2025-09-04 cs.CV astro-ph.GA cs.AI cs.LG 84%

GalaxAlign: Mimicking Citizen Scientists' Multimodal Guidance for Galaxy Morphology Analysis

Ruoqi Wang, Haitao Wang, Qiong Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.AI

Comments ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏