arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-05 至 2025-08-05 共收录 106 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 19 篇

2508.01254 2025-08-05 cs.CV 83%

Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency

Zihan Li, Wei Sun, Jing Hu, Jianhua Yin, Jianlong Wu, Liqiang Nie

专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08642 2025-08-05 cs.SI cs.CL cs.CV cs.MM 82%

More than Memes: A Multimodal Topic Modeling Approach to Conspiracy Theories on Telegram

Elisabeth Steffen

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

Comments 12 pages, 10 figures

Journal ref Proceedings of the Nineteenth International AAAI Conference on Web and Social Media, Vol. 19 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18937 2025-08-05 cs.CV cs.CL 81%

Kestrel: 3D Multimodal LLM for Part-Aware Grounded Description

Mahmoud Ahmed, Junjie Fei, Jian Ding, Eslam Mohamed Bakr, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡斯特大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11435 2025-08-05 cs.CV 79%

GLDesigner: Leveraging Multi-Modal LLMs as Designer for Enhanced Aesthetic Text Glyph Layouts

Junwen He, Yifan Wang, Lijun Wang, Huchuan Lu, Jun-Yan He, Chenyang Li, Hanyuan Chen, Jin-Peng Lan, Bin Luo, Yifeng Geng

机构 * Dalian University of Technology(大连理工大学) Alibaba Group(阿里巴巴集团)

专题命中 图文多模态 :multi-modal(title,abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02419 2025-08-05 cs.CV cs.CL 73%

Modality Bias in LVLMs: Analyzing and Mitigating Object Hallucination via Attention Lens

Haohan Zheng, Zhenguo Zhang

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01678 2025-08-05 cs.CV cs.AI 73%

Cure or Poison? Embedding Instructions Visually Alters Hallucination in Vision-Language Models

Zhaochen Wang, Yiwei Wang, Yujun Cai

机构 * The University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01219 2025-08-05 cs.CV cs.LG 70%

Eigen Neural Network: Unlocking Generalizable Vision with Eigenbasis

Anzhe Cheng, Chenzhong Yin, Mingxi Cheng, Shukai Duan, Shahin Nazarian, Paul Bogdan

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01308 2025-08-05 cs.CV 70%

Safeguarding Vision-Language Models: Mitigating Vulnerabilities to Gaussian Noise in Perturbation-based Attacks

Jiawei Wang, Yushen Zuo, Yuanjun Chai, Zhendong Liu, Yicheng Fu, Yichun Feng, Kin-Man Lam

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Washington(华盛顿大学) Nanjing University(南京大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10342 2025-08-05 cs.CV cs.AI 62%

UrbanSense:A Framework for Quantitative Analysis of Urban Streetscapes leveraging Vision Large Language Models

Jun Yin, Jing Zhong, Peilin Li, Ruolin Pan, Pengyu Zeng, Miao Zhang, Shuai Lu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01932 2025-08-05 cs.CV cs.AI 62%

Proactive Disentangled Modeling of Trigger-Object Pairings for Backdoor Defense

Kyle Stein, Andrew A. Mahyari, Guillermo Francia, Eman El-Sheikh

机构 * Department of Intelligent Systems and Robotics, University of West Florida(智能系统与机器人系,西佛罗里达大学) Florida Institute For Human and Machine Cognition (IHMC)(佛罗里达人类与机器认知研究所) Center for Cybersecurity, University of West Florida(网络安全中心,西佛罗里达大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Journal ref Computers, Materials & Continua, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01540 2025-08-05 cs.CV cs.AI 62%

MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning

Yi Liu, Xiao Xu, Zeyu Xu, Meng Zhang, Yibo Li, Haoyu Chen, Junkang Zhang, Qiang Wang, Jifa Sun, Siling Lin, Shengxun Cheng, Lingshu Zhang, Kang Wang

机构 * Project Leader(项目负责人) Corresponding Author(通讯作者)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01387 2025-08-05 cs.CV cs.AI 62%

Video-based Vehicle Surveillance in the Wild: License Plate, Make, and Model Recognition with Self Reflective Vision-Language Models

Pouya Parsa, Keya Li, Kara M. Kockelman, Seongjin Choi

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 19 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01921 2025-08-05 cs.CV 57%

InspectVLM: Unified in Theory, Unreliable in Practice

Conor Wallace, Isaac Corley, Jonathan Lwowski

机构 * Zeitview

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted to 2025 ICCV VISION Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01558 2025-08-05 cs.CV 57%

EvoVLMA: Evolutionary Vision-Language Model Adaptation

Kun Ding, Ying Wang, Shiming Xiang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments This paper has been accepted by ACM Multimedia 2025 (ACM MM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00945 2025-08-05 cs.CV 57%

Optimizing Vision-Language Consistency via Cross-Layer Regional Attention Alignment

Yifan Wang, Hongfeng Ai, Quangao Liu, Maowei Jiang, Ruiyuan Kang, Ruiqi Li, Jiahua Dong, Mengting Xiao, Cheng Jiang, Chenzhong Li

机构 * School of Medicine, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)医学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Wave and Machine Intelligence Department, Technology Innovation Institute(技术创新研究院波浪与机器智能部门) University of the Chinese Academy of Sciences(中国科学院大学) McGill University(麦吉尔大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12441 2025-08-05 cs.CV cs.LG 57%

Describe Anything Model for Visual Question Answering on Text-rich Images

Yen-Linh Vu, Dinh-Thang Duong, Truong-Binh Duong, Anh-Khoi Nguyen, Thanh-Huy Nguyen, Le Thien Phuc Nguyen, Jianhua Xing, Xingjian Li, Tianyang Wang, Ulas Bagci, Min Xu

机构 * AI VIETNAM Lab(AI越南实验室) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Northwestern University(西北大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

Comments 11 pages, 5 figures. Accepted to VisionDocs @ ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18645 2025-08-05 cs.CV 57%

Scendi Score: Prompt-Aware Diversity Evaluation via Schur Complement of CLIP Embeddings

Azim Ospanov, Mohammad Jalali, Farzan Farnia

机构 * The Chinese University of Hong Kong, Department of Computer Science & Engineering(香港中文大学计算机科学与工程系)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01361 2025-08-05 cs.RO 50%

VLH: Vision-Language-Haptics Foundation Model

Luis Francisco Moreno Fuentes, Muhammad Haris Khan, Miguel Altamirano Cabrera, Valerii Serpiva, Dmitri Iarchuk, Yara Mahmoud, Issatay Tokmurziyev, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory(智能空间机器人实验室) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 图文多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10011 2025-08-05 cs.RO 50%

KeyMPs: One-Shot Vision-Language Guided Motion Generation by Sequencing DMPs for Occlusion-Rich Tasks

Edgar Anarossi, Yuhwan Kwon, Hirotaka Tahara, Shohei Tanaka, Keisuke Shirai, Masashi Hamaya, Cristian C. Beltran-Hernandez, Atsushi Hashimoto, Takamitsu Matsubara

机构 * Division of Information Science, Graduate School of Science and Technology, Nara Institute of Science and Technology(信息科学系,科学技术研究生学校,科学技术研究所) Department of Electrical and Electronic Engineering, Faculty of Engineering Science, Kansai University(电气电子工程系,工学科学大学) Department of Electronics, Kobe City College of Technology(电子系,神户市立技术学院) OMRON SINIC X Corporation(OMRON SINIC X公司)

专题命中 图文多模态 :multimodal(abstract)

Comments Published in IEEE Access, Jul 14 2025

Journal ref IEEE Access, vol. 13, pp. 125420-125441, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2508.02000 2025-08-05 cs.SD cs.CV eess.AS eess.IV 81%

Localizing Audio-Visual Deepfakes via Hierarchical Boundary Modeling

Xuanjun Chen, Shih-Peng Cheng, Jiawei Du, Lin Zhang, Xiaoxiao Miao, Chung-Che Wang, Haibin Wu, Hung-yi Lee, Jyh-Shing Roger Jang

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、eess.AS

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21448 2025-08-05 eess.AS cs.ET cs.LG 79%

Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations

T. Aleksandra Ma, Sile Yin, Li-Chia Yang, Shuo Zhang

机构 * School of Music(音乐学院) Research(研究)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

Comments Accepted into Interspeech 2025; corrected author name typo

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01915 2025-08-05 cs.CV cs.ET cs.HC cs.LG cs.SD eess.AS 62%

EgoTrigger: Toward Audio-Driven Image Capture for Human Memory Enhancement in All-Day Energy-Efficient Smart Glasses

Akshay Paruchuri, Sinan Hersek, Lavisha Aggarwal, Qiao Yang, Xin Liu, Achin Kulshrestha, Andrea Colaco, Henry Fuchs, Ishan Chatterjee

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Google(谷歌)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、eess.AS

Comments 15 pages, 6 figres, 6 tables. Accepted to ISMAR 2025 as a TVCG journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06690 2025-08-05 cs.SD cs.AI cs.MM 62%

Benchmarking Sub-Genre Classification For Mainstage Dance Music

Hongzhi Shu, Xinglin Li, Hongyu Jiang, Minghao Fu, Xinyu Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Southeast University(东南大学) National University of Defense Technology(国防科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM

Comments WASPAA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01092 2025-08-05 cs.HC 50%

DescribePro: Collaborative Audio Description with Human-AI Interaction

Maryam Cheema, Sina Elahimanesh, Samuel Martin, Pooyan Fazli, Hasti Seifi

专题命中 音频语音多模态 :multimodal(abstract)

Comments ASSETS 25 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2507.16596 2025-08-05 cs.CV 83%

A Multimodal Deviation Perceiving Framework for Weakly-Supervised Temporal Forgery Localization

Wenbo Xu, Junyan Wu, Wei Lu, Xiangyang Luo, Qian Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室) School of Cyber Science and Engineering, Wuhan University(网络科学与工程学院,武汉大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

Comments 9 pages, 3 figures,conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05185 2025-08-05 q-fin.CP cs.AI cs.MM 81%

Towards Temporal-Aware Multi-Modal Retrieval Augmented Generation in Finance

Fengbin Zhu, Junfeng Li, Liangming Pan, Wenjie Wang, Fuli Feng, Chao Wang, Huanbo Luan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Estates Pte Ltd(6Estates私人有限公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI、cs.MM

Comments Accepted by MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19378 2025-08-05 cs.CV cs.AI cs.CL cs.LG 80%

Libra: Leveraging Temporal Images for Biomedical Radiology Analysis

Xi Zhang, Zaiqiao Meng, Jake Lever, Edmond S. L. Ho

机构 * Information Retrieval Group(信息检索组) AI4BioMed Lab(AI4BioMed实验室) School of Computing Science(计算科学学院) University of Glasgow(格拉斯哥大学)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

Comments 30 pages, 5 figures, Adding Appendix

Journal ref Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02179 2025-08-05 cs.CV 79%

Weakly Supervised Multimodal Temporal Forgery Localization via Multitask Learning

Wenbo Xu, Wei Lu, Xiangyang Luo

机构 * School of Computer Science and Engineering, MoE Key Laboratory of Information Technology, Guangdong Province Key Laboratory of Information Security Technology, Sun Yat-sen University(计算机科学与工程学院、信息科技教育部重点实验室、广东省信息安全技术重点实验室、中山大学) State Key Laboratory of Mathematical Engineering and Advanced Computing(数学工程与先进计算国家重点实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments 13 pages,4 figures. arXiv admin note: text overlap with arXiv:2507.16596

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01701 2025-08-05 cs.LG cs.AI 79%

MHARFedLLM: Multimodal Human Activity Recognition Using Federated Large Language Model

Asmit Bandyopadhyay, Rohit Basu, Tanmay Sen, Swagatam Das

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01168 2025-08-05 cs.MM 79%

Graph-based Interaction Augmentation Network for Robust Multimodal Sentiment Analysis

Hu Zhangfeng, Shi mengxin

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏