arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-07-29 至 2025-07-29 共收录 105 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 13 篇

2507.20994 2025-07-29 cs.CV cs.AI 86%

Security Tensors as a Cross-Modal Bridge: Extending Text-Aligned Safety to Vision in LVLM

Shen Li, Liuyi Yao, Wujia Niu, Lan Zhang, Yaliang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

Comments Codes and data are available at https://github.com/listen0425/Security-Tensors

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20913 2025-07-29 cs.CV cs.AI 84%

HAMLET-FFD: Hierarchical Adaptive Multi-modal Learning Embeddings Transformation for Face Forgery Detection

Jialei Cui, Jianwei Du, Yanzhe Li, Lei Gao, Hui Jiang, Chenfu Bao

机构 * Baidu Inc.(百度公司) Southeast University(东南大学) Tsinghua University(清华大学)

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20156 2025-07-29 cs.CV cs.AI 84%

Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality

Daulet Toibazar, Kesen Wang, Sherif Mohamed, Abdulaziz Al-Badawi, Abdulrahman Alfulayt, Pedro J. Moreno

机构 * Humain Riyadh, KSA(利雅得人类,沙特阿拉伯)

专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21226 2025-07-29 cs.CV cs.AI 82%

MemeBLIP2: A novel lightweight multimodal system to detect harmful memes

Jiaqi Liu, Ran Tong, Aowei Shen, Shuzheng Li, Changlin Yang, Lisha Xu

机构 * Mathematics and Statistics Department, University of Texas at Dallas(德克萨斯大学达拉斯分校数学与统计学系)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments 11 pages, 3 figures. Accepted at the First Workshop on Multimodal Knowledge and Language Modeling (MKLM), IJCAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19870 2025-07-29 cs.CV cs.HC 70%

OW-CLIP: Data-Efficient Visual Supervision for Open-World Object Detection via Human-AI Collaboration

Junwen Duan, Wei Xue, Ziyao Kang, Shixia Liu, Jiazhi Xia

机构 * School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) School of Software, Tsinghua University(清华大学软件学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

Comments 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14346 2025-07-29 cs.CV 70%

Egocentric Action-aware Inertial Localization in Point Clouds with Vision-Language Guidance

Mingfang Zhang, Ryo Yonetani, Yifei Huang, Liangyang Ouyang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学) CyberAgent AI Lab(CyberAgent AI实验室)

专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05983 2025-07-29 cs.CV 70%

Chimera: Improving Generalist Model with Domain-Specific Experts

Tianshuo Peng, Mingsheng Li, Jiakang Yuan, Hongbin Zhou, Renqiu Xia, Renrui Zhang, Lei Bai, Song Mao, Bin Wang, Aojun Zhou, Botian Shi, Tao Chen, Bo Zhang, Xiangyu Yue

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) MMLab College of Future Information Technology, Fudan University(未来信息技术学院,复旦大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图文多模态 :multi-modal(abstract);image-text(abstract);分类 cs.CV

Comments Accepted by ICCV-2025, Chimera Homepage: https://alpha-innovator.github.io/chimera_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20397 2025-07-29 cs.CV 57%

VESPA: Towards un(Human)supervised Open-World Pointcloud Labeling for Autonomous Driving

Levente Tempfli, Esteban Rivera, Markus Lienkamp

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20188 2025-07-29 cs.CV 57%

SAViL-Det: Semantic-Aware Vision-Language Model for Multi-Script Text Detection

Mohammed-En-Nadhir Zighem, Abdenour Hadid

机构 * Sorbonne Center for Artificial Intelligence, Sorbonne University Abu Dhabi, UAE(索邦人工智能中心,阿布扎比分校,阿联酋)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19875 2025-07-29 cs.CV 57%

ATCTrack: Aligning Target-Context Cues with Dynamic Target States for Robust Vision-Language Tracking

X. Feng, S. Hu, X. Li, D. Zhang, M. Wu, J. Zhang, X. Chen, K. Huang

机构 * School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, CASIA(复杂系统认知与决策智能重点实验室,中国科学院自动化所) School of Physical and Mathematical Sciences, NTU(物理与数学科学学院,国立新加坡大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments Accepted by ICCV2025 Highlight ~

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15480 2025-07-29 cs.CV 57%

One Last Attention for Your Vision-Language Model

Liang Chen, Ghazi Shazan Ahmad, Tianjun Yao, Lingqiao Liu, Zhiqiang Shen

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17762 2025-07-29 cs.CV 57%

MUSE-VL: Modeling Unified VLM through Semantic Discrete Encoding

Rongchang Xie, Chen Du, Ping Song, Chang Liu

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10341 2025-07-29 cs.RO cs.AI cs.LG 57%

Affordance-Guided Reinforcement Learning via Visual Prompting

Olivia Y. Lee, Annie Xie, Kuan Fang, Karl Pertsch, Chelsea Finn

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI

Comments 8 pages, 6 figures. IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2507.20740 2025-07-29 cs.CV 83%

Implicit Counterfactual Learning for Audio-Visual Segmentation

Mingfeng Zha, Tianyu Li, Guoqing Wang, Peng Wang, Yangyang Wu, Yang Yang, Heng Tao Shen

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19956 2025-07-29 cs.CV cs.AI q-bio.NC 81%

Predicting Brain Responses To Natural Movies With Multimodal LLMs

Cesar Kadir Torrico Villanueva, Jiaxin Cindy Tu, Mihir Tripathy, Connor Lane, Rishab Iyer, Paul S. Scotti

机构 * Medical AI Research Center (MedARC)(医学人工智能研究中心(MedARC)) Psychological and Brain Sciences, Dartmouth College(心理学与脑科学系,达特茅斯学院) Core for Advanced Magnetic Resonance Imaging (CAMRI), Baylor College of Medicine(先进磁共振成像核心(CAMRI),贝勒医学院) Sophont Princeton Neuroscience Institute(普林斯顿神经科学研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

Comments Code available at https://github.com/MedARC-AI/algonauts2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08714 2025-07-29 cs.CV cs.AI 81%

Versatile Multimodal Controls for Expressive Talking Human Animation

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Zixin Zhu, Sanping Zhou, Ming Yang, Le Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) University at Buffalo(布法罗大学)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ACM MM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20579 2025-07-29 cs.CV 79%

AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations

Zhixi Cai, Kartik Kuckreja, Shreya Ghosh, Akanksha Chuchra, Muhammad Haris Khan, Usman Tariq, Tom Gedeon, Abhinav Dhall

机构 * Monash University(墨尔本大学) Curtin University(Curtin大学) American University of Sharjah(沙迦美国大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04258 2025-07-29 cs.SD cs.AI cs.CV eess.AS 67%

TAIL: Text-Audio Incremental Learning

Yingfei Sun, Xu Gu, Wei Ji, Hanbin Zhao, Yifang Yin, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CV、cs.AI、eess.AS

Comments 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 16 篇

2507.20451 2025-07-29 cs.AI 79%

STARN-GAT: A Multi-Modal Spatio-Temporal Graph Attention Network for Accident Severity Prediction

Pritom Ray Nobin, Imran Ahammad Rifat

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20163 2025-07-29 cs.CV 79%

Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video Captioning

Zeyu Xi, Haoying Sun, Yaofei Wu, Junchi Yan, Haoran Zhang, Lifang Wu, Liang Wang, Changwen Chen

机构 * Beijing University of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10503 2025-07-29 cs.CV cs.CL cs.LG 79%

Everything is a Video: Unifying Modalities through Next-Frame Prediction

G. Thomas Hudson, Dean Slack, Thomas Winterbottom, Jamie Sterling, Chenghao Xiao, Junjie Shentu, Noura Al Moubayed

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13092 2025-07-29 cs.CV 70%

EventVAD: Training-Free Event-Aware Video Anomaly Detection

Yihua Shao, Haojin He, Sijie Li, Siyu Chen, Xinwei Long, Fanhu Zeng, Yuxuan Fan, Muyang Zhang, Ziyang Yan, Ao Ma, Xiaochen Wang, Hao Tang, Yan Wang, Shuyan Li

机构 * Peking University(北京大学) Guangdong University of Technology(广东工业大学) The University of Sheffield(谢菲尔德大学) University of Science and Technology Beijing(北京科技大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Nanjing University(南京大学) University of Trento(特伦特大学) Queen's University Belfast(贝尔法斯特女王大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

Comments Paper was accepted by ACM MM 2025; Code: https://github.com/YihuaJerry/EventVAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17402 2025-07-29 cs.CV cs.IR cs.MM 62%

HLFormer: Enhancing Partially Relevant Video Retrieval with Hyperbolic Learning

Jun Li, Jinpeng Wang, Chaolei Tan, Niu Lian, Long Chen, Yaowei Wang, Min Zhang, Shu-Tao Xia, Bin Chen

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Research Center of Artificial Intelligence, Peng Cheng Laboratory(鹏城实验室人工智能研究中心) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments Accepted by ICCV'25. 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20629 2025-07-29 cs.CV 57%

DAMS:Dual-Branch Adaptive Multiscale Spatiotemporal Framework for Video Anomaly Detection

Dezhi An, Wenqiang Liu, Kefan Wang, Zening Chen, Jun Lu, Shengcai Zhang

机构 * School of Cyberspace Security,Gansu University of Political Science and Law(网络安全学院、政治学科学校)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 13 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20939 2025-07-29 cs.CV 57%

ARC-Hunyuan-Video-7B: Structured Video Comprehension of Real-World Shorts

Yuying Ge, Yixiao Ge, Chen Li, Teng Wang, Junfu Pu, Yizhuo Li, Lu Qiu, Jin Ma, Lisheng Duan, Xinyu Zuo, Jinwen Luo, Weibo Gu, Zexuan Li, Xiaojing Zhang, Yangyu Tao, Han Hu, Di Wang, Ying Shan

机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Search Application Department, Tencent CSIG(腾讯CSIG搜索应用部门) Tencent Hunyuan(腾讯文生视频) Big Data Platform Department, Tencent PCG(腾讯PCG大数据平台部门)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments Project Page: https://tencentarc.github.io/posts/arc-video-announcement/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20763 2025-07-29 cs.CV 57%

KASportsFormer: Kinematic Anatomy Enhanced Transformer for 3D Human Pose Estimation on Short Sports Scene Video

Zhuoer Yin, Calvin Yeung, Tomohiro Suzuki, Ryota Tanaka, Keisuke Fujii

机构 * Nagoya University(名古屋大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19948 2025-07-29 cs.CV 57%

UniCT Depth: Event-Image Fusion Based Monocular Depth Estimation with Convolution-Compensated ViT Dual SA Block

Luoxi Jing, Dianxi Shi, Zhe Liu, Songchang Jin, Chunping Qiu, Ziteng Qiao, Yuxian Li, Jianqiang Xia

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Intelligent Game and Decision Lab (IGDL)(智能游戏与决策实验室) College of Computer, National University of Defense Technology(国防科技大学计算机学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学系)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025 (International Joint Conference on Artificial Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19863 2025-07-29 cs.MM 57%

Anchoring Trends: Mitigating Social Media Popularity Prediction Drift via Feature Clustering and Expansion

Chia-Ming Lee, Bo-Cheng Qiu, Cheng-Jun Kang, Yi-Hsuan Wu, Jun-Lin Chen, Yu-Fan Lin, Yi-Shiuan Chou, Chih-Chung Hsu

专题命中 视频多模态 :multi-modal(abstract);分类 cs.MM

Comments Accepted by ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01301 2025-07-29 cs.RO cs.AI 57%

Bi-LAT: Bilateral Control-Based Imitation Learning via Natural Language and Action Chunking with Transformers

Takumi Kobayashi, Masato Kobayashi, Thanpimon Buamanee, Yuki Uranishi

机构 * Graduate School of Information Science and Technology, The University of Osaka(信息科学与技术研究生学校,大阪大学) D3 Center, The University of Osaka(大阪大学D3中心) Graduate School of Maritime Sciences, Kobe University(海洋科学研究生学校, Kobe大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19599 2025-07-29 cs.CV 57%

Object-centric Video Question Answering with Visual Grounding and Referring

Haochen Wang, Qirui Chen, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie, Stratis Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) SAI, Shanghai Jiao Tong University(上海交通大学SAI研究所) Xiaohongshu Inc(小红书公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏