arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2512.08979 2025-12-11 cs.CV cs.AI 62%

What Happens When: Learning Temporal Orders of Events in Videos

当什么发生时:学习视频中事件的时间顺序

Daechul Ahn, Yura Choi, Hyeonbeom Choi, Seongwon Cho, San Kim, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MECOT方法,通过事件级描述训练和思维链提示提升视频模型对事件时间顺序的理解能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06963 2025-12-09 cs.RO cs.AI cs.CV 62%

VideoVLA: Video Generators Can Be Generalizable Robot Manipulators

VideoVLA: 视频生成器可以成为通用的机器人操作器

Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, Baining Guo

机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。

Comments Project page: https://videovla-nips2025.github.io

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06032 2025-12-09 cs.CV cs.AI 62%

The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation

在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04532 2025-12-05 cs.CV cs.AI 62%

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05332 2025-12-03 cs.CV cs.CL 62%

Unleashing Hour-Scale Video Training for Long Video-Language Understanding

释放小时级视频训练以实现长视频-语言理解

Jingyang Lin, Jialian Wu, Ximeng Sun, Ze Wang, Jiang Liu, Yusheng Su, Xiaodong Yu, Hao Chen, Jiebo Luo, Zicheng Liu, Emad Barsoum

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出VideoMarathon数据集和Hour-LLaVA模型,通过小时级视频训练提升长视频-语言理解能力。

Comments NeurIPS 2025, Project page: https://videomarathon.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 62%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21439 2025-11-27 cs.CV cs.AI 62%

EvRainDrop: HyperGraph-guided Completion for Effective Frame and Event Stream Aggregation

EvRainDrop:基于超图的高效帧和事件流聚合

Futian Wang, Fan Zhang, Xiao Wang, Mengqi Wang, Dexing Huang, Jin Tang

机构 * School of Computer Science and Technology, Anhui University(计算机科学与技术学院,安徽大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 EvRainDrop通过超图引导的方法完成事件流,实现多模态特征的有效融合与学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 62%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18711 2025-11-25 cs.CV cs.AI 62%

Modality-Collaborative Low-Rank Decomposers for Few-Shot Video Domain Adaptation

模态协同低秩分解器用于少样本视频域适应

Yuyang Wanyan, Xiaoshan Yang, Weiming Dong, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) PengCheng Laboratory(鹏城实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出模态协同低秩分解器,通过分解不同领域偏移级别的模态特征,提升少样本视频域适应的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27280 2025-11-25 cs.CV cs.AI cs.LG 62%

FOCUS: Efficient Keyframe Selection for Long Video Understanding

FOCUS: 长视频理解中的高效关键帧选择

Zirui Zhu, Hailun Xu, Yang Luo, Yong Liu, Kanchan Sarkar, Zhenheng Yang, Yang You

机构 * National University of Singapore(新加坡国立大学) TikTok

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FOCUS通过两阶段探索-利用策略,在严格标记预算下高效选择关键帧,提升长视频理解的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14186 2025-11-19 cs.CV cs.AI 62%

Few-Shot Precise Event Spotting via Unified Multi-Entity Graph and Distillation

Zhaoyu Liu, Kan Jiang, Murong Ma, Zhe Hou, Yun Lin, Jin Song Dong

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments The 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14119 2025-11-19 cs.MM cs.AI 62%

Real-Time Mobile Video Analytics for Pre-arrival Emergency Medical Services

Liuyi Jin, Amran Haroon, Radu Stoleru, Pasan Gunawardena, Michael Middleton, Jeeeun Kim

机构 * Engineering, Texas A\&M University Emergency Medical Services (EMS), Texas A\&M University

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12868 2025-11-18 cs.CV cs.AI 62%

Video Finetuning Improves Reasoning Between Frames

Ruiqi Yang, Tian Yun, Zihan Wang, Ellie Pavlick

机构 * Brown University(布朗大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted at CogInterp @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11880 2025-11-18 cs.LG cs.AI cs.CV 62%

Transformers vs. Recurrent Models for Estimating Forest Gross Primary Production

David Montero, Miguel D. Mahecha, Francesco Martinuzzi, César Aybar, Anne Klosterhalfen, Alexander Knohl, Jesús Anaya, Clemens Mosig, Sebastian Wieneke

机构 * IEF, Leipzig University(莱比锡大学IEF) iDiv MPI PKS(马克斯·普朗克研究所) IPL, Universitat de València(瓦伦西亚大学IPL) Bioclimatology, University of Göttingen(哥廷根大学生物气候学系) GEMA, Universidad de Medellín(梅迪纳大学GEMA)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10202 2025-11-17 cs.CL cs.CV 62%

Q2E: Query-to-Event Decomposition for Zero-Shot Multilingual Text-to-Video Retrieval

Shubhashis Roy Dipta, Francis Ferraro

机构 * Department of Computer Science and Electrical Engineering University of Maryland Baltimore County(计算机科学与电气工程系马里兰大学巴尔的摩县)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted in IJCNLP-AACL 2025 (also presented in MAGMAR 2025 at ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12067 2025-11-17 cs.CV cs.AI cs.LG 62%

Survey of Action Recognition, Spotting and Spatio-Temporal Localization in Soccer -- Current Trends and Research Perspectives

Karolina Seweryn, Anna Wróblewska, Szymon Łukasik

机构 * NASK - National Research Institute(国家研究 institute) Faculty of Mathematics and Information Science, Warsaw University of Technology(数学与信息科学学院,华沙技术大学) Faculty of Physics and Applied Computer Science, AGH University of Science and Technology(物理与应用计算机科学学院,AGH科技大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Journal ref ACM Transactions on Intelligent Systems and Technology (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08535 2025-11-12 cs.CV cs.AI 62%

Large Sign Language Models: Toward 3D American Sign Language Translation

Sen Zhang, Xiaoxiao He, Di Liu, Zhaoyang Xia, Mingyu Zhao, Chaowei Tan, Vivian Li, Bo Liu, Dimitris N. Metaxas, Mubbasir Kapadia

机构 * Rutgers University(罗格斯大学) Meta Reality Labs(Meta现实实验室) Qualcomm(高通公司) Walmart Global Tech(沃尔玛全球技术) Roblox PRISMS

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18094 2025-11-11 cs.CV cs.AI 62%

UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning

Ye Liu, Zongyang Ma, Junfu Pu, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) vivo Mobile Communication Co.(vivo移动通信公司) MindWingman Technology (Shenzhen) Co., Ltd.(深圳MindWingman技术有限公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2025 Camera Ready. Project Page: https://polyu-chenlab.github.io/unipixel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06344 2025-11-11 cs.CL cs.AI 62%

TimeSense:Making Large Language Models Proficient in Time-Series Analysis

Zhirui Zhang, Changhua Pei, Tianyi Gao, Zhe Xie, Yibo Hao, Zhaoyang Yu, Longlong Xu, Tong Xiao, Jing Han, Dan Pei

机构 * Tsinghua University(清华大学) Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ZTE Corporation(中兴通讯)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05783 2025-11-04 cs.CV cs.AI 62%

Video Flow as Time Series: Discovering Temporal Consistency and Variability for VideoQA

Zijie Song, Zhenzhen Hu, Yixiao Ma, Jia Li, Richang Hong

机构 * Hefei University of Technology, Hefei, China(合肥工业大学) University of Science and Technology of China, Hefei, China(中国科学技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26978 2025-11-03 cs.CV cs.CL 62%

Semantic Frame Aggregation-based Transformer for Live Video Comment Generation

Anam Fatima, Yi Yu, Janak Kapuriya, Julien Lalanne, Jainendra Shukla

机构 * IIIT-Delhi, India(德里印度理工学院) Grenoble INP – Ensimag, France(法国格勒诺布尔INP–Ensimag)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24720 2025-10-30 cs.HC cs.AI cs.CV 62%

Modelling the Interplay of Eye-Tracking Temporal Dynamics and Personality for Emotion Detection in Face-to-Face Settings

Meisam J. Seikavandi, Jostein Fimland, Fabricio Batista Narcizo, Maria Barrett, Ted Vucurevich, Jesper Bünsow Boldt, Andrew Burke Dittberner, Paolo Burelli

机构 * brAIn Lab, IT University of Copenhagen(brAIn实验室,丹麦技术大学) GN Advanced Science(GN先进科学) IT University of Copenhagen(丹麦技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23630 2025-10-29 cs.LG cs.AI cs.CL 62%

NUM2EVENT: Interpretable Event Reasoning from Numerical time-series

Ninghui Feng, Yiyan Qi

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA)) University of Nottingham Ningbo(诺丁汉大学宁波校区)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22602 2025-10-28 cs.CL cs.AI cs.CY 62%

Personal Care Utility (PCU): Building the Health Infrastructure for Everyday Insight and Guidance

Mahyar Abbasian, Ramesh Jain

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

Comments 22 pages, 2 figures, 1 table, Journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21813 2025-10-28 cs.CV cs.AI cs.LG 62%

SITS-DECO: A Generative Decoder Is All You Need For Multitask Satellite Image Time Series Modelling

Samuel J. Barrett, Docko Sow

机构 * LGND AI Tolbi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03674 2025-10-27 cs.CV cs.AI 62%

Action Quality Assessment via Hierarchical Pose-guided Multi-stage Contrastive Regression

Mengshi Qi, Hao Ye, Jiaxuan Peng, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, China(网络与交换技术国家重点实验室,北京邮电大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16708 2025-10-23 cs.CL cs.AI 62%

Natural Language Processing for Cardiology: A Narrative Review

Kailai Yang, Yan Leng, Xin Zhang, Tianlin Zhang, Paul Thompson, Bernard Keavney, Maciej Tomaszewski, Sophia Ananiadou

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16444 2025-10-21 cs.CV cs.MM cs.RO eess.IV 62%

RefAtomNet++: Advancing Referring Atomic Video Action Recognition using Semantic Retrieval based Multi-Trajectory Mamba

Kunyu Peng, Di Wen, Jia Fu, Jiamin Wu, Kailun Yang, Junwei Zheng, Ruiping Liu, Yufan Chen, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Rainer Stiefelhagen

机构 * Institute for Anthropomatics and Robotics, Karlsruhe Institute of Technology(人机化研究所,卡尔斯鲁厄技术大学) RISE Research Institutes of Sweden(瑞典RISE研究机构) KTH Royal Institute of Technology(皇家理工学院) School of Artificial Intelligence and Robotics(人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心) Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

Comments Extended version of ECCV 2024 paper arXiv:2407.01872. The dataset and code are released at https://github.com/KPeng9510/refAVA2

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16836 2025-10-16 cs.CV cs.AI 62%

Fact-R1: Towards Explainable Video Misinformation Detection with Deep Reasoning

Fanrui Zhang, Dian Li, Qiang Zhang, Jun Chen, Gang Liu, Junxiong Lin, Jiahong Yan, Jiawei Liu, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, USTC(脑启发智能感知与认知国家重点实验室,中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Tencent QQ(腾讯QQ) Fudan University(复旦大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 34 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16845 2025-10-15 cs.CV cs.AI cs.LG 62%

NinA: Normalizing Flows in Action. Training VLA Models with Normalizing Flows

Denis Tarasov, Alexander Nikulin, Ilya Zisman, Albina Klepach, Nikita Lyubaykin, Andrei Polubarov, Alexander Derevyagin, Vladislav Kurenkov

机构 * ETH Zürich(苏黎世联邦理工学院) MIPT(莫斯科国立信息安全大学) Skoltech(斯克里普斯基技术大学) Innopolis University(因诺波利斯大学) HSE(俄罗斯高等经济学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments https://github.com/dunnolab/NinA/

详情

展开后加载摘要…

URL PDF HTML 收藏