arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4749 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4749 篇

2504.14588 2025-04-22 cs.RO cs.AI cs.CV 62%

Phoenix: A Motion-based Self-Reflection Framework for Fine-grained Robotic Action Correction

Wenke Xia, Ruoxuan Feng, Dong Wang, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京耿丽人工智能学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13035 2025-04-18 cs.CV cs.AI 62%

Prototypes are Balanced Units for Efficient and Effective Partially Relevant Video Retrieval

WonJun Moon, Cheol-Ho Cho, Woojin Jun, Minho Shim, Taeoh Kim, Inwoong Lee, Dongyoon Wee, Jae-Pil Heo

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08222 2025-04-16 cs.CV cs.AI 62%

F$^3$Set: Towards Analyzing Fast, Frequent, and Fine-grained Events from Videos

Zhaoyu Liu, Kan Jiang, Murong Ma, Zhe Hou, Yun Lin, Jin Song Dong

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025; Website URL: https://lzyandy.github.io/f3set-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00883 2025-04-16 cs.CV cs.AI 62%

Improved Visual-Spatial Reasoning via R1-Zero-Like Training

Zhenyi Liao, Qingsong Xie, Yanhao Zhang, Zijian Kong, Haonan Lu, Zhenyu Yang, Zhijie Deng

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07745 2025-04-11 cs.CV cs.AI 62%

SF2T: Self-supervised Fragment Finetuning of Video-LLMs for Fine-Grained Understanding

Yangliu Hu, Zikai Song, Na Feng, Yawei Luo, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09921 2025-04-07 cs.CV cs.AI 62%

Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level

Andong Deng, Tongjia Chen, Shoubin Yu, Taojiannan Yang, Lincoln Spencer, Yapeng Tian, Ajmal Saeed Mian, Mohit Bansal, Chen Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21848 2025-03-31 cs.CV cs.AI 62%

Comparative Analysis of Image, Video, and Audio Classifiers for Automated News Video Segmentation

Jonathan Attard, Dylan Seychell

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Preprint for paper in CAI 2025, 7 pages, 5 tables, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00493 2025-03-28 cs.CV cs.CL 62%

Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding

Duo Zheng, Shijia Huang, Liwei Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19680 2025-03-28 cs.CV cs.AI 62%

M-LLM Based Video Frame Selection for Efficient Video Understanding

Kai Hu, Feng Gao, Xiaohan Nie, Peng Zhou, Son Tran, Tal Neiman, Lingyun Wang, Mubarak Shah, Raffay Hamid, Bing Yin, Trishul Chilimbi

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19794 2025-03-26 cs.CV cs.AI cs.LG 62%

PAVE: Patching and Adapting Video Large Language Models

Zhuoming Liu, Yiquan Li, Khoi Duc Nguyen, Yiwu Zhong, Yin Li

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.AI

Comments CVPR2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08601 2025-03-25 cs.SD cs.MM eess.AS 62%

STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment

Yong Ren, Chenxing Li, Manjie Xu, Wei Liang, Yu Gu, Rilin Chen, Dong Yu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.MM、eess.AS

Comments ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07411 2025-03-24 cs.CV cs.MM 62%

EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering

Sheng Zhou, Junbin Xiao, Qingyun Li, Yicong Li, Xun Yang, Dan Guo, Meng Wang, Tat-Seng Chua, Angela Yao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16173 2025-03-24 cs.CV cs.AI 62%

SALOVA: Segment-Augmented Long Video Assistant for Targeted Retrieval and Routing in Long-Form Video Analysis

Junho Kim, Hyunjun Kim, Hosu Lee, Yong Man Ro

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Project page: https://ivy-lvlm.github.io/SALOVA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17856 2025-03-21 cs.CV cs.AI 62%

ROCKET-1: Mastering Open-World Interaction with Visual-Temporal Context Prompting

Shaofei Cai, Zihao Wang, Kewei Lian, Zhancun Mu, Xiaojian Ma, Anji Liu, Yitao Liang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12964 2025-03-18 cs.CV cs.AI cs.LG 62%

Training Video Foundation Models with NVIDIA NeMo

Zeeshan Patel, Ethan He, Parth Mannan, Xiaowei Ren, Ryan Wolf, Niket Agarwal, Jacob Huffman, Zhuoyao Wang, Carl Wang, Jack Chang, Yan Bai, Tommy Huang, Linnan Wang, Sahil Jain, Shanmugam Ramasamy, Joseph Jennings, Ekaterina Sirazitdinova, Oleg Sudakov, Mingyuan Ma, Bobby Chen, Forrest Lin, Hao Wang, Vasanth Rao Naik Sabavat, Sriharsha Niverty, Rong Ou, Pallab Bhattacharya, David Page, Nima Tajbakhsh, Ashwath Aithal

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10625 2025-03-14 cs.CV cs.AI 62%

LHM: Large Animatable Human Reconstruction Model from a Single Image in Seconds

Lingteng Qiu, Xiaodong Gu, Peihao Li, Qi Zuo, Weichao Shen, Junfei Zhang, Kejie Qiu, Weihao Yuan, Guanying Chen, Zilong Dong, Liefeng Bo

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Project Page: https://lingtengqiu.github.io/LHM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10075 2025-03-14 cs.CV cs.AI 62%

HecVL: Hierarchical Video-Language Pretraining for Zero-shot Surgical Phase Recognition

Kun Yuan, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

Comments Accepted by MICCAI2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11584 2025-03-14 cs.RO cs.AI cs.CV 62%

DeformPAM: Data-Efficient Learning for Long-horizon Deformable Object Manipulation via Preference-based Action Alignment

Wendi Chen, Han Xue, Fangyuan Zhou, Yuan Fang, Cewu Lu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted to ICRA 2025. Project page: https://deform-pam.robotflow.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07860 2025-03-12 cs.CV cs.AI cs.LG 62%

Video Action Differencing

James Burgess, Xiaohan Wang, Yuhui Zhang, Anita Rau, Alejandro Lozano, Lisa Dunlap, Trevor Darrell, Serena Yeung-Levy

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments ICLR 2025 (International Conference on Learning Representations) Project page: http://jmhb0.github.io/viddiff Benchmark: https://huggingface.co/datasets/jmhb/VidDiffBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00054 2025-03-04 cs.CV cs.AI cs.LG 62%

Deciphering the complaint aspects: Towards an aspect-based complaint identification model with video complaint dataset in finance

Sarmistha Das, Basha Mujavarsheik, R E Zera Lyngkhoi, Sriparna Saha, Alka Maurya

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21271 2025-03-03 cs.CV cs.AI cs.LG 62%

Adaptive Keyframe Sampling for Long Video Understanding

Xi Tang, Jihao Qiu, Lingxi Xie, Yunjie Tian, Jianbin Jiao, Qixiang Ye

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19026 2025-02-27 eess.IV cs.AI cs.CV 62%

InternVQA: Advancing Compressed Video Quality Assessment with Distilling Large Foundation Model

Fengbin Guan, Zihao Yu, Yiting Lu, Xin Li, Zhibo Chen

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted by ISCAS 2025(Lecture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16602 2025-02-25 cs.CV cs.AI 62%

VidLBEval: Benchmarking and Mitigating Language Bias in Video-Involved LVLMs

Yiming Yang, Yangyang Guo, Hui Lu, Yan Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13845 2025-02-25 cs.CV cs.AI cs.LG 62%

Do Language Models Understand Time?

Xi Ding, Lei Wang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments Accepted for publication in the Companion Proceedings of the ACM Web Conference (WWW Companion 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12081 2025-02-18 cs.CV cs.CL 62%

Unhackable Temporal Rewarding for Scalable Video MLLMs

En Yu, Kangheng Lin, Liang Zhao, Yana Wei, Zining Zhu, Haoran Wei, Jianjian Sun, Zheng Ge, Xiangyu Zhang, Jingyu Wang, Wenbing Tao

专题命中 视频多模态 :MLLM(abstract);分类 cs.CV、cs.CL

Comments Accepted by ICLR2025. Project Page: https://ahnsun.github.io/UTR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11168 2025-02-18 cs.CV cs.AI 62%

Knowing Your Target: Target-Aware Transformer Makes Better Spatio-Temporal Video Grounding

Xin Gu, Yaojie Shen, Chenxi Luo, Tiejian Luo, Yan Huang, Yuewei Lin, Heng Fan, Libo Zhang

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18538 2025-02-12 cs.CV cs.AI eess.IV 62%

VideoQA-SC: Adaptive Semantic Communication for Video Question Answering

Jiangyuan Guo, Wei Chen, Yuxuan Sun, Jialong Xu, Bo Ai

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11619 2025-02-11 cs.CV cs.CL 62%

MultiVENT 2.0: A Massive Multilingual Benchmark for Event-Centric Video Retrieval

Reno Kriz, Kate Sanders, David Etter, Kenton Murray, Cameron Carpenter, Kelly Van Ochten, Hannah Recknor, Jimena Guallar-Blasco, Alexander Martin, Ronald Colaianni, Nolan King, Eugene Yang, Benjamin Van Durme

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17643 2025-01-30 cs.CL cs.AI 62%

Tonguescape: Exploring Language Models Understanding of Vowel Articulation

Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11775 2025-01-28 cs.CV cs.AI 62%

Task Me Anything

Jieyu Zhang, Weikai Huang, Zixian Ma, Oscar Michel, Dong He, Tanmay Gupta, Wei-Chiu Ma, Ali Farhadi, Aniruddha Kembhavi, Ranjay Krishna

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments NeurIPS 2024 Track on Datasets and Benchmarks. Website: https://www.task-me-anything.org

详情

展开后加载摘要…

URL PDF HTML 收藏