arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1395 篇

2410.04511 2024-10-08 cs.CV cs.CL 57%

Realizing Video Summarization from the Path of Language-based Semantic Understanding

Kuan-Chen Mu, Zhi-Yi Chin, Wei-Chen Chiu

专题命中 视频理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17041 2024-10-04 cs.CV cs.AI cs.CL 57%

Eliciting In-Context Learning in Vision-Language Models for Videos Through Curated Data Distributional Properties

Keunwoo Peter Yu, Zheyuan Zhang, Fengyuan Hu, Shane Storks, Joyce Chai

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 16 pages, LaTeX; Accepted to EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04886 2024-10-03 cs.CV cs.AI cs.CL 57%

Unveiling the Invisible: Captioning Videos with Metaphors

Abisek Rajakumar Kalarani, Pushpak Bhattacharyya, Sumit Shekhar

专题命中 视频理解 :video language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19389 2024-10-02 cs.CV 57%

OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding

Tao Zhang, Xiangtai Li, Hao Fei, Haobo Yuan, Shengqiong Wu, Shunping Ji, Chen Change Loy, Shuicheng Yan

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments NeurIPS-2024. Project page: https://lxtgh.github.io/project/omg_llava/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20566 2024-10-01 cs.CV cs.CL cs.LG 57%

MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning

Haotian Zhang, Mingfei Gao, Zhe Gan, Philipp Dufter, Nina Wenzel, Forrest Huang, Dhruti Shah, Xianzhi Du, Bowen Zhang, Yanghao Li, Sam Dodge, Keen You, Zhen Yang, Aleksei Timofeev, Mingze Xu, Hong-You Chen, Jean-Philippe Fauconnier, Zhengfeng Lai, Haoxuan You, Zirui Wang, Afshin Dehghan, Peter Grasch, Yinfei Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15035 2024-09-24 cs.CV cs.CL 57%

Can CLIP Count Stars? An Empirical Study on Quantity Bias in CLIP

Zeliang Zhang, Zhuo Liu, Mingqian Feng, Chenliang Xu

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Short paper. Accepted by the Findings of EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13091 2024-09-23 cs.CV cs.AI 57%

Interpretable Action Recognition on Hard to Classify Actions

Anastasia Anichenko, Frank Guerin, Andrew Gilbert

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 5 pages, This manuscript has been accepted at the Human-inspired Computer Vision (HCV) ECCV 2024 Workshop. arXiv admin note: text overlap with arXiv:2107.05319

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10641 2024-09-18 cs.CV 57%

HAVANA: Hierarchical stochastic neighbor embedding for Accelerated Video ANnotAtions

Alexandru Bobe, Jan C. van Gemert

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10587 2024-09-18 cs.CV 57%

SoccerNet 2024 Challenges Results

Anthony Cioppa, Silvio Giancola, Vladimir Somers, Victor Joos, Floriane Magera, Jan Held, Seyed Abolfazl Ghasemzadeh, Xin Zhou, Karolina Seweryn, Mateusz Kowalczyk, Zuzanna Mróz, Szymon Łukasik, Michał Hałoń, Hassan Mkhallati, Adrien Deliège, Carlos Hinojosa, Karen Sanchez, Amir M. Mansourian, Pierre Miralles, Olivier Barnich, Christophe De Vleeschouwer, Alexandre Alahi, Bernard Ghanem, Marc Van Droogenbroeck, Adam Gorski, Albert Clapés, Andrei Boiarov, Anton Afanasiev, Artur Xarles, Atom Scott, ByoungKwon Lim, Calvin Yeung, Cristian Gonzalez, Dominic Rüfenacht, Enzo Pacilio, Fabian Deuser, Faisal Sami Altawijri, Francisco Cachón, HanKyul Kim, Haobo Wang, Hyeonmin Choe, Hyunwoo J Kim, Il-Min Kim, Jae-Mo Kang, Jamshid Tursunboev, Jian Yang, Jihwan Hong, Jimin Lee, Jing Zhang, Junseok Lee, Kexin Zhang, Konrad Habel, Licheng Jiao, Linyi Li, Marc Gutiérrez-Pérez, Marcelo Ortega, Menglong Li, Milosz Lopatto, Nikita Kasatkin, Nikolay Nemtsev, Norbert Oswald, Oleg Udin, Pavel Kononov, Pei Geng, Saad Ghazai Alotaibi, Sehyung Kim, Sergei Ulasen, Sergio Escalera, Shanshan Zhang, Shuyuan Yang, Sunghwan Moon, Thomas B. Moeslund, Vasyl Shandyba, Vladimir Golovkin, Wei Dai, WonTaek Chung, Xinyu Liu, Yongqiang Zhu, Youngseo Kim, Yuan Li, Yuting Yang, Yuxuan Xiao, Zehua Cheng, Zhihao Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09707 2024-09-17 cs.CV 57%

Synergistic Spotting and Recognition of Micro-Expression via Temporal State Transition

Bochao Zou, Zizheng Guo, Wenfeng Qin, Xin Li, Kangsheng Wang, Huimin Ma

专题命中 视频理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15841 2024-09-17 cs.CV 57%

SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models

Mingze Xu, Mingfei Gao, Zhe Gan, Hong-You Chen, Zhengfeng Lai, Haiming Gang, Kai Kang, Afshin Dehghan

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00826 2024-09-09 cs.CV 57%

DEVIAS: Learning Disentangled Video Representations of Action and Scene

Kyungho Bae, Geo Ahn, Youngrae Kim, Jinwoo Choi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV 2024 (Oral). Project page : https://khu-vll.github.io/DEVIAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06764 2024-09-04 cs.CV cs.AI cs.CL 57%

An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models

Liang Chen, Haozhe Zhao, Tianyu Liu, Shuai Bai, Junyang Lin, Chang Zhou, Baobao Chang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV 2024 (Oral), code is released at https://github.com/pkunlp-icler/FastV,

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16195 2024-08-30 cs.CV 57%

DLM-VMTL:A Double Layer Mapper for heterogeneous data video Multi-task prompt learning

Zeyi Bo, Wuxi Sun, Ye Jin

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15209 2024-08-28 cs.MM 57%

Sec2Sec Co-attention for Video-Based Apparent Affective Prediction

Mingwei Sun, Kunpeng Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.MM

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14441 2024-08-27 cs.CV cs.AI 57%

Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification

Mahrukh Awan, Asmar Nadeem, Muhammad Junaid Awan, Armin Mustafa, Syed Sameed Husain

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14008 2024-08-27 cs.CV cs.AI 57%

LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models

Qihang Ge, Wei Sun, Yu Zhang, Yunhao Li, Zhongpeng Ji, Fengyu Sun, Shangling Jui, Xiongkuo Min, Guangtao Zhai

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09220 2024-08-20 cs.CV cs.AI 57%

Flatten: Video Action Recognition is an Image Classification task

Junlin Chen, Chengcheng Xu, Yangfan Xu, Jian Yang, Jun Li, Zhiping Shi

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 13pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07600 2024-08-15 cs.CV 57%

Disentangle and denoise: Tackling context misalignment for video moment retrieval

Kaijing Ma, Han Fang, Xianghao Zang, Chao Ban, Lanxiang Zhou, Zhongjiang He, Yongxiang Li, Hao Sun, Zerun Feng, Xingsong Hou

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16609 2024-08-14 cs.CV cs.AI 57%

SFMViT: SlowFast Meet ViT in Chaotic World

Jiaying Lin, Jiajun Wen, Mengyuan Liu, Jinfu Liu, Baiqiao Yin, Yue Li

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02421 2024-08-06 cs.CV 57%

FE-Adapter: Adapting Image-based Emotion Classifiers to Videos

Shreyank N Gowda, Boyan Gao, David A. Clifton

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17100 2024-08-02 cs.CV 57%

Open-Set Video-based Facial Expression Recognition with Human Expression-sensitive Prompting

Yuanyuan Liu, Yuxuan Huang, Shuyang Liu, Yibing Zhan, Zijing Chen, Zhe Chen

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ACM MM2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19981 2024-07-30 cs.CV 57%

Adversarial Robustness in RGB-Skeleton Action Recognition: Leveraging Attention Modality Reweighter

Chao Liu, Xin Liu, Zitong Yu, Yonghong Hou, Huanjing Yue, Jingyu Yang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IJCB 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05021 2024-07-30 cs.CV 57%

Beyond MOT: Semantic Multi-Object Tracking

Yunhao Li, Qin Li, Hao Wang, Xue Ma, Jiali Yao, Shaohua Dong, Heng Fan, Libo Zhang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09490 2024-07-25 cs.CV 57%

Leveraging Temporal Contextualization for Video Action Recognition

Minji Kim, Dongyoon Han, Taekyung Kim, Bohyung Han

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 26 pages, 11 figures, 16 tables. To be presented at ECCV'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09308 2024-07-25 cs.CV 57%

In My Perspective, In My Hands: Accurate Egocentric 2D Hand Pose and Action Recognition

Wiktor Mucha, Martin Kampel

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at: The 18th IEEE International Conference on Automatic Face and Gesture Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08476 2024-07-12 cs.CV 57%

VideoMamba: Spatio-Temporal Selective State Space Model

Jinyoung Park, Hee-Seon Kim, Kangwook Ko, Minbeom Kim, Changick Kim

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments ECCV 2024. code available at http://github.com/jinyjelly/VideoMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06189 2024-07-09 cs.CV cs.AI 57%

Video-STaR: Self-Training Enables Video Instruction Tuning with Any Supervision

Orr Zohar, Xiaohan Wang, Yonatan Bitton, Idan Szpektor, Serena Yeung-Levy

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Project page: https://orrzohar.github.io/projects/video-star/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05419 2024-07-09 cs.CV cs.IR 57%

Multimodal Language Models for Domain-Specific Procedural Video Summarization

Nafisa Hussain

专题命中 视频理解 :long video(abstract);分类 cs.CV

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03320 2024-07-04 cs.CV cs.CL 57%

InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output

Pan Zhang, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Rui Qian, Lin Chen, Qipeng Guo, Haodong Duan, Bin Wang, Linke Ouyang, Songyang Zhang, Wenwei Zhang, Yining Li, Yang Gao, Peng Sun, Xinyue Zhang, Wei Li, Jingwen Li, Wenhai Wang, Hang Yan, Conghui He, Xingcheng Zhang, Kai Chen, Jifeng Dai, Yu Qiao, Dahua Lin, Jiaqi Wang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Technical Report. https://github.com/InternLM/InternLM-XComposer

详情

展开后加载摘要…

URL PDF HTML 收藏