arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 473 篇

2408.17422 2025-04-08 cs.CV cs.AI cs.RO 57%

Open-Vocabulary Action Localization with Iterative Visual Prompting

Naoki Wake, Atsushi Kanehira, Kazuhiro Sasabuchi, Jun Takamatsu, Katsushi Ikeuchi

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments 9 pages, 5 figures, 6 tables. Published in IEEE Access. Last updated on April 7th, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00432 2025-04-02 cs.CV 57%

DecoFuse: Decomposing and Fusing the "What", "Where", and "How" for Brain-Inspired fMRI-to-Video Decoding

Chong Li, Jingyang Huo, Weikang Gong, Yanwei Fu, Xiangyang Xue, Jianfeng Feng

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24026 2025-04-02 cs.CV 57%

HumanDreamer: Generating Controllable Human-Motion Videos via Decoupled Generation

Boyuan Wang, Xiaofeng Wang, Chaojun Ni, Guosheng Zhao, Zhiqin Yang, Zheng Zhu, Muyang Zhang, Yukun Zhou, Xinze Chen, Guan Huang, Lihong Liu, Xingang Wang

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Project Page: https://humandreamer.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21616 2025-03-28 cs.CV 57%

Audio-driven Gesture Generation via Deviation Feature in the Latent Space

Jiahui Chen, Yang Huan, Runhua Shi, Chanfan Ding, Xiaoqi Mo, Siyu Xiong, Yinong He

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20348 2025-03-27 cs.CV cs.AI cs.CL cs.LG 57%

VideoGEM: Training-free Action Grounding in Videos

Felix Vogel, Walid Bousselham, Anna Kukleva, Nina Shvetsova, Hilde Kuehne

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19953 2025-03-27 cs.CV 57%

Self-Supervised Learning of Motion Concepts by Optimizing Counterfactuals

Stefan Stojanov, David Wendt, Seungwoo Kim, Rahul Venkatesh, Kevin Feigelis, Jiajun Wu, Daniel LK Yamins

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Project webpage: https://neuroailab.github.io/opt_cwm_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19383 2025-03-26 cs.CV 57%

MVPortrait: Text-Guided Motion and Emotion Control for Multi-view Vivid Portrait Animation

Yukang Lin, Hokit Fung, Jianjin Xu, Zeping Ren, Adela S. M. Lau, Guosheng Yin, Xiu Li

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14340 2025-03-26 cs.CV 57%

Zero-shot Action Localization via the Confidence of Large Vision-Language Models

Josiah Aklilu, Xiaohan Wang, Serena Yeung-Levy

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16916 2025-03-24 cs.CV 57%

Temporal Action Detection Model Compression by Progressive Block Drop

Xiaoyong Chen, Yong Guo, Jiaming Liang, Sitong Zhuang, Runhao Zeng, Xiping Hu

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15871 2025-03-21 cs.CV 57%

MASH-VLM: Mitigating Action-Scene Hallucination in Video-LLMs through Disentangled Spatial-Temporal Representations

Kyungho Bae, Jinhyung Kim, Sihaeng Lee, Soonyoung Lee, Gunhee Lee, Jinwoo Choi

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted for CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12828 2025-03-19 cs.CE cs.CV 57%

AUTV: Creating Underwater Video Datasets with Pixel-wise Annotations

Quang Trung Truong, Wong Yuk Kwan, Duc Thanh Nguyen, Binh-Son Hua, Sai-Kit Yeung

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03699 2025-03-11 cs.CV 57%

Motion-Aware Generative Frame Interpolation

Guozhen Zhang, Yuhan Zhu, Yutao Cui, Xiaotong Zhao, Kai Ma, Limin Wang

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05643 2025-03-04 cs.CV 57%

TRACE: Temporal Grounding Video LLM via Causal Event Modeling

Yongxin Guo, Jingyu Liu, Mingda Li, Qingbin Liu, Xi Chen, Xiaoying Tang

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06525 2025-03-03 cs.CV cs.AI 57%

I2VControl-Camera: Precise Video Camera Control with Adjustable Motion Strength

Wanquan Feng, Jiawei Liu, Pengqi Tu, Tianhao Qi, Mingzhen Sun, Tianxiang Ma, Songtao Zhao, Siyu Zhou, Qian He

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Accepted to ICLR 2025, Project page: https://wanquanf.github.io/I2VControlCamera

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20361 2025-02-28 cs.CV 57%

OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection

Shuming Liu, Chen Zhao, Fatimah Zohra, Mattia Soldan, Alejandro Pardo, Mengmeng Xu, Lama Alssum, Merey Ramazanova, Juan León Alcázar, Anthony Cioppa, Silvio Giancola, Carlos Hinojosa, Bernard Ghanem

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17753 2025-02-27 cs.CV 57%

Task Graph Maximum Likelihood Estimation for Procedural Activity Understanding in Egocentric Videos

Luigi Seminara, Giovanni Maria Farinella, Antonino Furnari

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2406.01486

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03280 2025-02-20 cs.CV cs.AI 57%

Animate Your Thoughts: Decoupled Reconstruction of Dynamic Natural Vision from Slow Brain Activity

Yizhuo Lu, Changde Du, Chong Wang, Xuanliu Zhu, Liuyun Jiang, Xujin Li, Huiguang He

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04296 2025-02-07 cs.RO cs.CV cs.LG 57%

Learning Real-World Action-Video Dynamics with Heterogeneous Masked Autoregression

Lirui Wang, Kevin Zhao, Chaoqi Liu, Xinlei Chen

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Website: https://liruiw.github.io/hma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04076 2025-02-07 cs.CV 57%

Content-Rich AIGC Video Quality Assessment via Intricate Text Alignment and Motion-Aware Consistency

Shangkun Sun, Xiaoyu Liang, Bowen Qu, Wei Gao

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02817 2025-02-06 cs.AI cs.CV 57%

A Decade of Action Quality Assessment: Largest Systematic Survey of Trends, Challenges, and Future Directions

Hao Yin, Paritosh Parmar, Daoliang Xu, Yang Zhang, Tianyou Zheng, Weiwei Fu

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments 36 Pages, 20 Figures, 12 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01486 2025-01-10 cs.CV 57%

Differentiable Task Graph Learning: Procedural Activity Representation and Online Mistake Detection from Egocentric Videos

Luigi Seminara, Giovanni Maria Farinella, Antonino Furnari

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03567 2024-12-05 cs.CV 57%

Streaming Detection of Queried Event Start

Cristobal Eyzaguirre, Eric Tang, Shyamal Buch, Adrien Gaidon, Jiajun Wu, Juan Carlos Niebles

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00148 2024-12-03 cs.CV 57%

Motion Modes: What Could Happen Next?

Karran Pandey, Matheus Gadelha, Yannick Hold-Geoffroy, Karan Singh, Niloy J. Mitra, Paul Guerrero

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17751 2024-10-31 cs.CV cs.AI cs.LG 57%

VISAGE: Video Synthesis using Action Graphs for Surgery

Yousef Yeganeh, Rachmadio Lazuardi, Amir Shamseddin, Emine Dari, Yash Thirani, Nassir Navab, Azade Farshad

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Accepted at MICCAI 2024 Embodied AI and Robotics for HealTHcare (EARTH) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12165 2024-10-22 cs.CV cs.AI 57%

Dual-Model Distillation for Efficient Action Classification with Hybrid Edge-Cloud Solution

Timothy Wei, Hsien Xin Peng, Elaine Xu, Bryan Zhao, Lei Ding, Diji Yang

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13830 2024-10-18 cs.CV 57%

DreamVideo-2: Zero-Shot Subject-Driven Video Customization with Precise Motion Control

Yujie Wei, Shiwei Zhang, Hangjie Yuan, Xiang Wang, Haonan Qiu, Rui Zhao, Yutong Feng, Feng Liu, Zhizhong Huang, Jiaxin Ye, Yingya Zhang, Hongming Shan

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments Project page: https://dreamvideo2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06087 2024-10-15 cs.CV 57%

GAIA: Rethinking Action Quality Assessment for AI-Generated Videos

Zijian Chen, Wei Sun, Yuan Tian, Jun Jia, Zicheng Zhang, Jiarui Wang, Ru Huang, Xiongkuo Min, Guangtao Zhai, Wenjun Zhang

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted by NeurIPS2024 Dataset and Benchmark Track as Spotlight. 33 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08649 2024-10-14 cs.CV 57%

E-Motion: Future Motion Simulation via Event Sequence Diffusion

Song Wu, Zhiyu Zhu, Junhui Hou, Guangming Shi, Jinjian Wu

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05267 2024-10-08 cs.CL cs.CV 57%

Grounding Partially-Defined Events in Multimodal Data

Kate Sanders, Reno Kriz, David Etter, Hannah Recknor, Alexander Martin, Cameron Carpenter, Jingyang Lin, Benjamin Van Durme

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

Comments Preprint; 9 pages; 2024 EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19580 2024-10-01 cs.CV 57%

High Quality Human Image Animation using Regional Supervision and Motion Blur Condition

Zhongcong Xu, Chaoyue Song, Guoxian Song, Jianfeng Zhang, Jun Hao Liew, Hongyi Xu, You Xie, Linjie Luo, Guosheng Lin, Jiashi Feng, Mike Zheng Shou

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏