arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 473 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 473 篇

1908.04013 2019-08-13 cs.CV 57%

Multi-Frame Content Integration with a Spatio-Temporal Attention Mechanism for Person Video Motion Transfer

Kun Cheng, Hao-Zhi Huang, Chun Yuan, Lingyiqing Zhou, Wei Liu

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1908.03477 2019-08-12 cs.CV 57%

Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings

Michael Wray, Diane Larlus, Gabriela Csurka, Dima Damen

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted for presentation at ICCV. Project Page: https://mwray.github.io/FGAR

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.03327 2019-08-01 cs.CV 57%

HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips

Antoine Miech, Dimitri Zhukov, Jean-Baptiste Alayrac, Makarand Tapaswi, Ivan Laptev, Josef Sivic

专题命中 动作与事件理解 :text-to-video(abstract);分类 cs.CV

Comments Accepted at ICCV 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.12165 2019-07-01 cs.CV cs.IR 57%

Localizing Unseen Activities in Video via Image Query

Zhu Zhang, Zhou Zhao, Zhijie Lin, Jingkuan Song, Deng Cai

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by IJCAI 2019 as a poster paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.03544 2019-06-06 cs.CV 57%

A Structured Model For Action Detection

Yubo Zhang, Pavel Tokmakov, Martial Hebert, Cordelia Schmid

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10575 2019-06-04 cs.CV 57%

Stacked Spatio-Temporal Graph Convolutional Networks for Action Segmentation

Pallabi Ghosh, Yi Yao, Larry S. Davis, Ajay Divakaran

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.03460 2019-05-09 cs.CV 57%

DMC-Net: Generating Discriminative Motion Cues for Fast Compressed Video Action Recognition

Zheng Shou, Xudong Lin, Yannis Kalantidis, Laura Sevilla-Lara, Marcus Rohrbach, Shih-Fu Chang, Zhicheng Yan

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by CVPR'19

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04869 2019-04-09 cs.CV 57%

A Perceptual Prediction Framework for Self Supervised Event Segmentation

Sathyanarayanan N. Aakur, Sudeep Sarkar

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR 2019 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.04527 2019-03-26 cs.CV 57%

SoccerNet: A Scalable Dataset for Action Spotting in Soccer Videos

Silvio Giancola, Mohieddine Amine, Tarek Dghaily, Bernard Ghanem

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR Workshop on Computer Vision in Sports 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.10180 2018-11-28 cs.CV 57%

Bringing a Blurry Frame Alive at High Frame-Rate with an Event Camera

Liyuan Pan, Cedric Scheerlinck, Xin Yu, Richard Hartley, Miaomiao Liu, Yuchao Dai

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1807.10706 2018-07-30 cs.CV 57%

Diagnosing Error in Temporal Action Detectors

Humam Alwassel, Fabian Caba Heilbron, Victor Escorcia, Bernard Ghanem

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to ECCV 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.00097 2018-05-09 cs.CV 57%

Budget-Aware Activity Detection with A Recurrent Policy Network

Behrooz Mahasseni, Xiaodong Yang, Pavlo Molchanov, Jan Kautz

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.01058 2017-09-15 cs.CV 57%

Skeleton-aided Articulated Motion Generation

Yichao Yan, Jingwei Xu, Bingbing Ni, Xiaokang Yang

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

Comments ACM MM 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.00558 2017-05-17 cs.CV 57%

Unsupervised Human Action Detection by Action Matching

Basura Fernando, Sareh Shirazi, Stephen Gould

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments IEEE International Conference on Computer Vision and Pattern Recognition CVPR 2017 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.01180 2017-05-04 cs.CV 57%

Cascaded Boundary Regression for Temporal Action Detection

Jiyang Gao, Zhenheng Yang, Ram Nevatia

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.02031 2016-06-08 cs.CV 57%

Hand Action Detection from Ego-centric Depth Sequences with Error-correcting Hough Transform

Chi Xu, Lakshmi Narasimhan Govindarajan, Li Cheng

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.02129 2016-04-25 cs.CV 57%

Temporal Action Localization in Untrimmed Videos via Multi-stage CNNs

Zheng Shou, Dongang Wang, Shih-Fu Chang

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.04574 2016-04-18 cs.CV 57%

Learning Temporal Regularity in Video Sequences

Mahmudul Hasan, Jonghyun Choi, Jan Neumann, Amit K. Roy-Chowdhury, Larry S. Davis

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments CVPR 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
1512.09041 2015-12-31 cs.CV 57%

Actor-Action Semantic Segmentation with Grouping Process Models

Chenliang Xu, Jason J. Corso

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
1508.03755 2015-08-18 cs.CV 57%

Beat-Event Detection in Action Movie Franchises

Danila Potapov, Matthijs Douze, Jerome Revaud, Zaid Harchaoui, Cordelia Schmid

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1505.05769 2015-05-22 cs.CV 57%

Watch and Learn: Semi-Supervised Learning of Object Detectors from Videos

Ishan Misra, Abhinav Shrivastava, Martial Hebert

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments To appear in CVPR 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1412.6505 2015-05-07 cs.CV 57%

Pooled Motion Features for First-Person Videos

M. S. Ryoo, Brandon Rothrock, Larry Matthies

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1309.6390 2013-09-26 cs.CV 57%

Contextually learnt detection of unusual motion-based behaviour in crowded public spaces

Ognjen Arandjelović

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Journal ref Computer and Information Sciences II Computer and Information Sciences II, pp 403-410, 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
1010.3935 2010-10-20 cs.CV 57%

3-D Rigid Models from Partial Views - Global Factorization

Pedro M. Q. Aguiar, Rui F. C. Guerreiro, Bruno B. Gonçalves

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11521 2026-08-14 cs.RO cs.AI 版本更新 50%

Keep the Future, Drop the Rollout: RIFT for World Action Models

保留未来,放弃展开:面向世界动作模型的RIFT

Chushan Zhang, Jinguang Tong, Xuesong Li, Yikai Wang, Hongdong Li

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文针对世界动作模型部署延迟问题,提出RIFT方法,通过学习的预期标记一次构建未来K/V缓存,在LIBERO、RoboTwin 2.0任务上实现高成功率且大幅降低动作块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11605 2026-08-13 cs.AI 新提交 50%

Foresight Without Seeing: Latent Futures for World Action Models

无视觉前瞻:面向世界动作模型的潜在未来

Jiakai Huang, Zhongbo Wu, Zheng Zhang, Zihan Wang, Shan You, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 本文提出ForeWAM,一种动力学条件下的直接策略WAM,通过Future-KV和动力学寄存器在无需显式生成未来视频的情况下,使直接策略WAMs兼具高效动作预测与预测动力学暴露能力,在LIBERO和LIBERO-Plus上取得高成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19313 2026-07-24 cs.RO cs.AI cs.LG 版本更新 50%

TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics

TOPReward: 令牌概率作为机器人学中的隐式零样本奖励

Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究所) Amazon(亚马逊) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 动作与事件理解 :video-language(abstract)

AI总结 TOPReward通过利用预训练视频视觉-语言模型的令牌概率,提供高效的零样本奖励估计,显著提升机器人任务进度评估的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14997 2026-07-17 cs.RO 新提交 50%

AeroAct: Action-Centered World-Action Models for Language-Conditioned Quadrotor Flight

AeroAct:用于语言条件四旋翼飞行的以动作中心的世界-动作模型

Xinhong Zhang, Qiyuan Zhu, Yubo Huang, Haolin Chen, Runqing Wang, Yuhao Mo, Zhongxin Chen, Yu Hu, Xinjiang Wang, Jian Sun, Gang Wang

机构 * School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 研究语言条件下四旋翼飞行问题,提出AeroAct模型,利用预训练视频扩散Transformer,结合相关采集设备和程序获取数据,经实验验证该模型能提升四旋翼飞行的目标跟踪和物体搜索性能,且对应策略可在实体四旋翼上执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27792 2026-07-16 cs.RO 版本更新 50%

Motubrain: An Advanced World Action Model for Robot Control

MotuBrain: 一种先进的世界动作模型用于机器人控制

Motubrain Team, Chendong Xiang, Fan Bao, Haitian Liu, Hengkai Tan, Hongzhe Bi, James Li, Jiabao Liu, Jingrui Pang, Kiro Jing, Louis Liu, Mengchen Cai, Rongxu Cui, Ruowen Zhao, Runqing Wang, Shuhe Huang, Yao Feng, Yinze Rong, Zeyuan Wang, Jun Zhu

机构 * MotuBrain Team(MotuBrain团队)

专题命中 动作与事件理解 :video generation(abstract)

AI总结 MotuBrain提出一种统一的世界动作模型,结合视频和动作,支持多项任务,实现高效部署和高精度控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06558 2026-07-14 cs.RO 版本更新 50%

RynnWorld-Teleop: An Action-Conditioned World Model for Digital Teleoperation

RynnWorld-Teleop:用于数字遥操作的动作条件世界模型

Haoyu Zhao, Xingyue Zhao, Hangyu Li, Biao Gong, Kehan Li, Siteng Huang, Xin Li, Deli Zhao, Zhongyu Li

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hong Kong Embodied AI Lab(香港具身人工智能实验室) CUHK(香港中文大学) Hupan Lab(湖畔实验室) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

专题命中 动作与事件理解 :video diffusion(abstract)

AI总结 研究针对机器人学习数据收集瓶颈,提出数字遥操作范式,用生成世界模型解耦数据收集与物理约束。以RynnWorld-Teleop系统实现,含多种技术,能实时生成,训练策略可零样本转移,还能增强数据集,是高保真可扩展数据引擎。

Comments Project Page: https://alibaba-damo-academy.github.io/RynnWorld-Teleop.github.io, Github: https://github.com/alibaba-damo-academy/RynnWorld-Teleop

详情

展开后加载摘要…

URL PDF HTML 收藏