arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-15 至 2025-12-15 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2512.11792 2025-12-15 cs.CV 79%

Structure From Tracking: Distilling Structure-Preserving Motion for Video Generation

从跟踪中获取结构:从自回归视频跟踪模型中蒸馏保持结构的运动用于视频生成

Yang Fei, George Stoica, Jingyuan Liu, Qifeng Chen, Ranjay Krishna, Xiaojuan Wang, Benlin Liu

机构 * HKUST(香港科技大学) University of Washington(华盛顿大学) Georgia Tech(佐治亚理工学院) Adobe(Adobe公司)

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 通过蒸馏自回归视频跟踪模型中的结构保持运动先验,SAM2VideoX在视频生成任务中实现了更高的保真度和一致性。

Comments Project Website: https://sam2videox.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01543 2025-12-15 cs.CV 57%

Efficient Action Counting with Dynamic Queries

高效动态查询动作计数

Xiaoxuan Ma, Zishi Li, Qiuyan Shang, Wentao Zhu, Hai Ci, Yu Qiao, Yizhou Wang

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于动态查询表示的高效动作计数方法,通过动态更新和跨查询对比学习,显著提升了长视频和未见过动作的计数性能。

Comments code: https://github.com/lizishi/DeTRC, proj page: https://shirleymaxx.github.io/DeTRC/

详情

展开后加载摘要…

URL PDF HTML 收藏