arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-21 至 2025-10-21 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2506.22967 2025-10-21 cs.CV cs.LG cs.MM 73%

ActAlign: Zero-Shot Fine-Grained Video Classification via Language-Guided Sequence Alignment

Amir Aghdam, Vincent Tao Hu, Björn Ommer

机构 * Department of Computer Science, Temple University(Temple大学计算机科学系) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV、cs.MM

Comments Accepted to TMLR 2025 - Project page: https://amir-aghdam.github.io/act-align/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16209 2025-10-21 cs.CV 57%

StretchySnake: Flexible SSM Training Unlocks Action Recognition Across Spatio-Temporal Scales

Nyle Siddiqui, Rohit Gupta, Sirnam Swetha, Mubarak Shah

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏