arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-10 至 2025-09-10 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2509.07680 2025-09-10 cs.CV cs.LG 70%

CAViAR: Critic-Augmented Video Agentic Reasoning

Sachit Menon, Ahmet Iscen, Arsha Nagrani, Tobias Weyand, Carl Vondrick, Cordelia Schmid

机构 * Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00969 2025-09-10 cs.CV 70%

Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors

Xiangchen Wang, Jinrui Zhang, Teng Wang, Haigang Zhang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) The University of Hong Kong(香港大学) Shenzhen Polytechnic University(深圳职业技术大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments 17 pages, 8 figures, EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02074 2025-09-10 cs.CV cs.AI 57%

Large Language Models for Crash Detection in Video: A Survey of Methods, Datasets, and Challenges

Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction and Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 3 篇

2509.05323 2025-09-10 cs.AI cs.MM 85%

Attention of a Kiss: Exploring Attention Maps in Video Diffusion for XAIxArts

Adam Cole, Mick Grierson

机构 * University of the Arts London(伦敦艺术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.MM

Comments 3rd international workshop on eXplainable AI for the Arts (XAIxArts) at the ACM Creativity and Cognition Conference June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07484 2025-09-10 cs.CV 83%

LINR Bridge: Vector Graphic Animation via Neural Implicits and Video Diffusion Priors

Wenshuo Gao, Xicheng Lan, Luyao Zhang, Shuai Yang

机构 * Wangxuan Institute of Computer Technology, State Key Laboratory of Multimedia Information Processing, \ University, Beijing, China Wangxuan Institute of Computer Technology, State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

Comments 5 pages, ICIPW 2025, Website: https://gaowenshuo.github.io/LINR-bridge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07472 2025-09-10 cs.CV 70%

ANYPORTAL: Zero-Shot Consistent Video Background Replacement

Wenshuo Gao, Xicheng Lan, Shuai Yang

机构 * Wangxuan Institute of Computer Technology, State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China(王轩计算机技术研究所,多媒体信息处理国家重点实验室,北京大学,北京)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments 8 pages, ICCV 2025, Website: https://gaowenshuo.github.io/AnyPortal/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2409.10090 2025-09-10 cs.CV 57%

InteractPro: A Unified Framework for Motion-Aware Image Composition

Weijing Tao, Xiaofeng Yang, Miaomiao Cui, Guosheng Lin

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏