arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-24 至 2025-10-24 共收录 11 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2510.20622 2025-10-24 cs.CV 88%

SeViCES: Unifying Semantic-Visual Evidence Consensus for Long Video Understanding

Yuan Sheng, Yanbin Hao, Chenxu Li, Shuo Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03885 2025-10-24 cs.CV 57%

Video, How Do Your Tokens Merge?

Sam Pollard, Michael Wray

机构 * University of Bristol(布里斯托大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted at eLVM workshop at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2510.19193 2025-10-24 cs.CV 83%

Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning

Takehiro Aoshima, Yusuke Shinohara, Byeongseon Park

机构 * LY Corporation(LY公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03639 2025-10-24 cs.CV 83%

Towards Physical Understanding in Video Generation: A 3D Point Regularization Approach

Yunuo Chen, Junli Cao, Vidit Goel, Sergei Korolev, Chenfanfu Jiang, Jian Ren, Sergey Tulyakov, Anil Kag

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Snap Inc(Snap公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Project Page: \url{https://snap-research.github.io/PointVidGen/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11224 2025-10-24 cs.CV cs.GR 79%

GenLit: Reformulating Single-Image Relighting as Video Generation

Shrisha Bharadwaj, Haiwen Feng, Giorgio Becherini, Victoria Fernandez Abrevaya, Michael J. Black

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19957 2025-10-24 cs.AI 50%

A new wave of vehicle insurance fraud fueled by generative AI

Amir Hever, Itai Orr

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频问答 1 篇

2510.20287 2025-10-24 cs.CV cs.AI cs.LG 57%

Breakdance Video classification in the age of Generative AI

Sauptik Dhar, Naveen Ramakrishnan, Michelle Munson

机构 * Eluvio AI Labs(Eluvio AI实验室)

专题命中 视频问答 :video language model(abstract);分类 cs.CV

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2505.23155 2025-10-24 cs.CV 57%

PreFM: Online Audio-Visual Event Parsing via Predictive Future Modeling

Xiao Yu, Yan Fang, Xiaojie Jin, Yao Zhao, Yunchao Wei

机构 * Institute of Information Science, Beijing Jiaotong University(信息科学学院,北京交通大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2510.20822 2025-10-24 cs.CV 79%

HoloCine: Holistic Generation of Cinematic Multi-Shot Long Video Narratives

Yihao Meng, Hao Ouyang, Yue Yu, Qiuyu Wang, Wen Wang, Ka Leong Cheng, Hanlin Wang, Yixuan Li, Cheng Chen, Yanhong Zeng, Yujun Shen, Huamin Qu

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学) NTU(南洋理工大学)

专题命中 长视频与时序推理 :long video(title);text-to-video(abstract);分类 cs.CV

Comments Project page and code: https://holo-cine.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20726 2025-10-24 cs.CV 57%

AutoScape: Geometry-Consistent Long-Horizon Scene Generation

Jiacheng Chen, Ziyu Jiang, Mingfu Liang, Bingbing Zhuang, Jong-Chyi Su, Sparsh Garg, Ying Wu, Manmohan Chandraker

机构 * NEC Labs America(NEC美国实验室) Simon Fraser University(西蒙弗雷泽大学) Northwestern University(西北大学) UC San Diego(加州大学圣地亚哥分校)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://auto-scape.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他视频模型 1 篇

2510.20244 2025-10-24 cs.CV cs.LG 57%

Empower Words: DualGround for Structured Phrase and Sentence-Level Temporal Grounding

Minseok Kang, Minhyeok Lee, Minjung Kim, Donghyeong Kim, Sangyoun Lee

机构 * Yonsei University(延世大学) LG Electronics(LG电子)

专题命中 其他视频模型 :video-language(abstract);分类 cs.CV

Comments Comments: 28 pages, including appendix. 5 figures. Full version of the NeurIPS 2025 paper

详情

展开后加载摘要…

URL PDF HTML 收藏