arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-04 至 2025-11-04 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2505.18079 2025-11-04 cs.CV cs.AI cs.CL 83%

Deep Video Discovery: Agentic Search with Tool Use for Long-form Video Understanding

Xiaoyi Zhang, Zhaoyang Jia, Zongyu Guo, Jiahao Li, Bin Li, Houqiang Li, Yan Lu

机构 * Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10821 2025-11-04 cs.CV cs.AI cs.CL 83%

VideoExplorer: Think With Videos For Agentic Long-Video Understanding

Huaying Yuan, Zheng Liu, Junjie Zhou, Hongjin Qian, Yan Shu, Nicu Sebe, Ji-Rong Wen, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学) University of Trento(特伦托大学)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2511.01775 2025-11-04 cs.CV cs.AI cs.MM 81%

How Far Are Surgeons from Surgical World Models? A Pilot Study on Zero-shot Surgical Video Generation with Expert Assessment

Zhen Chen, Qing Xu, Jinlin Wu, Biao Yang, Yuhao Zhai, Geng Guo, Jing Zhang, Yinlu Ding, Nassir Navab, Jiebo Luo

机构 * Yale University(耶鲁大学) University of Nottingham(诺丁汉大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Department of Neurosurgery, The First Hospital, Shanxi Medical University(山西医科大学第一医院神经外科部) Department of Gastrointestinal Surgery, The Second Qilu Hospital, Shandong University(山东大学第二齐鲁医院胃肠外科部) Technical University of Munich(慕尼黑技术大学) University of Rochester(罗切斯特大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00107 2025-11-04 cs.CV cs.AI cs.IR 79%

AI Powered High Quality Text to Video Generation with Enhanced Temporal Consistency

Piyushkumar Patel

机构 * Microsoft(微软)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00248 2025-11-04 cs.CV cs.GR 57%

Object-Aware 4D Human Motion Generation

Shurui Gui, Deep Anil Patel, Xiner Li, Martin Renqiang Min

机构 * Texas A&M University(德克萨斯A&M大学) NEC Laboratories America(NEC美国实验室)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 3 篇

2510.24448 2025-11-04 cs.CV cs.AI 57%

Rethinking Visual Intelligence: Insights from Video Pretraining

Pablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08271 2025-11-04 cs.GR cs.CV cs.LG 57%

SViM3D: Stable Video Material Diffusion for Single Image 3D Generation

Andreas Engelhardt, Mark Boss, Vikram Voleti, Chun-Han Yao, Hendrik P. A. Lensch, Varun Jampani

机构 * Stability AI University of Tübingen(图宾根大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by International Conference on Computer Vision (ICCV 2025). Project page: http://svim3d.aengelhardt.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02608 2025-11-04 cs.LG physics.flu-dyn 50%

Lost in Latent Space: An Empirical Study of Latent Diffusion Models for Physics Emulation

François Rozet, Ruben Ohana, Michael McCabe, Gilles Louppe, François Lanusse, Shirley Ho

机构 * Polymathic AI Flatiron Institute University of Liège(列日大学) New York University(纽约大学) Princeton University(普林斯顿大学) Université Paris-Saclay, Université Paris Cité, CEA, CNRS, AIM(巴黎-萨克莱大学、巴黎-cite大学、CEA、CNRS、AIM)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2504.05783 2025-11-04 cs.CV cs.AI 57%

Video Flow as Time Series: Discovering Temporal Consistency and Variability for VideoQA

Zijie Song, Zhenzhen Hu, Yixiao Ma, Jia Li, Richang Hong

机构 * Hefei University of Technology, Hefei, China(合肥工业大学) University of Science and Technology of China, Hefei, China(中国科学技术大学)

专题命中 视频问答 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2507.12508 2025-11-04 cs.CV cs.AI cs.RO 57%

MindJourney: Test-Time Scaling with World Models for Spatial Reasoning

Yuncong Yang, Jiageng Liu, Zheyuan Zhang, Siyuan Zhou, Reuben Tan, Jianwei Yang, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) JHU(约翰·霍普金斯大学) HKUST(香港科技大学) Microsoft Research(微软研究院) Harvard(哈佛大学)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://umass-embodied-agi.github.io/MindJourney

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2508.06350 2025-11-04 cs.CV 57%

Aligning Effective Tokens with Video Anomaly in Large Language Models

Yingxian Chen, Jiahui Liu, Ruidi Fan, Yanwei Li, Chirui Chang, Shizhen Zhao, Wilton W. T. Fok, Xiaojuan Qi, Yik-Chung Wu

机构 * The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22810 2025-11-04 cs.CV 57%

VidText: Towards Comprehensive Evaluation for Video Text Understanding

Zhoufaran Yang, Yan Shu, Jing Wang, Zhifei Yang, Yan Zhang, Yu Li, Keyang Lu, Gangyan Zeng, Shaohui Liu, Yu Zhou, Nicu Sebe

机构 * UNITN HIT(哈尔滨工业大学) SEU(上海电子大学) PKU(北京大学) IIE, CAS(中国科学院信息工程研究所) UCAS(中国科学院大学) BUAA(北京航空航天大学) NJUST(南京理工大学) NKU(宁夏大学)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏