arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-24 至 2025-11-24 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2506.18883 2025-11-24 cs.CV 70%

Universal Video Temporal Grounding with Generative Multi-modal Large Language Models

通用视频时间定位与生成多模态大语言模型

Zeqian Li, Shangzhe Di, Zhonghua Zhai, Weilin Huang, Yanfeng Wang, Weidi Xie

机构 * SAI, Shanghai Jiao Tong University(上海交通大学SAI实验室) ByteDance Seed(字节跳动种子)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出UniTime模型,利用生成多模态大语言模型实现通用视频时间定位,有效处理多类型视频并提升VideoQA任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2511.17450 2025-11-24 cs.CV cs.AI cs.CL 79%

Planning with Sketch-Guided Verification for Physics-Aware Video Generation

基于草图引导验证的物理感知视频生成规划

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) FieldAI Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SketchVerify通过草图验证和动态轨迹优化提升物理感知视频生成的效率与质量。

Comments website: https://sketchverify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03135 2025-11-24 cs.CV cs.RO 79%

Mask2IV: Interaction-Centric Video Generation via Mask Trajectories

Mask2IV: 通过遮罩轨迹实现以交互为中心的视频生成

Gen Li, Bo Zhao, Jianfei Yang, Laura Sevilla-Lara

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Mask2IV通过遮罩轨迹实现以交互为中心的视频生成,提供灵活的交互控制和高真实感的视频生成。

Comments AAAI 2026. Project page: https://reagan1311.github.io/mask2iv

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16783 2025-11-24 cs.HC cs.AI cs.CV 57%

Generative Augmented Reality: Paradigms, Technologies, and Future Applications

生成增强现实:范式、技术与未来应用

Chen Liang, Jiawen Zheng, Yufeng Zeng, Yi Tan, Hengye Lyu, Yuhui Zheng, Zisu Li, Yueting Weng, Jiaxin Shi, Hanwang Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学) XMax.AI Ltd.(XMax.AI有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出生成增强现实(GAR)作为下一代AR范式,通过统一生成模型实现环境再合成,提升真实感与沉浸感,同时引发技术、内容生态及伦理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2511.17481 2025-11-24 cs.CV 79%

Counterfactual World Models via Digital Twin-conditioned Video Diffusion

通过数字孪生条件的视频扩散实现反事实世界模型

Yiqing Shen, Aiza Maksutova, Chenjia Li, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 CWMDT通过构建数字孪生和应用大语言模型,实现反事实世界模型,提升对视频正向模拟的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏