arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-07-21 至 2025-07-21 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2507.13753 2025-07-21 cs.CV 79%

Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis

Tongtong Su, Chengyu Wang, Bingyan Liu, Jun Huang, Dongming Lu

机构 * Zhejiang University(浙江大学) Alibaba Cloud Computing(阿里云计算) South China University of Technology(华南理工大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01729 2025-07-21 cs.CV 57%

PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth

Bu Jin, Weize Li, Baihan Yang, Zhenxin Zhu, Junpeng Jiang, Huan-ang Gao, Haiyang Sun, Kun Zhan, Hengtong Hu, Xueyang Zhang, Peng Jia, Hao Zhao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Li Auto BAAI(北京人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted at IEEE/RSJ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频问答 1 篇

2507.13820 2025-07-21 cs.CV cs.AI 57%

Team of One: Cracking Complex Video QA with Model Synergy

Jun Xie, Zhaoran Zhao, Xiongjun Guan, Yingjian Zhu, Hongzhu Yi, Xinming Wang, Feng Chen, Zhepeng Wang

专题命中 视频问答 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频数据与评测 1 篇

2507.13609 2025-07-21 cs.CV cs.CL 70%

CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks

Yanan Wang, Julio Vizcarra, Zhi Li, Hao Niu, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究公司)

专题命中 视频数据与评测 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏