arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-11 至 2025-11-11 共收录 17 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2507.17047 2025-11-11 cs.CV cs.AI 79%

Controllable Hybrid Captioner for Improved Long-form Video Understanding

Kuleen Sasse, Efsun Sarioglu Kayi, Arun Reddy

机构 * Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18094 2025-11-11 cs.CV cs.AI 57%

UniPixel: Unified Object Referring and Segmentation for Pixel-Level Visual Reasoning

Ye Liu, Zongyang Ma, Junfu Pu, Zhongang Qi, Yang Wu, Ying Shan, Chang Wen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) vivo Mobile Communication Co.(vivo移动通信公司) MindWingman Technology (Shenzhen) Co., Ltd.(深圳MindWingman技术有限公司)

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments NeurIPS 2025 Camera Ready. Project Page: https://polyu-chenlab.github.io/unipixel/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05833 2025-11-11 cs.CV 57%

TYrPPG: Uncomplicated and Enhanced Learning Capability rPPG for Remote Heart Rate Estimation

Taixi Chen, Yiu-ming Cheung

机构 * School of Computing, Binghamton University(计算学院,宾夕法尼亚州立大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments The 6th International Workshop on AI for Social Good in the Connected World (AI4SG)@ IEEE WI-IAT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 7 篇

2511.06055 2025-11-11 cs.CV 83%

Neodragon: Mobile Video Generation using Diffusion Transformer

Animesh Karnewar, Denis Korzhenkov, Ioannis Lelekas, Adil Karjauv, Noor Fathima, Hanwen Xiong, Vancheeswaran Vaidyanathan, Will Zeng, Rafael Esteves, Tushar Singhal, Fatih Porikli, Mohsen Ghafoorian, Amirhossein Habibian

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01450 2025-11-11 cs.CV cs.AI 79%

Reg-DPO: SFT-Regularized Direct Preference Optimization with GT-Pair for Improving Video Generation

Jie Du, Xinyu Gong, Qingshan Tan, Wen Li, Yangming Cheng, Weitao Wang, Chenlu Zhan, Suhui Wu, Hao Zhang, Jun Zhang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments The paper is withdrawn due to the need for further revision and verification of experimental results. A revised version will be resubmitted once the updates are completed

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20358 2025-11-11 cs.CV 79%

PhysCtrl: Generative Physics for Controllable and Physics-Grounded Video Generation

Chen Wang, Chuhao Chen, Yiming Huang, Zhiyang Dou, Yuan Liu, Jiatao Gu, Lingjie Liu

机构 * University of Pennsylvania(宾夕法尼亚大学) HKU(香港大学) HKUST(香港科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments NeurIPS 2025 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06271 2025-11-11 cs.CV 77%

RelightMaster: Precise Video Relighting with Multi-plane Light Images

Weikang Bian, Xiaoyu Shi, Zhaoyang Huang, Jianhong Bai, Qinghe Wang, Xintao Wang, Pengfei Wan, Kun Gai, Hongsheng Li

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) CPII under InnoHK(创新香港 CPII) Zhejiang University(浙江大学) Dalian University of Technology(大连理工大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://wkbian.github.io/Projects/RelightMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05573 2025-11-11 cs.CV cs.AI 70%

Video Text Preservation with Synthetic Text-Rich Videos

Ziyang Liu, Kevin Valencia, Justin Cui

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07416 2025-11-11 cs.RO cs.AI cs.CV 57%

Robot Learning from a Physical World Model

Jiageng Mao, Sicheng He, Hao-Ning Wu, Yang You, Shuyang Sun, Zhicheng Wang, Yanan Bao, Huizhong Chen, Leonidas Guibas, Vitor Guizilini, Howard Zhou, Yue Wang

机构 * Google DeepMind(谷歌DeepMind) USC(美国斯克利普斯大学) Stanford(斯坦福大学) Toyota Research Institute(丰田研究机构)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://pointscoder.github.io/PhysWorld_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05682 2025-11-11 cs.CV cs.LG 57%

VMDT: Decoding the Trustworthiness of Video Foundation Models

Yujin Potter, Zhun Wang, Nicholas Crispino, Kyle Montgomery, Alexander Xiong, Ethan Y. Chang, Francesco Pinto, Yuqi Chen, Rahul Gupta, Morteza Ziyadi, Christos Christodoulopoulos, Bo Li, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Amazon(亚马逊) Information Commissioner’s Office(信息专员办公室)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2506.08009 2025-11-11 cs.CV cs.AI cs.LG 83%

Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion

Xun Huang, Zhengqi Li, Guande He, Mingyuan Zhou, Eli Shechtman

机构 * Adobe Research(Adobe研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments NeurIPS 2025 spotlight. Project website: http://self-forcing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08239 2025-11-11 cs.GR cs.CV 57%

ACT-R: Adaptive Camera Trajectories for Single View 3D Reconstruction

Yizhi Wang, Mingrui Zhao, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 3DV 2026, Project Page: https://mingrui-zhao.github.io/ACT-R/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2504.18800 2025-11-11 cs.CV cs.AI 57%

Video CLIP Model for Multi-View Echocardiography Interpretation

Ryo Takizawa, Satoshi Kodera, Tempei Kabayama, Ryo Matsuoka, Yuta Ando, Yuto Nakamura, Haruki Settai, Norihiko Takeda

机构 * The University of Tokyo Hospital(东京大学医院)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2505.24838 2025-11-11 cs.CV cs.AI 57%

VideoCAD: A Dataset and Model for Learning Long-Horizon 3D CAD UI Interactions from Video

Brandon Man, Ghadi Nehme, Md Ferdous Alam, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 3 篇

2511.06281 2025-11-11 cs.CV 70%

VideoSSR: Video Self-Supervised Reinforcement Learning

Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学)

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19875 2025-11-11 cs.CV 70%

InfiniBench: A Benchmark for Large Multi-Modal Models in Long-Form Movies and TV Shows

Kirolos Ataallah, Eslam Abdelrahman, Mahmoud Ahmed, Chenhui Gou, Khushbu Pahwa, Jian Ding, Mohamed Elhoseiny

机构 * KAUST(卡塔尔科技大学) Monash University(墨尔本大学) RICE University(里士满大学)

专题命中 视频数据与评测 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted for oral presentation at the EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15675 2025-11-11 cs.CV cs.AI 57%

Sekai: A Video Dataset towards World Exploration

Zhen Li, Chuanhao Li, Xiaofeng Mao, Shaoheng Lin, Ming Li, Shitian Zhao, Zhaopan Xu, Xinyue Li, Yukang Feng, Jianwen Sun, Zizhen Li, Fanrui Zhang, Jiaxin Ai, Zhixiang Wang, Yuwei Wu, Tong He, Jiangmiao Pang, Yu Qiao, Yunde Jia, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Beijing Institute of Technology(北京理工大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Tokyo(东京大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏