arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-24 至 2025-12-24 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2512.19949 2025-12-24 cs.CV cs.AI 57%

How Much 3D Do Video Foundation Models Encode?

视频基础模型编码多少三维信息?

Zixuan Huang, Xiang Li, Zhaoyang Lv, James M. Rehg

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Impossible, Inc(Impossible公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文研究了视频基础模型对3D世界的理解程度,提出了一种模型无关的框架来评估不同模型的3D意识,并发现最先进的视频生成模型在无3D训练数据的情况下也能表现出超越专门3D任务模型的理解能力。

Comments Project Page: https://vidfm-3d-probe.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13507 2025-12-24 cs.CV 57%

Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model

Seedance 1.5 pro: 一种原生音频视频联合生成基础模型

Team Seedance, Heyi Chen, Siyan Chen, Xin Chen, Yanfei Chen, Ying Chen, Zhuo Chen, Feng Cheng, Tianheng Cheng, Xinqi Cheng, Xuyan Chi, Jian Cong, Jing Cui, Qinpeng Cui, Qide Dong, Junliang Fan, Jing Fang, Zetao Fang, Chengjian Feng, Han Feng, Mingyuan Gao, Yu Gao, Dong Guo, Qiushan Guo, Boyang Hao, Qingkai Hao, Bibo He, Qian He, Tuyen Hoang, Ruoqing Hu, Xi Hu, Weilin Huang, Zhaoyang Huang, Zhongyi Huang, Donglei Ji, Siqi Jiang, Wei Jiang, Yunpu Jiang, Zhuo Jiang, Ashley Kim, Jianan Kong, Zhichao Lai, Shanshan Lao, Yichong Leng, Ai Li, Feiya Li, Gen Li, Huixia Li, JiaShi Li, Liang Li, Ming Li, Shanshan Li, Tao Li, Xian Li, Xiaojie Li, Xiaoyang Li, Xingxing Li, Yameng Li, Yifu Li, Yiying Li, Chao Liang, Han Liang, Jianzhong Liang, Ying Liang, Zhiqiang Liang, Wang Liao, Yalin Liao, Heng Lin, Kengyu Lin, Shanchuan Lin, Xi Lin, Zhijie Lin, Feng Ling, Fangfang Liu, Gaohong Liu, Jiawei Liu, Jie Liu, Jihao Liu, Shouda Liu, Shu Liu, Sichao Liu, Songwei Liu, Xin Liu, Xue Liu, Yibo Liu, Zikun Liu, Zuxi Liu, Junlin Lyu, Lecheng Lyu, Qian Lyu, Han Mu, Xiaonan Nie, Jingzhe Ning, Xitong Pan, Yanghua Peng, Lianke Qin, Xueqiong Qu, Yuxi Ren, Kai Shen, Guang Shi, Lei Shi, Yan Song, Yinglong Song, Fan Sun, Li Sun, Renfei Sun, Yan Sun, Zeyu Sun, Wenjing Tang, Yaxue Tang, Zirui Tao, Feng Wang, Furui Wang, Jinran Wang, Junkai Wang, Ke Wang, Kexin Wang, Qingyi Wang, Rui Wang, Sen Wang, Shuai Wang, Tingru Wang, Weichen Wang, Xin Wang, Yanhui Wang, Yue Wang, Yuping Wang, Yuxuan Wang, Ziyu Wang, Guoqiang Wei, Wanru Wei, Di Wu, Guohong Wu, Hanjie Wu, Jian Wu, Jie Wu, Ruolan Wu, Xinglong Wu, Yonghui Wu, Ruiqi Xia, Liang Xiang, Fei Xiao, XueFeng Xiao, Pan Xie, Shuangyi Xie, Shuang Xu, Jinlan Xue, Shen Yan, Bangbang Yang, Ceyuan Yang, Jiaqi Yang, Runkai Yang, Tao Yang, Yang Yang, Yihang Yang, ZhiXian Yang, Ziyan Yang, Songting Yao, Yifan Yao, Zilyu Ye, Bowen Yu, Jian Yu, Chujie Yuan, Linxiao Yuan, Sichun Zeng, Weihong Zeng, Xuejiao Zeng, Yan Zeng, Chuntao Zhang, Heng Zhang, Jingjie Zhang, Kuo Zhang, Liang Zhang, Liying Zhang, Manlin Zhang, Ting Zhang, Weida Zhang, Xiaohe Zhang, Xinyan Zhang, Yan Zhang, Yuan Zhang, Zixiang Zhang, Fengxuan Zhao, Huating Zhao, Yang Zhao, Hao Zheng, Jianbin Zheng, Xiaozheng Zheng, Yangyang Zheng, Yijie Zheng, Jiexin Zhou, Jiahui Zhu, Kuan Zhu, Shenhan Zhu, Wenjia Zhu, Benhui Zou, Feilong Zuo

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Seedance 1.5 pro是一款专为原生音频视频联合生成设计的基础模型,通过双分支扩散变压器架构实现高质量生成,支持多语言唇形同步和动态摄像机控制,提升专业内容创作效率。

Comments Seedance 1.5 pro Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作与事件理解 1 篇

2512.19817 2025-12-24 cs.CV cs.GR 57%

Generating the Past, Present and Future from a Motion-Blurred Image

从模糊图像生成过去、现在和未来

SaiKiran Tedla, Kelly Zhu, Trevor Canham, Felix Taubner, Michael S. Brown, Kiriakos N. Kutulakos, David B. Lindell

机构 * York University(约克大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用预训练视频扩散模型从模糊图像恢复过去、现在和未来的视频,以揭示复杂场景动态。

Comments Code and data are available at https://blur2vid.github.io

Journal ref ACM Trans. Graph. (SIGGRAPH Asia 2025), vol. 44, no. 6, pp. 1-15, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 2 篇

2512.18741 2025-12-24 cs.CV 83%

Memorize-and-Generate: Towards Long-Term Consistency in Real-Time Video Generation

记忆与生成:迈向实时视频生成中的长期一致性

Tianrui Zhu, Shiyi Zhang, Zhirui Sun, Jingqi Tian, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 MAG通过分离内存压缩与帧生成任务,提升实时视频生成的长期一致性与效率。

Comments Code will be released at https://github.com/Xilluill/MAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20618 2025-12-24 cs.AI cs.CV cs.LG cs.MA 74%

LongVideoAgent: Multi-Agent Reasoning with Long Videos

LongVideoAgent: 多智能体推理与长视频

Runtao Liu, Ziyi Liu, Jiaqi Tang, Yue Ma, Renjie Pi, Jipeng Zhang, Qifeng Chen

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 长视频与时序推理 :long video(title);分类 cs.CV

AI总结 LongVideoAgent通过多智能体框架实现长视频的多模态推理,利用强化学习提升多智能体协作效率,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2512.20557 2025-12-24 cs.CV 57%

Learning to Reason in 4D: Dynamic Spatial Understanding for Vision Language Models

在4D中学习推理:面向视觉语言模型的动态空间理解

Shengchao Zhou, Yuxin Chen, Yuying Ge, Wei Huang, Jiehong Lin, Ying Shan, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本研究提出DSR套件,通过生成多选题-答案对和轻量级几何选择模块提升视觉语言模型的动态空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏