arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-02 至 2025-12-02 共收录 26 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2512.02014 2025-12-02 cs.CV 70%

TUNA: Taming Unified Visual Representations for Native Unified Multimodal Models

TUNA: 降低统一视觉表示以适应原生统一多模态模型

Zhiheng Liu, Weiming Ren, Haozhe Liu, Zijian Zhou, Shoufa Chen, Haonan Qiu, Xiaoke Huang, Zhaochong An, Fanny Yang, Aditya Patel, Viktar Atliha, Tony Ng, Xiao Han, Chuyan Zhu, Chenyang Zhang, Ding Liu, Juan-Manuel Perez-Rua, Sen He, Jürgen Schmidhuber, Wenhu Chen, Ping Luo, Wei Liu, Tao Xiang, Jonas Schult, Yuren Cong

机构 * Meta BizAI University of Waterloo(滑铁卢大学)

专题命中 视频理解 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 TUNA通过统一视觉表示提升多模态模型的性能,实现端到端理解和生成任务的高效处理。

Comments Project page: https://tuna-ai.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01949 2025-12-02 cs.CV 57%

Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models

脚本:图结构和查询条件的语义令牌修剪用于多模态大语言模型

Zhongyu Yang, Dannong Xu, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦德大学BCML中心)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 Script通过图结构和查询条件的语义令牌修剪,提升多模态大语言模型的效率和准确性,实现显著的性能提升。

Comments Published in Transactions on Machine Learning Research, Project in https://01yzzyu.github.io/script.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00024 2025-12-02 cs.RO cs.CV 57%

Learning from Watching: Scalable Extraction of Manipulation Trajectories from Human Videos

通过观看学习:从人类视频中可扩展地提取操作轨迹

X. Hu, G. Ye

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出结合大规模基础模型与点跟踪技术,从人类视频中提取操作轨迹,以实现更高效的数据收集和机器人学习。

Comments Accepted to RSS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 8 篇

2512.00425 2025-12-02 cs.CV 83%

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

视频生成中重力的作用:基于可验证奖励的后训练牛顿定律

Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, Dimitris Samaras

机构 * Stony Brook University(石溪大学) LIX, École Polytechnique, CNRS, IPP(巴黎政治学院LIX研究所、法国国家科学研究中心、IPPP)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 NewtonRewards通过可验证奖励机制提升视频生成的物理合理性与运动流畅度。

Comments Project page: https://cvlab-stonybrook.github.io/NewtonRewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01960 2025-12-02 cs.CV cs.HC 79%

SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation

SpriteHand: 实时多样的手-物体交互与自回归视频生成

Zisu Li, Hengye Lyu, Jiaxin Shi, Yufeng Zeng, Mingming Fan, Hanwang Zhang, Chen Liang

机构 * HKUST (Guangzhou)(香港科技大学(广州)) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00832 2025-12-02 cs.CV 79%

PanFlow: Decoupled Motion Control for Panoramic Video Generation

PanFlow:全景视频生成的解耦运动控制

Cheng Zhang, Hanwen Liang, Donny Y. Chen, Qianyi Wu, Konstantinos N. Plataniotis, Camilo Cruz Gambardella, Jianfei Cai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PanFlow通过解耦动态摄像机旋转与输入光学流,提升全景视频生成的运动控制精度和质量。

Comments Accepted by AAAI. Code: https://github.com/chengzhag/PanFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14712 2025-12-02 cs.CV 79%

FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation

FreeSwim: 重新审视滑动窗口注意力机制以实现无训练超高清视频生成

Yunfeng Wu, Jiayi Song, Zhenxiong Tan, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 FreeSwim通过无训练滑动窗口注意力机制实现超高清视频生成,提升效率并保持视觉细节。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01677 2025-12-02 cs.CV 74%

Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation

基于结构和接触感知表示的开放世界手-物体交互视频生成

Haodong Yan, Hang Yu, Zhide Zhong, Weilin Yuan, Xin Gong, Zehang Luo, Chengxi Heyu, Junfeng Li, Wenxuan Song, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出一种结构和接触感知表示,用于生成逼真的手-物体交互视频,通过联合生成范式提升开放世界场景下的交互物理建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17735 2025-12-02 cs.MM cs.CV 62%

RDTF: Resource-efficient Dual-mask Training Framework for Multi-frame Animated Sticker Generation

RDTF:面向多帧动画贴纸生成的资源高效双掩码训练框架

Zhiqiang Yuan, Ting Zhang, Peixiang Luo, Ying Deng, Jiapei Zhang, Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能图案识别中心) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 RDTF通过三种核心设计,为多帧动画贴纸生成任务提供资源高效的解决方案,优于现有PEFT方法。

Comments Submitted to TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23172 2025-12-02 cs.CV 57%

Fast Multi-view Consistent 3D Editing with Video Priors

快速多视角一致3D编辑与视频先验

Liyi Chen, Ruihuang Li, Guowen Zhang, Pengfei Wang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ViP3DE方法,利用视频生成模型的时间一致性先验,实现多视角一致的3D编辑,提升编辑质量和速度。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00762 2025-12-02 cs.CV 57%

Seeing the Wind from a Falling Leaf

从飘落的树叶中看到风

Zhiyuan Gao, Jiageng Mao, Hong-Xing Yu, Haozhe Lou, Emily Yue-Ting Jia, Jernej Barbic, Jiajun Wu, Yue Wang

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种端到端可微逆图形框架,通过视频恢复不可见的物理力,应用于风场估计和基于物理的视频生成与编辑。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 5 篇

2511.23127 2025-12-02 cs.CV 79%

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成

Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen

机构 * HKUST (GZ)(香港科技大学) HKUST(香港科技大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01686 2025-12-02 cs.CV 57%

DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models

DreamingComics: 通过主体和布局定制生成实现故事可视化管道

Patrick Kwon, Chen Chen

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DreamingComics通过结合视频模型和布局生成技术,实现了基于主体和布局定制的高效故事可视化方法,提升了角色一致性和风格相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01481 2025-12-02 cs.CV 57%

ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling

ChronosObserver: 用超空间扩散采样驯服4D世界

Qisen Wang, Yifan Zhao, Peisen Shen, Jialu Li, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 ChronosObserver通过超空间表示和引导采样,实现无需训练的高质量多视角时间同步视频生成,解决4D世界生成难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00532 2025-12-02 cs.CV cs.RO 57%

Image Generation as a Visual Planner for Robotic Manipulation

图像生成作为机器人操作的视觉规划器

Ye Pang

机构 * Southern China University of Technology(华南理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。

Comments 11 pages 9 figures Under review at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23886 2025-12-02 cs.CV 57%

Generating Fit Check Videos with a Handheld Camera

使用手持相机生成符合检查的视频

Bowei Chen, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于视频扩散模型的方法,利用手持设备和静态照片生成逼真的全身视频,通过多参考注意力机制和图像微调策略提升视频真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2510.20285 2025-12-02 cs.CV cs.MM 62%

DMC$^3$: Dual-Modal Counterfactual Contrastive Construction for Egocentric Video Question Answering

DMC$^3$:双模态反事实对比构建用于第一人称视频问答

Jiayi Zou, Chaofan Chen, Bing-Kun Bao, Changsheng Xu

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peng Cheng Laboratory(鹏城实验室) MAIS, Institute of Automation, Chinese Academy of Sciences(自动化所MAIS)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV、cs.MM

AI总结 DMC$^3$通过双模态反事实对比构建方法提升第一人称视频问答性能,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 4 篇

2512.02015 2025-12-02 cs.CV 57%

Generative Video Motion Editing with 3D Point Tracks

基于3D点轨迹的生成视频运动编辑

Yao-Chih Lee, Zhoutong Zhang, Jiahui Huang, Jui-Hsien Wang, Joon-Young Lee, Jia-Bin Huang, Eli Shechtman, Zhengqi Li

机构 * Adobe Research(Adobe研究院) Adobe(Adobe公司) University of Maryland College Park(马里兰大学学院公园分校)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 本文提出基于3D点轨迹的视频生成框架,实现摄像机与物体运动的联合编辑,通过稀疏对应关系保持时空一致性,提升视频编辑的精确度和创作潜力。

Comments Project page: https://edit-by-track.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01298 2025-12-02 cs.CV 57%

TBT-Former: Learning Temporal Boundary Distributions for Action Localization

TBT-Former:基于时间边界分布的学习用于动作定位

Thisara Rathnayaka, Uthayasanker Thayasivam

机构 * Dept. of Computer Science \& Engineering University of Moratuwa Sri Lanka

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 TBT-Former通过改进的Transformer架构和边界分布回归头,提升动作定位性能,实现THUMOS14和EPIC-Kitchens 100数据集上的新高。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19861 2025-12-02 cs.CV cs.RO 57%

GigaWorld-0: World Models as Data Engine to Empower Embodied AI

GigaWorld-0:世界模型作为数据引擎赋能具身AI

GigaWorld Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jiagang Zhu, Kerui Li, Mengyuan Xu, Qiuping Deng, Siting Wang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yankai Wang, Yu Cao, Yifan Chang, Yuan Xu, Yun Ye, Yang Wang, Yukun Zhou, Zhengyuan Zhang, Zhehao Dong, Zheng Zhu

机构 * GigaWorld Team(GigaWorld团队)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 GigaWorld-0通过整合视频生成与3D建模技术,构建统一的数据引擎,生成高质量具身交互数据,提升VLA模型在现实任务中的性能。

Comments Project Page: https://giga-world-0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18151 2025-12-02 cs.GR cs.AI cs.CV 57%

WonderPlay: Dynamic 3D Scene Generation from a Single Image and Actions

WonderPlay:从单张图像和动作生成动态3D场景

Zizhang Li, Hong-Xing Yu, Wei Liu, Yin Yang, Charles Herrmann, Gordon Wetzstein, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Utah(犹他大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 WonderPlay通过结合物理模拟与视频生成,实现从单张图像和动作生成多样化动态3D场景。

Comments ICCV 2025 (Highlight). The first two authors contributed equally. Project website: https://kyleleey.github.io/WonderPlay/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 2 篇

2512.00694 2025-12-02 cs.CV 74%

Affordance-First Decomposition for Continual Learning in Video-Language Understanding

基于可及性的分解方法用于视频-语言理解中的持续学习

Mengzhu Xu, Hanzhi Liu, Ningkang Peng, Qianyu Chen, Canran Xiao

机构 * University of Sydney(悉尼大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Nanjing Normal University(南京师范大学) Nanyang Technological University(南洋理工大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 长视频与时序推理 :video-language(title);分类 cs.CV

AI总结 AFD通过显式分解视频-语言理解中的稳定性与适应性,实现了在持续学习中的高性能表现。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08015 2025-12-02 cs.CV 57%

4DGT: Learning a 4D Gaussian Transformer Using Real-World Monocular Videos

4DGT: 基于4D高斯变换器的学习用于动态场景重建

Zhen Xu, Zhengqin Li, Zhao Dong, Xiaowei Zhou, Richard Newcombe, Zhaoyang Lv

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 4DGT通过基于4D高斯的变换器模型,在真实世界单目视频上实现高效动态场景重建,显著提升重建速度并优于现有方法。

Comments NeurIPS 2025 (Spotlight); Project Page: https://4dgt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 3 篇

2511.12263 2025-12-02 cs.CV cs.AI 83%

CrossVid: A Comprehensive Benchmark for Evaluating Cross-Video Reasoning in Multimodal Large Language Models

CrossVid: 一个用于评估多模态大语言模型在跨视频推理中的综合基准

Jingyao Li, Jingyun Wang, Molin Tan, Haochen Wang, Cilin Yan, Likun Shi, Jiayin Cai, Xiaolong Jiang, Yao Hu

专题命中 视频数据与评测 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 CrossVid是首个用于评估多模态大语言模型跨视频推理能力的综合基准,通过多样化的任务和数据集验证了模型在复杂视频推理任务中的表现。

Comments Accepted to AAAI 2026 (main track). For code and data, see https://github.com/chuntianli666/CrossVid

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01989 2025-12-02 cs.CV 70%

PAI-Bench: A Comprehensive Benchmark For Physical AI

PAI-Bench: 一个全面的物理AI基准

Fengzhe Zhou, Jiannan Huang, Jialuo Li, Deva Ramanan, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) CMU(卡内基梅隆大学)

专题命中 视频数据与评测 :video generation(abstract);video understanding(abstract);分类 cs.CV

AI总结 PAI-Bench通过评估视频生成和理解任务,揭示了当前模型在物理合理性和动态一致性上的不足,为物理AI的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00983 2025-12-02 cs.GR cs.AI cs.CV 57%

WorldScore: A Unified Evaluation Benchmark for World Generation

WorldScore: 一个用于世界生成的统一评估基准

Haoyi Duan, Hong-Xing Yu, Sirui Chen, Li Fei-Fei, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 WorldScore提出一个统一评估基准,用于评估不同世界生成方法,涵盖3D、4D场景生成及视频生成,通过可控性、质量和动态性三个维度评估19种模型。

Comments ICCV 2025. Project website: https://haoyi-duan.github.io/WorldScore/ The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏