arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-02 至 2025-12-02 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 8 篇

2512.00425 2025-12-02 cs.CV 83%

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

视频生成中重力的作用:基于可验证奖励的后训练牛顿定律

Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, Dimitris Samaras

机构 * Stony Brook University(石溪大学) LIX, École Polytechnique, CNRS, IPP(巴黎政治学院LIX研究所、法国国家科学研究中心、IPPP)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 NewtonRewards通过可验证奖励机制提升视频生成的物理合理性与运动流畅度。

Comments Project page: https://cvlab-stonybrook.github.io/NewtonRewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01960 2025-12-02 cs.CV cs.HC 79%

SpriteHand: Real-Time Versatile Hand-Object Interaction with Autoregressive Video Generation

SpriteHand: 实时多样的手-物体交互与自回归视频生成

Zisu Li, Hengye Lyu, Jiaxin Shi, Yufeng Zeng, Mingming Fan, Hanwang Zhang, Chen Liang

机构 * HKUST (Guangzhou)(香港科技大学(广州)) XMax.AI Ltd.(XMax人工智能有限公司) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SpriteHand通过自回归视频生成框架实现实时高质量手-物体交互视频合成,支持多种物体和运动模式,具有高视觉真实性和物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00832 2025-12-02 cs.CV 79%

PanFlow: Decoupled Motion Control for Panoramic Video Generation

PanFlow:全景视频生成的解耦运动控制

Cheng Zhang, Hanwen Liang, Donny Y. Chen, Qianyi Wu, Konstantinos N. Plataniotis, Camilo Cruz Gambardella, Jianfei Cai

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PanFlow通过解耦动态摄像机旋转与输入光学流,提升全景视频生成的运动控制精度和质量。

Comments Accepted by AAAI. Code: https://github.com/chengzhag/PanFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14712 2025-12-02 cs.CV 79%

FreeSwim: Revisiting Sliding-Window Attention Mechanisms for Training-Free Ultra-High-Resolution Video Generation

FreeSwim: 重新审视滑动窗口注意力机制以实现无训练超高清视频生成

Yunfeng Wu, Jiayi Song, Zhenxiong Tan, Zihao He, Songhua Liu

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) Xi’an Jiaotong University(西安交通大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 FreeSwim通过无训练滑动窗口注意力机制实现超高清视频生成,提升效率并保持视觉细节。

Comments 23 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01677 2025-12-02 cs.CV 74%

Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation

基于结构和接触感知表示的开放世界手-物体交互视频生成

Haodong Yan, Hang Yu, Zhide Zhong, Weilin Yuan, Xin Gong, Zehang Luo, Chengxi Heyu, Junfeng Li, Wenxuan Song, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出一种结构和接触感知表示,用于生成逼真的手-物体交互视频,通过联合生成范式提升开放世界场景下的交互物理建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17735 2025-12-02 cs.MM cs.CV 62%

RDTF: Resource-efficient Dual-mask Training Framework for Multi-frame Animated Sticker Generation

RDTF:面向多帧动画贴纸生成的资源高效双掩码训练框架

Zhiqiang Yuan, Ting Zhang, Peixiang Luo, Ying Deng, Jiapei Zhang, Zexi Jia, Jinchao Zhang, Jie Zhou

机构 * Pattern Recognition Center, WeChat AI, Tencent Inc(腾讯人工智能图案识别中心) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 RDTF通过三种核心设计,为多帧动画贴纸生成任务提供资源高效的解决方案,优于现有PEFT方法。

Comments Submitted to TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23172 2025-12-02 cs.CV 57%

Fast Multi-view Consistent 3D Editing with Video Priors

快速多视角一致3D编辑与视频先验

Liyi Chen, Ruihuang Li, Guowen Zhang, Pengfei Wang, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ViP3DE方法,利用视频生成模型的时间一致性先验,实现多视角一致的3D编辑,提升编辑质量和速度。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00762 2025-12-02 cs.CV 57%

Seeing the Wind from a Falling Leaf

从飘落的树叶中看到风

Zhiyuan Gao, Jiageng Mao, Hong-Xing Yu, Haozhe Lou, Emily Yue-Ting Jia, Jernej Barbic, Jiajun Wu, Yue Wang

机构 * University of Southern California(南加州大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出一种端到端可微逆图形框架,通过视频恢复不可见的物理力,应用于风场估计和基于物理的视频生成与编辑。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏