arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-15 至 2026-01-15 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 5 篇

2601.09697 2026-01-15 cs.CV 79%

Efficient Camera-Controlled Video Generation of Static Scenes via Sparse Diffusion and 3D Rendering

通过稀疏扩散和3D渲染实现静态场景的高效摄像机控制视频生成

Jieying Chen, Jeffrey Hu, Joan Lasenby, Ayush Tewari

机构 * University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SRENDER方法,通过稀疏扩散和3D渲染生成静态场景的高效视频,使视频生成速度提升40倍,保持高质量和稳定性。

Comments Project page: https://ayushtewari.com/projects/srender/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05966 2026-01-15 cs.CV cs.AI 79%

VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction

VideoAR: 通过下一帧与尺度预测实现自回归视频生成

Longbin Ji, Xiaoxiong Liu, Junyuan Shang, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 VideoAR通过多尺度下一帧预测与自回归建模,实现高效、一致的视频生成,提升性能并减少计算成本。

Comments Project page: https://ernie-research.github.io/VideoAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09255 2026-01-15 cs.CV 79%

PhyRPR: Training-Free Physics-Constrained Video Generation

PhyRPR: 无训练物理约束视频生成

Yibo Zhao, Hengjia Li, Xiaofei He, Boxi Wu

机构 * State Key Lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PhyRPR提出一种无训练的三阶段视频生成方法,通过解耦物理理解和视觉合成,提升生成视频的物理合理性和运动可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07832 2026-01-15 cs.CV cs.AI 57%

MHLA: Restoring Expressivity of Linear Attention via Token-Level Multi-Head

MHLA: 通过令牌级多头恢复线性注意力的表达性

Kewei Zhang, Ye Huang, Yufan Deng, Jincheng Yu, Junsong Chen, Huan Ling, Enze Xie, Daquan Zhou

机构 * Peking University(北京大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 MHLA通过令牌级多头机制恢复线性注意力的表达性,提升多个领域任务性能

Comments Code: https://github.com/DAGroup-PKU/MHLA/ Project website: https://dagroup-pku.github.io/MHLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23003 2026-01-15 cs.LG cs.AI cs.SY eess.SY 50%

Physically Plausible Multi-System Trajectory Generation and Symmetry Discovery

物理合理多系统轨迹生成与对称性发现

Jiayin Liu, Yulong Yang, Vineet Bansal, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出SPS-GAN,通过辛相空间GAN架构实现多系统轨迹生成与对称性发现,无需先验配置空间知识,通过物理动机项优化实现配置空间的稀疏表示。

详情

展开后加载摘要…

URL PDF HTML 收藏