arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-23 至 2026-01-23 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2601.16214 2026-01-23 cs.CV 79%

CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback

CamPilot: 通过高效的相机奖励反馈提升视频扩散模型的相机控制

Wenhang Ge, Guibao Shen, Jiawei Feng, Luozhou Wang, Hao Lu, Xingye Tian, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 CamPilot通过高效的3D解码器和奖励机制提升视频扩散模型的相机控制能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23494 2026-01-23 cs.CV cs.GR 57%

Yesnt: Are Diffusion Relighting Models Ready for Capture Stage Compositing? A Hybrid Alternative to Bridge the Gap

Yesnt:扩散重照明模型是否准备好用于捕获阶段合成?一种混合方法用于弥合差距

Elisabeth Jüttner, Janelle Pfeifer, Leona Krath, Stefan Korfhage, Hannah Dröge, Matthias B. Hullin, Markus Plack

机构 * University of Bonn(波恩大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种混合重照明框架,结合扩散先验与物理约束,实现更稳定的视频重照明效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16163 2026-01-23 cs.AI cs.RO 50%

Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning

Cosmos Policy: 为视觉运动控制和规划微调视频模型

Moo Jin Kim, Yihuai Gao, Tsung-Yi Lin, Yen-Chen Lin, Yunhao Ge, Grace Lam, Percy Liang, Shuran Song, Ming-Yu Liu, Chelsea Finn, Jinwei Gu

机构 * NVIDIA Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Cosmos Policy通过单阶段后训练将预训练视频模型转化为高效机器人策略,实现视觉运动控制与规划的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏