arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-01 至 2026-01-01 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 2 篇

2512.25075 2026-01-01 cs.CV cs.AI cs.RO 57%

SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

SpaceTimePilot: 动态场景在时空上的生成渲染

Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang

机构 * University of Cambridge(剑桥大学) Adobe Research(Adobe研究院)

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 SpaceTimePilot通过解耦空间和时间实现动态场景的可控生成渲染,结合时序扭曲训练和CamxTime数据集提升时间控制精度。

Comments Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18113 2026-01-01 cs.CV 57%

Chrono: A Simple Blueprint for Representing Time in MLLMs

Chrono: 一种用于多模态大语言模型中表示时间的简单蓝图

Hector Rodriguez, Boris Meinardus, Anil Batra, Anna Rohrbach, Marcus Rohrbach

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

AI总结 Chrono提出了一种简单通用的序列蓝图,用于提升多模态大语言模型在视频时间定位和 grounded 视频问答任务中的性能。

Comments Code: https://github.com/sudo-Boris/mr-Blip. Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Under review

详情

展开后加载摘要…

URL PDF HTML 收藏