arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-26 至 2026-08-26 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 2 篇

2608.23927 2026-08-26 cs.CV 新提交 57%

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

GlanceWAM:面向世界-动作模型的稀疏测试时想象方法

Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu

机构 * Virginia Tech(弗吉尼亚理工大学) Drexel University(卓克索大学) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 该研究提出GlanceWAM,通过异步解耦视频DiT的想象与控制,打破世界-动作模型的速度-成功率困境,在RoboCasa、LIBERO基准测试中表现优异,推理速度达48ms/块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23664 2026-08-26 cs.CV cs.LG 新提交 57%

Scaling Reinforcement Learning for Diffusion Models via Velocity Matching

通过速度匹配扩展扩散模型的强化学习

Jaemoo Choi, Wei Guo, Yuchen Zhu, Arash Vahdat, Molei Tao, Julius Berner, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 该研究提出基于奖励的速度匹配(RVM)方法,用于扩散模型的奖励微调,其训练成本显著降低,性能优于或相当基于轨迹的策略梯度方法,还通过动态跟踪奖励改善了视频生成的运动效果。

Comments 30 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏