arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-07 至 2026-01-07 共收录 3 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 3 篇

2505.23171 2026-01-07 cs.CV 79%

RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer

RoboTransfer: 可控的几何一致视频扩散用于操控策略迁移

Liu Liu, Xiaofeng Wang, Guosheng Zhao, Keyu Li, Wenkang Qin, Jiagang Zhu, Jiaxiong Qiu, Zheng Zhu, Guan Huang, Zhizhong Su

机构 * Horizon Robotics GigaAI CASIA

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 RoboTransfer通过可控的几何一致视频扩散技术,提升机器人操控策略在真实环境中的泛化能力。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03178 2026-01-07 cs.CV 57%

DiffBench Meets DiffAgent: End-to-End LLM-Driven Diffusion Acceleration Code Generation

DiffBench 与 DiffAgent:端到端的 LLM 驱动扩散加速代码生成

Jiajun jiao, Haowei Zhu, Puyuan Yang, Jianghui Wang, Ji Liu, Ziqiong Liu, Dong Li, Yuejian Fang, Junhai Yong, Bin Wang, Emad Barsoum

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出DiffBench和DiffAgent,通过LLM驱动的闭环流程,实现端到端的扩散模型加速代码生成,显著提升生成策略的有效性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02646 2026-01-07 cs.CV cs.AI 57%

DreamLoop: Controllable Cinemagraph Generation from a Single Photograph

DreamLoop:从单张照片生成可控的cinemagraph

Aniruddha Mahapatra, Long Mai, Cusuh Ham, Feng Liu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 DreamLoop通过训练视频扩散模型实现从单张照片生成可控cinemagraph,提供灵活的运动路径控制,生成高质量且符合用户意图的动画。

Comments Project Page: https://anime26398.github.io/dreamloop.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏