arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-12 至 2026-02-12 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2602.10825 2026-02-12 cs.CV cs.AI 85%

Flow caching for autoregressive video generation

流缓存用于自回归视频生成

Yuexiao Ma, Xuzhe Zheng, Jing Xu, Xiwei Xu, Feng Ling, Xiawu Zheng, Huafeng Kuang, Huixia Li, Xing Wang, Xuefeng Xiao, Fei Chao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 FlowCache通过分块缓存策略和优化的KV缓存压缩机制,显著提升了自回归视频生成的速度,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10717 2026-02-12 cs.RO 50%

Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation

说、梦、做:学习视频世界模型以驱动指令式机器人操作

Songen Gu, Yunuo Cai, Tianyu Wang, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏