arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-07 至 2026-01-07 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2 篇

2601.03233 2026-01-07 cs.CV 77%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02785 2026-01-07 cs.CV 57%

DreamStyle: A Unified Framework for Video Stylization

DreamStyle: 视频风格化的一个统一框架

Mengtian Li, Jinshu Chen, Songtao Zhao, Wanquan Feng, Pengqi Tu, Qian He

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DreamStyle通过统一框架支持文本、风格图像和第一帧引导的视频风格化,提升风格一致性和视频质量。

Comments Github Page: https://lemonsky1995.github.io/dreamstyle/

详情

展开后加载摘要…

URL PDF HTML 收藏