arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-11 至 2026-02-11 共收录 14 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2602.10113 2026-02-11 cs.CV 83%

ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

ConsID-Gen:视图一致且身份保持的图像到视频生成

Mingyang Wu, Ashirbad Mishra, Soumik Dey, Shuo Xing, Naveen Ravipati, Hansi Wu, Binbin Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) eBay Inc.(eBay公司)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 ConsID-Gen通过视图辅助生成框架提升图像到视频生成的视图一致性和身份保持性。

Comments Project page: https://myangwu.github.io/ConsID-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08682 2026-02-11 cs.CV 83%

ALIVE: Animate Your World with Lifelike Audio-Video Generation

ALIVE: 用逼真音频视频生成动画你的世界

Ying Guo, Qijun Gan, Yifu Zhang, Jinlai Liu, Yifei Hu, Pan Xie, Dongjun Qian, Yu Zhang, Ruiqi Li, Yuqi Zhang, Ruibiao Lu, Xiaofeng Mei, Bo Han, Xiang Yin, Bingyue Peng, Zehuan Yuan

机构 * Bytedance ALIVE Team(字节跳动ALIVE团队)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 ALIVE通过结合预训练文本到视频模型与新的音频视频生成技术,实现了逼真的音频视频生成和动画,展示了优于开源和商业解决方案的性能。

Comments Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03213 2026-02-11 cs.CV 79%

ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask

ConsisDrive: 用于视频生成的实例掩码驾驶世界模型

Zhuoran Yang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ConsisDrive通过实例掩码注意力和损失机制提升驾驶视频生成质量及自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10105 2026-02-11 cs.RO 50%

DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos

DexImit:从单目人类视频中学习双臂灵巧操作

Juncheng Mu, Sizhe Yang, Yiming Bao, Hojin Bae, Tianming Wei, Linning Xu, Boyi Li, Huazhe Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract)

AI总结 DexImit通过四阶段生成流程,将单目人类视频转化为物理合理的机器人数据,以解决双臂灵巧操作的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频扩散模型 7 篇

2504.16081 2026-02-11 cs.CV cs.CL 79%

Survey of Video Diffusion Models: Foundations, Implementations, and Applications

视频扩散模型综述:基础、实现与应用

Yimu Wang, Xuye Liu, Wei Pang, Li Ma, Shuai Yuan, Paul Debevec, Ning Yu

机构 * University of Waterloo(滑铁卢大学) Netflix Eyeline Studios Duke University(杜克大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文综述视频扩散模型的基础、实现与应用,系统梳理了当前方法学体系,分析架构创新与优化策略,并探讨其在视频生成中的实际应用及与其他领域的协同作用。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10102 2026-02-11 cs.CV 70%

VideoWorld 2: Learning Transferable Knowledge from Real-world Videos

VideoWorld 2: 从真实世界视频中学习可迁移的知识

Zhongwei Ren, Yunchao Wei, Xiao Yu, Guixun Luo, Yao Zhao, Bingyi Kang, Jiashi Feng, Xiaojie Jin

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 VideoWorld 2通过动态增强的潜在动态模型从真实世界视频中学习可迁移知识,显著提升了任务成功率和长周期推理能力。

Comments Code and models are released at: https://maverickren.github.io/VideoWorld2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09868 2026-02-11 cs.CV 70%

Free-GVC: Towards Training-Free Extreme Generative Video Compression with Temporal Coherence

Free-GVC: 向无训练极端生成视频压缩迈进:时间一致性

Xiaoyue Ling, Chuqin Zhou, Chunyi Li, Yunuo Chen, Yuan Tian, Guo Lu, Wenjun Zhang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Free-GVC通过无训练的生成视频压缩框架,在超低比特率下实现视觉质量与时间一致性的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21091 2026-02-11 cs.CV 70%

ERTACache: Error Rectification and Timesteps Adjustment for Efficient Diffusion

ERTACache:误差修正与时间步调整以实现高效的扩散模型

Xurui Peng, Chenqian Yan, Hong Liu, Rui Ma, Fangmin Chen, Xing Wang, Zhihua Wu, Songwei Liu, Mingbao Lin

机构 * ByteDance Inc.(字节跳动公司) Rakuten Asia(乐天亚洲)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 ERTACache通过误差修正和时间步调整,实现高效扩散模型的加速,保持视觉质量的同时提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09883 2026-02-11 cs.CV 57%

AdaTSQ: Pushing the Pareto Frontier of Diffusion Transformers via Temporal-Sensitivity Quantization

AdaTSQ: 通过时间敏感量化推动扩散变换器的帕累托前沿

Shaoqiu Zhang, Zizhong Ding, Kaicheng Yang, Junyi Wu, Xianglong Yan, Xi Li, Bingnan Duan, Jianping Fang, Yulun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 AdaTSQ通过时间敏感量化方法提升扩散变换器的效率与质量,优于现有方法。

Comments Code will be released at https://github.com/Qiushao-E/AdaTSQ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09268 2026-02-11 cs.CV 57%

Rethinking Global Text Conditioning in Diffusion Transformers

重新思考扩散变换器中的全局文本条件化

Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen Liu, Zhonghao Wang, Yuqian Zhou, Zhe Lin, Dmitry Baranchuk

机构 * Yandex Research(Yandex研究院) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文重新思考扩散变换器中的全局文本条件化,发现传统调制机制贡献有限,但通过不同视角使用池化嵌入可带来显著性能提升。

Comments Accepted at ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20240 2026-02-11 cs.CV 57%

Unconditional Priors Matter! Improving Conditional Generation of Fine-Tuned Diffusion Models

无条件先验很重要!改进细调扩散模型的条件生成

Prin Phunyaphibarn, Phillip Y. Lee, Jaihoon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出通过替换无条件噪声提升条件生成质量,验证了使用其他扩散模型进行无条件噪声预测的有效性。

Comments WACV 2026; Project Page: https://unconditional-priors-matter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 2 篇

2602.09146 2026-02-11 cs.CV 57%

SemanticMoments: Training-Free Motion Similarity via Third Moment Features

语义时刻:通过第三时刻特征实现免训练的运动相似性

Saar Huberman, Kfir Goldberg, Or Patashnik, Sagie Benaim, Ron Mokady

机构 * BRIA AI(BRIA人工智能研究中心) Tel Aviv University(特拉维夫大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV

AI总结 SemanticMoments通过计算语义特征的高阶矩,无需训练即可提升基于运动的视频理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21797 2026-02-11 cs.CV 57%

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

MoWM: 通过潜在到像素特征调制的混合世界模型实现具身规划

Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI Shanghai Jiao Tong University(上海交通大学)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 MoWM通过融合潜在世界模型与像素特征,提升具身规划中动作解码的精度与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 1 篇

2602.09816 2026-02-11 cs.CV 57%

CompSplat: Compression-aware 3D Gaussian Splatting for Real-world Video

CompSplat: 为真实世界视频设计的压缩感知3D高斯点散布

Hojun Song, Heejung Choi, Aro Kim, Chae-yeong Song, Gahyeon Kim, Soo Ye Kim, Jaehyup Lee, Sang-hyo Park

机构 * Kyungpook National University(Kyungpook国立大学) Adobe Research(Adobe研究院)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 CompSplat是一种针对真实世界视频压缩感知的3D高斯点散布框架,通过建模帧级压缩特性来减少帧间不一致性和累积几何误差,实现了在高压缩条件下更高质量的视角合成。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏