arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-24 至 2026-02-24 共收录 18 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2602.18702 2026-02-24 cs.CV cs.AI 89%

Think with Grounding: Curriculum Reinforced Reasoning with Video Grounding for Long Video Understanding

基于接地的思考:用于长视频理解的课程强化推理与视频接地

Houlun Chen, Xin Wang, Guangyao Li, Yuwei Zhou, Yihan Chen, Jia Jia, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 Video-TwG通过课程强化框架和接地范式提升长视频理解,采用双阶段策略和TwG-GRPO算法优化推理与接地质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16210 2026-02-24 cs.CV cs.AI 85%

PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation

PyraTok: 用于视频理解和生成的语言对齐金字塔分词器

Onkar Susladkar, Tushar Prakash, Adheesh Juvekar, Kiet A. Nguyen, Dong-Hwan Jang, Inderjit S Dhillon, Ismini Lourentzou

专题命中 视频理解 :video understanding(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 PyraTok通过多尺度文本引导量化和全局自回归目标,实现了视频理解和生成中语言与视觉的紧密对齐,提升了视频重建和零样本迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16412 2026-02-24 cs.CV 79%

ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding

ReMoRa:基于精细运动表示的多模态大语言模型用于长视频理解

Daichi Yashima, Shuhei Kurita, Yusuke Oda, Komei Sugiura

机构 * Keio University(庆应大学) NII(日本信息处理学会) NII LLMC(日本信息处理学会语言模型中心)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 ReMoRa通过精细运动表示实现长视频理解,有效压缩视频数据并提升多模态大语言模型性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18977 2026-02-24 cs.CV 74%

Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding

Frame2Freq: 用于细粒度视频理解的频谱适配器

Thinesh Thiyakesan Ponbagavathi, Constantin Seibold, Alina Roitberg

机构 * Institute for Artificial Intelligence, University of Stuttgart(斯图加特大学人工智能研究所) University Hospital Heidelberg, Diagnostic and Interventional Radiology(海德堡大学医院放射诊断与介入科) Intelligent Assistive Systems Lab, University of Hildesheim(希尔德斯海姆大学智能辅助系统实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 Frame2Freq通过频谱编码提升细粒度视频理解,利用FFT和频率带嵌入改进动作识别性能。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19184 2026-02-24 cs.RO 50%

Human-to-Robot Interaction: Learning from Video Demonstration for Robot Imitation

人机交互:从视频演示中学习机器人模仿

Thanh Nguyen Canh, Thanh-Tuan Tran, Haolan Zhang, Ziyan Gao, Nak Young Chong, Xiem HoangVan

专题命中 视频理解 :video understanding(abstract)

AI总结 本研究提出了一种基于视频演示的机器人模仿学习方法,通过模块化框架结合时间位移模块和深度强化学习,实现机器人从无结构视频中学习基本操作技能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2602.09609 2026-02-24 cs.CV 83%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV 83%

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19163 2026-02-24 cs.CV cs.MM cs.SD 81%

JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation

JavisDiT++:联合音频视频生成的统一建模与优化

Kai Liu, Yanhao Zheng, Kai Wang, Shengqiong Wu, Rongjunchen Zhang, Jiebo Luo, Dimitrios Hatzinakos, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Toronto(多伦多大学) HiThink Research(HiThink研究) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 JavisDiT++通过统一建模与优化方法,在联合音频视频生成任务中实现高质量的同步与语义对齐。

Comments Accepted by ICLR 2026. Homepage: https://JavisVerse.github.io/JavisDiT2-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19040 2026-02-24 cs.IR cs.AI cs.MM 79%

Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval

自适应多智能体推理用于文本到视频检索

Jiaxin Wu, Xiao-Yong Wei, Qing Li

机构 * Shenzhen University(深圳大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.MM

AI总结 本文提出自适应多智能体框架,通过动态协调检索、推理和查询重述智能体,提升文本到视频检索的零样本跨模态对齐与复杂查询处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18618 2026-02-24 cs.CV 57%

Narrating For You: Prompt-guided Audio-visual Narrating Face Generation Employing Multi-entangled Latent Space

为你叙述:基于多纠缠潜在空间的提示引导音频视觉叙述面部生成

Aashish Chandra, Aashutosh A, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, BITS Pilani, Hyderabad Campus, India(机器智能组,计算机科学与信息学系,比斯汉学院海得拉巴校区,印度) Georgia Institute of Technology, USA(佐治亚理工学院,美国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出了一种基于多纠缠潜在空间的音频视觉叙述面部生成方法,通过合成静态图像、语音档案和目标文本来生成逼真的说话面孔。

Comments To appear in the Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) 2026. Presented at Poster Session 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06559 2026-02-24 cs.GT 50%

GenAI vs. Human Creators: Procurement Mechanism Design in Two-/Three-Layer Markets

生成式AI与人类创作者:跨域市场中的采购机制设计

Rui Ai, David Simchi-Levi, Haifeng Xu

专题命中 视频生成 :video generation(abstract)

AI总结 本文研究了生成式AI与人类创作者在跨域市场中的采购机制设计,揭示了数据中介带来的影响及对社会福利的负面影响,提出需政府监管以优化数据生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 6 篇

2512.05016 2026-02-24 cs.CV 83%

Generative Neural Video Compression via Video Diffusion Prior

基于视频扩散先验的生成神经视频压缩

Qi Mao, Hao Cheng, Tinghan Yang, Libiao Jin, Siwei Ma

机构 * School of Information and Communication Engineering, Communication University of China(信息与通信工程学院,通信大学) School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 GNVC-VD通过结合视频扩散先验和序列级去噪,实现了高效的生成神经视频压缩,显著减少了闪烁伪影并提升了感知质量。

Comments accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23377 2026-02-24 cs.CV cs.AI cs.SD eess.AS 83%

JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization

JavisDiT:具有层次化时空先验同步的联合音频视频扩散变换器

Kai Liu, Wei Li, Lai Chen, Shengqiong Wu, Yanhao Zheng, Jiayi Ji, Fan Zhou, Jiebo Luo, Ziwei Liu, Hao Fei, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) University of Rochester(罗切斯特大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 JavisDiT通过层次化时空先验同步机制,实现了高质量的音频视频同步生成,解决了现实场景中的同步评估问题。

Comments Accepted by ICLR 2026. Homepage: https://javisverse.github.io/JavisDiT-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07399 2026-02-24 cs.CV cs.LG 79%

StreamDiffusionV2: A Streaming System for Dynamic and Interactive Video Generation

StreamDiffusionV2:动态交互视频生成的流式系统

Tianrui Feng, Zhi Li, Shuo Yang, Haocheng Xi, Muyang Li, Xiuyu Li, Lvmin Zhang, Keting Yang, Kelly Peng, Song Han, Maneesh Agrawala, Kurt Keutzer, Akio Kodaira, Chenfeng Xu

机构 * Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 视频扩散模型 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 StreamDiffusionV2通过无训练管道和系统级优化,实现了低延迟、高效率的实时视频生成,支持灵活的去噪步骤和多GPU扩展,推动生成直播的实用化和普及。

Comments Accepted by MLSys 2026. Project Page: http://streamdiffusionv2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06391 2026-02-24 cs.CV 70%

Object-WIPER : Training-Free Object and Associated Effect Removal in Videos

Object-WIPER : 无需训练的对象及关联效果视频去除

Saksham Singh Kushwaha, Sayan Nag, Yapeng Tian, Kuldeep Kulkarni

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 Object-WIPER通过预训练的文本到视频扩散模型实现无需训练的对象及关联效果视频去除,通过创新的去噪方法和新指标在DAVIS和WIPER-Bench上取得优越性能。

Comments Accepted to CVPR 2026. Project Page: https://sakshamsingh1.github.io/object_wiper_webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06336 2026-02-24 cs.CV cs.LG eess.IV 62%

MEt3R: Measuring Multi-View Consistency in Generated Images

MEt3R:测量生成图像的多视图一致性

Mohammad Asim, Christopher Wewer, Thomas Wimmer, Bernt Schiele, Jan Eric Lenssen

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland Informatics Campus(萨尔州信息校园) ETH Zurich(苏黎世联邦理工学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV

AI总结 MEt3R是一种用于评估生成图像多视图一致性的新指标,通过密集3D重建和特征比较,独立于场景和采样过程,评估生成模型的质量。

Comments Project website: https://geometric-rl.mpi-inf.mpg.de/met3r/ Updated to Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19089 2026-02-24 cs.CV cs.GR cs.LG 57%

Ani3DHuman: Photorealistic 3D Human Animation with Self-guided Stochastic Sampling

Ani3DHuman:基于自引导随机采样的逼真3D人体动画

Qi Sun, Can Wang, Jiaxiang Shang, Yingchun Liu, Jing Liao

机构 * City University of Hong Kong(香港城市大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 Ani3DHuman通过结合运动学动画与视频扩散先验,利用自引导随机采样实现逼真3D人体动画生成。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2503.13444 2026-02-24 cs.CV cs.AI 83%

VideoMind: A Chain-of-LoRA Agent for Temporal-Grounded Video Reasoning

VideoMind: 一种用于时序 grounded 视频推理的链式 LoRA 代理

Ye Liu, Kevin Qinghong Lin, Chang Wen Chen, Mike Zheng Shou

机构 * The Hong Kong Polytechnic University(香港理工大学) National University of Singapore(新加坡国立大学)

专题命中 视频问答 :video reasoning(title,abstract);video-language(abstract);分类 cs.CV

AI总结 VideoMind 提出了一种基于角色的链式 LoRA 机制,用于提升视频时序 grounded 推理的效率与灵活性。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏