arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-02-27 至 2026-02-27 共收录 16 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2602.22932 2026-02-27 cs.CV 79%

MSJoE: Jointly Evolving MLLM and Sampler for Efficient Long-Form Video Understanding

MSJoE:联合进化多模态大语言模型与采样器以实现高效的长视频理解

Wenhui Tan, Xiaoyi Yu, Jiaze Li, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Ruihua Song, Jian Luan

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Tongji University(同济大学) MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 MSJoE通过联合进化多模态大语言模型与轻量级采样器,提升长视频理解效率,实验表明其在多个基准测试中表现优异。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08683 2026-02-27 cs.CV 57%

OneVision-Encoder: Codec-Aligned Sparsity as a Foundational Principle for Multimodal Intelligence

OneVision-Encoder: 编码对齐的稀疏性作为多模态智能的基础原则

Feilong Tang, Xiang An, Yunyao Yan, Yin Xie, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Chunyuan Li, Shikun Feng, Changrui Chen, Huajie Tan, Ming Hu, Manyuan Zhang, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

机构 * Glint Lab(Glint实验室) AIM for Health Lab(健康人工智能实验室) MVP Lab(MVP实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 OneVision-Encoder通过编码对齐的稀疏性原则,实现高效的多模态视觉理解。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2502.02088 2026-02-27 cs.CV cs.AI 86%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04228 2026-02-27 cs.CV cs.AI cs.LG cs.MM 84%

LayerT2V: A Unified Multi-Layer Video Generation Framework

LayerT2V: 一个统一的多层视频生成框架

Guangzhao Li, Kangrui Cen, Baixuan Zhao, Yi Xin, Siqi Luo, Guangtao Zhai, Lei Zhang, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Hong Kong Polytechnic University(香港理工大学) OPPO Research Institute(OPPO研究院) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV、cs.MM

AI总结 LayerT2V通过统一的多层视频生成框架,实现了多层输出并提升了视频生成的语义一致性和时间一致性。

Comments Project Page is https://layert2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23203 2026-02-27 cs.CV cs.AI 79%

ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation

ColoDiff:整合动态一致性与内容感知用于结肠镜视频生成

Junhu Fu, Shuyu Liang, Wutong Li, Chen Ma, Peng Huang, Kehao Wang, Ke Chen, Shengli Lin, Pinghong Zhou, Zeju Li, Yuanyuan Wang, Yi Guo

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Fudan University Shanghai Cancer Center(复旦大学上海肿瘤中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心和内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ColoDiff通过整合动态一致性与内容感知,生成高质量的结肠镜视频,以缓解数据短缺并辅助临床分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17937 2026-02-27 cs.SD cs.AI cs.CL eess.AS 71%

Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation

Bob的彩纸:音乐和视频生成中的语音记忆攻击

Jaechul Roh, Zachary Novack, Yuefeng Peng, Niloofar Mireshghallah, Taylor Berg-Kirkpatrick, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(title)

AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13587 2026-02-27 cs.CV 57%

UniFuture: A 4D Driving World Model for Future Generation and Perception

UniFuture: 一个面向未来生成与感知的4D驾驶世界模型

Dingkang Liang, Dingyuan Zhang, Xin Zhou, Sifan Tu, Tianrui Feng, Xiaofan Li, Yumeng Zhang, Mingyang Du, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 UniFuture通过统一4D建模提升自动驾驶中的未来生成与几何感知能力。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22208 2026-02-27 cs.CV 57%

Solaris: Building a Multiplayer Video World Model in Minecraft

Solaris:在Minecraft中构建多玩家视频世界模型

Georgy Savva, Oscar Michel, Daohan Lu, Suppakit Waiwitlikhit, Timothy Meehan, Dhairya Mishra, Srivats Poddar, Jack Lu, Saining Xie

机构 * New York University(纽约大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Solaris通过多玩家数据系统和分阶段训练方法,在Minecraft中构建了能模拟多视角观测的视频世界模型,提升了多代理交互的建模能力。

Comments Project website: https://solaris-wm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 7 篇

2411.19381 2026-02-27 cs.CV cs.GR 88%

Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity Constraints

增强草图动画:带有时间一致性和刚性约束的文本到视频扩散模型

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术研究所图形研究组)

专题命中 视频扩散模型 :video diffusion(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于文本到视频扩散模型的草图动画方法,通过引入时间一致性和刚性约束,提升了动画的平滑度和形状保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12691 2026-02-27 cs.GR cs.CV cs.LG 86%

Adaptive Hybrid Caching for Efficient Text-to-Video Diffusion Model Acceleration

自适应混合缓存用于高效文本到视频扩散模型加速

Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Wei Lin, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(title);video generation(abstract);分类 cs.CV

AI总结 本文提出MixCache,一种基于缓存的训练自由框架,通过自适应混合缓存策略提升视频DiT模型的生成效率和质量。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05115 2026-02-27 cs.GR cs.CV cs.SD eess.AS 74%

RAP: Real-time Audio-driven Portrait Animation with Video Diffusion Transformer

RAP: 基于音频的实时人物动画与视频扩散变换器

Fangyu Du, Taiqing Li, Qian Qiao, Tan Yu, Ziwei Zhang, Dingcheng Zhen, Xu Jia, Yang Yang, Shunshun Yin, Siyuan Liu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

AI总结 RAP通过混合注意力机制和静态-动态训练-推理范式,在实时约束下实现高质量音频驱动人物动画,提升音频-视觉同步与视觉保真度。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14377 2026-02-27 cs.CV 70%

RelaCtrl: Relevance-Guided Efficient Control for Diffusion Transformers

RelaCtrl: 为扩散变换器实现相关性引导的高效控制

Ke Cao, Jing Wang, Ao Ma, Jiasong Feng, Xuanhua He, Run Ling, Haowei Liu, Jian Lu, Wei Feng, Haozhe Wang, Hongjuan Pei, Yihua Shao, Zhanjie Zhang, Jie Zhang

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 RelaCtrl通过相关性引导的方法优化扩散变换器的控制信号整合,减少参数和计算开销,提升生成效率。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12099 2026-02-27 cs.CV 57%

G4Splat: Geometry-Guided Gaussian Splatting with Generative Prior

G4Splat:基于生成先验的几何引导高斯点云法

Junfeng Ni, Yixin Chen, Zhifei Yang, Yu Liu, Ruijie Lu, Song-Chun Zhu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Peking University(北京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 G4Splat通过几何引导的生成先验提升3D场景重建,有效解决多视角不一致性问题,实现高质量场景补全。

Comments ICLR'26. Project page: https://dali-jack.github.io/g4splat-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06139 2026-02-27 cs.CV 57%

Deforming Videos to Masks: Flow Matching for Referring Video Segmentation

视频变形到掩码:用于指认视频分割的流匹配

Zanyi Wang, Dengyang Jiang, Liuzhuozheng Li, Sizhe Dang, Chengzu Li, Harry Yang, Guang Dai, Mengmeng Wang, Jingdong Wang

机构 * SGIT AI Lab, State Grid Corporation of China(国网信通研究院) University of California, San Diego(加州大学圣地亚哥分校) The Hong Kong University of Science and Technology(香港科技大学) The University of Tokyo(东京大学) University of Cambridge(剑桥大学) Zhejiang University of Technology(浙江工业大学) Baidu(百度)

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV

AI总结 本文提出FlowRVS框架,将指认视频分割视为条件连续流问题,通过学习视频整体表示到目标掩码的直接语言引导变形,在多个基准上取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22596 2026-02-27 cs.CV cs.AI 57%

BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model

BetterScene: 一种基于表示对齐生成模型的3D场景合成

Yuci Han, Charles Toth, John E. Anderson, William J. Shuart, Alper Yilmaz

机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) USACE ERDC GRL(美国陆军工程兵队ERDC GRL)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 1 篇

2602.23152 2026-02-27 cs.AI 50%

The Trinity of Consistency as a Defining Principle for General World Models

一致性三元组作为一般世界模型的定义原则

Jingxuan Wei, Siyuan Li, Yuhang Xu, Zheng Sun, Junjie Jiang, Hexuan Jin, Caijun Jia, Honghao He, Xinglong Xu, Xi bai, Chang Yu, Yumou Liu, Junnan Zhu, Xuanhe Zhou, Jintao Chen, Xiaobin Hu, Shancheng Pang, Bihui Yu, Ran He, Zhen Lei, Stan Z. Li, Conghui He, Shuicheng Yan, Cheng Tan

专题命中 视频数据与评测 :video generation(abstract)

AI总结 本文提出一致性三元组作为定义通用世界模型的原则,通过系统回顾多模态学习的演变,引入CoW-Bench基准测试,明确未来发展方向。

Comments 119 pages, 50 figures

详情

展开后加载摘要…

URL PDF HTML 收藏