arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-26 至 2026-01-26 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2506.11777 2026-01-26 cs.CV cs.AI cs.CY cs.LG 57%

Self-supervised Learning of Echocardiographic Video Representations via Online Cluster Distillation

通过在线聚类蒸馏实现心电图视频的自监督学习

Divyanshu Mishra, Mohammadreza Salehi, Pramit Saha, Olga Patey, Aris T. Papageorghiou, Yuki M. Asano, J. Alison Noble

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学) Nuffield Department of Women’s and Reproductive Health, University of Oxford(妇女与生殖健康系,牛津大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 DISCOVR通过在线聚类蒸馏实现心脏超声视频的自监督学习,结合时序动态和细粒度空间语义,提升临床任务性能。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 50%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 视频理解 :video-language(abstract)

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2601.16914 2026-01-26 cs.CV cs.AI 79%

LoL: Longer than Longer, Scaling Video Generation to Hour

LoL: 长于更长,将视频生成扩展至小时级

Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, Cho-Jui Hsieh

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LoL提出一种无需训练的方法,通过多头RoPE抖动缓解视频生成中的sink-collapse问题,实现长时长、高质量的流式视频生成。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16982 2026-01-26 cs.CV cs.LG cs.RO 57%

AnyView: Synthesizing Any Novel View in Dynamic Scenes

AnyView: 动态场景中合成任意新视角

Basile Van Hoorick, Dian Chen, Shun Iwase, Pavel Tokmakov, Muhammad Zubair Irshad, Igor Vasiljevic, Swati Gupta, Fangzhou Cheng, Sergey Zakharov, Vitor Campagnolo Guizilini

机构 * Toyota Research Institute(丰田研究院) Amazon Web Services(亚马逊网络服务)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 AnyView通过动态视角合成框架实现任意视角生成,克服了传统方法在高度动态场景中的局限性,提出了新的基准测试并展示了优越的性能。

Comments Project webpage: https://tri-ml.github.io/AnyView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10072 2026-01-26 cs.CV 57%

ToonifyGB: StyleGAN-based Gaussian Blendshapes for 3D Stylized Head Avatars

ToonifyGB: 基于StyleGAN的高斯混合形状用于3D风格化头身人偶

Rui-Yang Ju, Sheng-Yen Huang, Yi-Ping Hung

机构 * Graduate Institute of Networking and Multimedia(网络与多媒体研究生院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 ToonifyGB通过改进的StyleGAN生成风格化视频并结合高斯混合形状,实现高效渲染多样化风格化的3D头身人偶。

Comments 2-Page Version Accepted as a Poster at IEEE VR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2512.10940 2026-01-26 cs.CV cs.AI 70%

OmniView: An All-Seeing Diffusion Model for 3D and 4D View Synthesis

OmniView: 一种用于3D和4D视图合成的全视角扩散模型

Xiang Fan, Sharath Girish, Vivek Ramanujan, Chaoyang Wang, Ashkan Mirzaei, Petr Sushko, Aliaksandr Siarohin, Sergey Tulyakov, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Snap Inc.(Snap公司)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 OmniView是一种统一的扩散模型,能够泛化多种4D一致性任务,通过空间、时间和视图条件的灵活组合提升视频生成质量与相机控制精度。

Comments Project page: https://snap-research.github.io/OmniView/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14172 2026-01-26 eess.IV 57%

TaQ-DiT: Time-aware Quantization for Diffusion Transformers

TaQ-DiT: 时感知量化用于扩散变换器

Xinyan Liu, Huihong Shi, Yang Xu, Zhongfeng Wang

专题命中 视频扩散模型 :video generation(abstract);分类 eess.IV

AI总结 TaQ-DiT通过引入时感知量化方法,解决扩散变换器中权重和激活的非收敛问题及不同层的量化敏感性差异,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏