arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-26 至 2026-01-26 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2506.11777 2026-01-26 cs.CV cs.AI cs.CY cs.LG 57%

Self-supervised Learning of Echocardiographic Video Representations via Online Cluster Distillation

通过在线聚类蒸馏实现心电图视频的自监督学习

Divyanshu Mishra, Mohammadreza Salehi, Pramit Saha, Olga Patey, Aris T. Papageorghiou, Yuki M. Asano, J. Alison Noble

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学) Nuffield Department of Women’s and Reproductive Health, University of Oxford(妇女与生殖健康系,牛津大学) Fundamental AI Lab, University of Technology Nuremberg(基础人工智能实验室,纽伦堡技术大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 DISCOVR通过在线聚类蒸馏实现心脏超声视频的自监督学习,结合时序动态和细粒度空间语义,提升临床任务性能。

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16231 2026-01-26 cs.SD cs.AI cs.CL cs.LG eess.AS 50%

SoundBreak: A Systematic Study of Audio-Only Adversarial Attacks on Trimodal Models

SoundBreak: 对三模态模型上仅音频对抗攻击的系统研究

Aafiya Hussain, Gaurav Srivastava, Alvi Ishmam, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science, Virginia Tech, USA(计算机科学系,弗吉尼亚理工大学)

专题命中 视频理解 :video-language(abstract)

AI总结 SoundBreak研究了对三模态模型的仅音频对抗攻击,发现音频扰动可导致严重多模态失败,攻击成功率高达96%,并揭示了多模态系统中被忽视的单模态攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏