arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-28 至 2025-10-28 共收录 2 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 2 篇

2501.07227 2025-10-28 cs.CV 83%

MECD+: Unlocking Event-Level Causal Graph Discovery for Video Reasoning

Tieyuan Chen, Huabin Liu, Yi Wang, Yihang Chen, Tianyao He, Chaofan Gan, Huanyu He, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学) Zhongguancun Academy(中关村academy) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 动作与事件理解 :video reasoning(title);video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by IEEE TPAMI (IEEE Transactions on Pattern Analysis and Machine Intelligence). arXiv admin note: substantial text overlap with arXiv:2409.17647

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22810 2025-10-28 cs.CV 70%

MAGIC-Talk: Motion-aware Audio-Driven Talking Face Generation with Customizable Identity Control

Fatemeh Nazarieh, Zhenhua Feng, Diptesh Kanojia, Muhammad Awais, Josef Kittler

机构 * School of Computer Science and Electronic Engineering, University of Surrey(Surrey大学计算机科学与电子工程学院) School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音和信号处理中心)

专题命中 动作与事件理解 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏