arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-07-24 至 2025-07-24 共收录 8 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2507.09068 2025-07-24 cs.CV cs.AI cs.IR cs.LG cs.MM 84%

Infinite Video Understanding

Dell Zhang, Xiangyu Chen, Jixiang Luo, Mengxi Jia, Changzhi Sun, Ruilong Ren, Jingren Liu, Hao Sun, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Peking University(北京大学) Tianjin University(天津大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02591 2025-07-24 cs.CV 83%

AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding

Weili Xu, Enxin Song, Wenhao Chai, Xuexiang Wen, Tian Ye, Gaoang Wang

机构 * Zhejiang University(浙江大学) University of Washington(华盛顿大学) HKUST (GZ)(香港科技大学(广州)) Zhejiang University / Shanghai AI Lab(浙江大学/上海人工智能实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17050 2025-07-24 cs.CV 57%

Toward Scalable Video Narration: A Training-free Approach Using Multimodal Large Language Models

Tz-Ying Wu, Tahani Trigui, Sharath Nittur Sridhar, Anand Bodas, Subarna Tripathi

机构 * Intel(英特尔)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVAM Workshop at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2507.17388 2025-07-24 cs.CV eess.IV 81%

EndoGen: Conditional Autoregressive Endoscopic Video Generation

Xinyu Liu, Hengyu Liu, Cheng Wang, Tianming Liu, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) University of Georgia(佐治亚大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、eess.IV

Comments MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19664 2025-07-24 cs.RO cs.LG 50%

Towards Generalist Robot Learning from Internet Video: A Survey

Robert McCarthy, Daniel C. H. Tan, Dominik Schmidt, Fernando Acero, Nathan Herr, Yilun Du, Thomas G. Thuruthel, Zhibin Li

机构 * University College London(伦敦大学学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视频生成 :video generation(abstract)

Journal ref Journal of Artificial Intelligence Research, Vol.83, Article 12. Publication date: July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2507.17744 2025-07-24 cs.CV cs.AI cs.HC 70%

Yume: An Interactive World Generation Model

Xiaofeng Mao, Shaoheng Lin, Zhen Li, Chuanhao Li, Wenshuo Peng, Tong He, Jiangmiao Pang, Mingmin Chi, Yu Qiao, Kaipeng Zhang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频数据与评测 2 篇

2411.16619 2025-07-24 cs.CV 70%

Human-Activity AGV Quality Assessment: A Benchmark Dataset and an Objective Evaluation Metric

Zhichao Zhang, Wei Sun, Xinyue Li, Yunhao Li, Qihang Ge, Jun Jia, Zicheng Zhang, Zhongpeng Ji, Fengyu Sun, Shangling Jui, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16878 2025-07-24 cs.CV cs.AI 57%

CausalStep: A Benchmark for Explicit Stepwise Causal Reasoning in Videos

Xuchen Li, Xuzhao Li, Shiyu Hu, Kaiqi Huang, Wentao Zhang

专题命中 视频数据与评测 :video reasoning(abstract);分类 cs.CV

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏