arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-08-19 至 2025-08-19 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2507.09693 2025-08-19 cs.CV 57%

ExpStar: Towards Automatic Commentary Generation for Multi-discipline Scientific Experiments

Jiali Chen, Yujie Jia, Zihan Wu, Jinyu Yang, Jianpeng Chen, Xusen Hei, Jiayuan Xie, Yi Cai, Qing Li

机构 * South China University of Technology(南方科技大学) The Hong Kong Polytechnic University(香港理工大学) Key Laboratory of Big Data and Intelligent Robot Ministry of Education(教育部大数据与智能机器人重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2508.12969 2025-08-19 cs.CV 83%

Compact Attention: Exploiting Structured Spatio-Temporal Sparsity for Fast Video Generation

Qirui Li, Guangcong Zheng, Qi Zhao, Jie Li, Bin Dong, Yiwu Yao, Xi Li

机构 * College of Computer Science & Technology, Zhejiang University(计算机科学与技术学院,浙江大学) Huawei Technologies(华为技术)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13104 2025-08-19 cs.CV cs.RO 79%

Precise Action-to-Video Generation Through Visual Action Prompts

Yuang Wang, Chao Wen, Haoyu Guo, Sida Peng, Minghan Qin, Hujun Bao, Xiaowei Zhou, Ruizhen Hu

机构 * Xiangjiang Lab(湘江实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen University(深圳大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Project page: https://zju3dv.github.io/VAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13013 2025-08-19 cs.CV 57%

EgoTwin: Dreaming Body and View in First Person

Jingqiao Xiu, Fangzhou Hong, Yicong Li, Mengze Li, Wentao Wang, Sirui Han, Liang Pan, Ziwei Liu

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2508.13154 2025-08-19 cs.CV 57%

4DNeX: Feed-Forward 4D Generative Modeling Made Easy

Zhaoxi Chen, Tianqi Liu, Long Zhuo, Jiawei Ren, Zeng Tao, He Zhu, Fangzhou Hong, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://4dnex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10905 2025-08-19 cs.CV cs.HC 57%

InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation

Yukang Lin, Yan Hong, Zunnan Xu, Xindi Li, Chao Xu, Chuanbiao Song, Ronghui Li, Haoxing Chen, Jun Lan, Huijia Zhu, Weiqiang Wang, Jianfu Zhang, Xiu Li

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accept to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2507.14784 2025-08-19 cs.CV cs.AI 57%

LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering

Xinxin Dong, Baoyun Peng, Haokai Ma, Yufei Wang, Zixuan Dong, Fei Hu, Xiaodong Wang

专题命中 视频问答 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17069 2025-08-19 cs.CV cs.AI 57%

PVChat: Personalized Video Chat with One-Shot Learning

Yufei Shi, Weilong Yan, Gang Xu, Yumeng Li, Yucheng Chen, Zhenxi Li, Fei Richard Yu, Ming Li, Si Yong Yeo

机构 * MedVisAI Lab(MedVisAI实验室) National University of Singapore(新加坡国立大学) Nankai University(南开大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳)) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科谦医学院)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 1 篇

2508.07330 2025-08-19 cs.CV 57%

Planner-Refiner: Dynamic Space-Time Refinement for Vision-Language Alignment in Videos

Tuyen Tran, Thao Minh Le, Quang-Hung Le, Truyen Tran

机构 * Applied Artificial Intelligence Institute, Deakin University, Australia(应用人工智能研究所,德金大学,澳大利亚)

专题命中 长视频与时序推理 :video-language(abstract);分类 cs.CV

Comments Accepted for publication at ECAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2503.16867 2025-08-19 cs.CV 79%

ETVA: Evaluation of Text-to-Video Alignment via Fine-grained Question Generation and Answering

Kaisi Guan, Zhengfeng Lai, Yuchong Sun, Peng Zhang, Wei Liu, Kieran Liu, Meng Cao, Ruihua Song

机构 * Renmin University of China(中国人民大学) Apple(苹果公司)

专题命中 视频数据与评测 :text-to-video(title,abstract);分类 cs.CV

Comments International Conference on Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏