arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-10-09 至 2025-10-09 共收录 12 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2510.06973 2025-10-09 cs.CV 85%

Addressing the ID-Matching Challenge in Long Video Captioning

Zhantao Yang, Huangji Wang, Ruili Feng, Han Zhang, Yuting Hu, Shangwen Zhu, Junyan Li, Yu Liu, Fan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba group(阿里巴巴集团)

专题命中 视频理解 :long video(title,abstract);video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20444 2025-10-09 cs.LG cs.CV 70%

HoPE: Hybrid of Position Embedding for Long Context Vision-Language Models

Haoran Li, Yingjie Qin, Baoyuan Ou, Lai Xu, Ruiwen Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Xiaohongshu Inc.(小红书公司)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16276 2025-10-09 cs.CV cs.AI 57%

Empowering LLMs with Pseudo-Untrimmed Videos for Audio-Visual Temporal Understanding

Yolo Yunlong Tang, Daiki Shimada, Jing Bi, Mingqian Feng, Hang Hua, Chenliang Xu

专题命中 视频理解 :video-language(abstract);分类 cs.CV

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24031 2025-10-09 cs.LG cs.AI cs.CV cs.MA 57%

GPS-MTM: Capturing Pattern of Normalcy in GPS-Trajectories with self-supervised learning

Umang Garg, Bowen Zhang, Anantajit Subrahmanya, Chandrakanth Gudavalli, BS Manjunath

机构 * ECE Department(电子工程系) University of California(加州大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 3 篇

2510.07313 2025-10-09 cs.CV cs.RO 57%

WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation

Zezhong Qian, Xiaowei Chi, Yuming Li, Shizun Wang, Zhiyuan Qin, Xiaozhu Ju, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国家大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06512 2025-10-09 cs.CV cs.AI 57%

LogSTOP: Temporal Scores over Prediction Sequences for Matching and Retrieval

Avishree Khare, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Rajeev Alur

机构 * seas.upenn.edu(宾夕法尼亚大学塞as学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07092 2025-10-09 cs.LG cs.AI cs.RO 50%

Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report

Riccardo Mereu, Aidan Scannell, Yuxin Hou, Yi Zhao, Aditya Jitta, Antonio Dominguez, Luigi Acerbi, Amos Storkey, Paul Chang

机构 * Aalto University(阿alto大学) University of Edinburgh(爱丁堡大学) Deep Render(Deep Render公司) DataCrunch(DataCrunch公司) University of Helsinki(赫尔辛基大学)

专题命中 视频生成 :video generation(abstract)

Comments 6 pages, 3 figures, 1X world model challenge technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2510.07190 2025-10-09 cs.CV 83%

MV-Performer: Taming Video Diffusion Model for Faithful and Synchronized Multi-view Performer Synthesis

Yihao Zhi, Chenghong Li, Hongjie Liao, Xihe Yang, Zhengwentai Sun, Jiahao Chang, Xiaodong Cun, Wensen Feng, Xiaoguang Han

机构 * Great Bay University(大亚湾大学) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来网络智能化重点实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments Accepted by SIGGRAPH Asia 2025 conference track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07344 2025-10-09 cs.CV cs.AI 57%

Generative Pre-trained Autoregressive Diffusion Transformer

Yuan Zhang, Jiacheng Jiang, Guoqing Ma, Zhiying Lu, Haoyang Huang, Jianlong Yuan, Nan Duan, Daxin Jiang

机构 * University of Science and Technology of China(中国科学技术大学) StepFun, China(StepFun)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2510.04022 2025-10-09 cs.CV 74%

Video-in-the-Loop: Span-Grounded Long Video QA with Interleaved Reasoning

Chendong Wang, Donglin Bai, Yifan Yang, Xiao Jin, Anlan Zhang, Rui Wang, Shiqi Jiang, Yuqing Yang, Hao Wu, Qi Dai, Chong Luo, Ting Cao, Lili Qiu, Suman Banerjee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Columbia University(哥伦比亚大学) University of Southern California(南加州大学) Fudan University(复旦大学)

专题命中 视频问答 :long video(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 2 篇

2510.06855 2025-10-09 cs.CV eess.IV 62%

Online Generic Event Boundary Detection

Hyungrok Jung, Daneul Kim, Seunggyun Lim, Jeany Son, Jonghyun Choi

机构 * GIST(韩国科学技术院) Seoul National University(首尔国立大学) POSTECH

专题命中 动作与事件理解 :video understanding(abstract);分类 cs.CV、eess.IV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19972 2025-10-09 cs.CV 57%

PHI: Bridging Domain Shift in Long-Term Action Quality Assessment via Progressive Hierarchical Instruction

Kanglei Zhou, Hubert P. H. Shum, Frederick W. B. Li, Xingxing Zhang, Xiaohui Liang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学) Department of Computer Science, Durham University(杜伦大学计算机科学系) Department of Computer Science and Technology, Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University(人工智能研究院,北京人工智能研究院,清华大学-博世联合机器学习中心,THBI实验室,清华大学计算机科学与技术系) Zhongguancun Laboratory, Beijing(中关村实验室,北京)

专题命中 动作与事件理解 :long video(abstract);分类 cs.CV

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏