arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-09-30 至 2025-09-30 共收录 31 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 4 篇

2509.24786 2025-09-30 cs.CV 89%

LOVE-R1: Advancing Long Video Understanding with an Adaptive Zoom-in Mechanism via Multi-Step Reasoning

Shenghao Fu, Qize Yang, Yuan-Ming Li, Xihan Wei, Xiaohua Xie, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Tongyi Lab, Alibaba Group(阿里巴巴集团 Tongyi 实验室) Peng Cheng Laboratory, China(鹏城实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室) Guangdong Province Key Laboratory of Information Security Technology, China(广东省信息安全技术重点实验室) Pazhou Laboratory (Huangpu), China(琶洲实验室(黄埔))

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12083 2025-09-30 cs.CV 83%

Self-alignment of Large Video Language Models with Refined Regularized Preference Optimization

Pritam Sarkar, Ali Etemad

机构 * Queen’s University(女王大学) Vector Institute(向量研究所)

专题命中 视频理解 :video language model(title,abstract);video understanding(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23672 2025-09-30 cs.CV 79%

Token Merging via Spatiotemporal Information Mining for Surgical Video Understanding

Xixi Jiang, Chen Yang, Dong Zhang, Pingcheng Dong, Xin Yang, Kwang-Ting Cheng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) School of Electronic Information and Communications, Huazhong University of Science and Technology(电子信息与通信学院,华中科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24109 2025-09-30 cs.CV 70%

SVAC: Scaling Is All You Need For Referring Video Object Segmentation

Li Zhang, Haoxiang Gao, Zhihao Zhang, Luoxiao Huang, Tao Zhang

机构 * Columbia University New York, USA(哥伦比亚大学) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学) New York University New York, USA(纽约大学) Wuhan University Wuhan, China(武汉大学)

专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments This paper is accepted to BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 8 篇

2509.25182 2025-09-30 cs.CV cs.AI 83%

DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder

Junyu Chen, Wenkun He, Yuchao Gu, Yuyang Zhao, Jincheng Yu, Junsong Chen, Dongyun Zou, Yujun Lin, Zhekai Zhang, Muyang Li, Haocheng Xi, Ligeng Zhu, Enze Xie, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Tech Report. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10774 2025-09-30 cs.CV cs.AI cs.LG 83%

BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation

Youping Gu, Xiaolong Li, Yuhao Hu, Minqi Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Central Media Technology Institute, Huawei Technologies(华为技术有限公司中央媒体技术研究所)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24241 2025-09-30 cs.CV cs.RO 79%

FreeAction: Training-Free Techniques for Enhanced Fidelity of Trajectory-to-Video Generation

Seungwook Kim, Seunghyeon Lee, Minsu Cho

机构 * POSTECH Ewha Womans University(成均馆大学) RLWRLD

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 8 pages, 4 figures, accepted to CoRL 2025 LSRW workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24081 2025-09-30 cs.CV 79%

Autoregressive Video Generation beyond Next Frames Prediction

Sucheng Ren, Chen Chen, Zhenbang Wang, Liangchen Song, Xiangxin Zhu, Alan Yuille, Yinfei Yang, Jiasen Lu

机构 * Johns Hopkins University(约翰霍普金斯大学) Apple(苹果公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10678 2025-09-30 cs.GR 78%

T2Bs: Text-to-Character Blendshapes via Video Generation

Jiahao Luo, Chaoyang Wang, Michael Vasilkovsky, Vladislav Shakhrai, Di Liu, Peiye Zhuang, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee, James Davis, Jian Wang

专题命中 视频生成 :video generation(title);video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24427 2025-09-30 cs.CV 74%

UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark

Ailing Zhang, Lina Lei, Dehong Kong, Zhixin Wang, Jiaqi Xu, Fenglong Song, Chun-Le Guo, Chang Liu, Fan Li, Jie Chen

机构 * Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Nankai University(南开大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24652 2025-09-30 cs.CV 57%

Learning Object-Centric Representations Based on Slots in Real World Scenarios

Adil Kaan Akan

机构 * Computer Science and Engineering(计算机科学与工程)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments PhD Thesis, overlap with arXiv:2507.20855 and arXiv:2501.15878

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23169 2025-09-30 cs.CV 57%

Sparse2Dense: A Keypoint-driven Generative Framework for Human Video Compression and Vertex Prediction

Bolin Chen, Ru-Ling Liao, Yan Ye, Jie Chen, Shanzhi Yin, Xinrui Ju, Shiqi Wang, Yibo Fan

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(华潘实验室) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 11 篇

2505.17550 2025-09-30 cs.CV 86%

T2VUnlearning: A Concept Erasing Method for Text-to-Video Diffusion Models

Xiaoyu Ye, Songjie Cheng, Yongtao Wang, Yajiao Xiong, Yishen Li

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24997 2025-09-30 cs.CV 83%

PanoWorld-X: Generating Explorable Panoramic Worlds via Sphere-Aware Video Diffusion

Yuyang Yin, HaoXiang Guo, Fangfu Liu, Mengyu Wang, Hanwen Liang, Eric Li, Yikai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei

机构 * Beijing Jiaotong University(北京交通大学) Skywork AI Tsinghua University(清华大学) University of Toronto(多伦多大学) Beijing Normal University(北京师范大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

Comments Project page: \url{https://yuyangyin.github.io/PanoWorld-X/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21839 2025-09-30 cs.CV cs.AI 83%

DiTraj: training-free trajectory control for video diffusion transformer

Cheng Lei, Jiayu Zhang, Yue Ma, Xinyu Wang, Long Chen, Liang Tang, Yiqiang Yan, Fei Su, Zhicheng Zhao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Lenovo(联想) HKUST(香港科技大学) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24353 2025-09-30 cs.CV 70%

NeRV-Diffusion: Diffuse Implicit Neural Representations for Video Synthesis

Yixuan Ren, Hanyu Wang, Hao Chen, Bo He, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院 park)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project Page: https://nerv-diffusion.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24416 2025-09-30 cs.CV cs.AI 57%

CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers

Kai Liu, Shaoqiu Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures. Code is released at https://github.com/Kai-Liu001/CLQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06040 2025-09-30 cs.CV cs.AI cs.LG 57%

BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models

Yuming Li, Yikai Wang, Yuying Zhu, Zhongyu Zhao, Ming Lu, Qi She, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19838 2025-09-30 cs.CV 57%

SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution

Liangbin Xie, Yu Li, Shian Du, Menghan Xia, Xintao Wang, Fanghua Yu, Ziyan Chen, Pengfei Wan, Jiantao Zhou, Chao Dong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学物联网智能城市国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Tsinghua University(清华大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12053 2025-09-30 cs.CV cs.AI 57%

VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption

Tianxiong Zhong, Xingye Tian, Boyuan Jiang, Xuebo Wang, Xin Tao, Pengfei Wan, Zhiwei Zhang

机构 * Beijing Institute of Technology(北京理工大学) Kling Team(Kling团队)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00639 2025-09-30 cs.CV cs.AI cs.LG stat.ML 57%

Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer

Tao Ren, Zishi Zhang, Jingyang Jiang, Zehao Li, Shentao Qin, Yi Zheng, Guanghao Li, Qianyou Sun, Yan Li, Jiafeng Liang, Xinping Li, Yijie Peng

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00796 2025-09-30 cs.LG cs.AI cs.CV 57%

Diffusion Models: A Comprehensive Survey of Methods and Applications

Ling Yang, Zhilong Zhang, Yang Song, Shenda Hong, Runsheng Xu, Yue Zhao, Wentao Zhang, Bin Cui, Ming-Hsuan Yang

机构 * Peking University(北京大学) OpenAI University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) University of California at Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 59 pages, 19 figures, citing 396 (up-to-date) papers, project: https://github.com/YangLing0818/Diffusion-Models-Papers-Survey-Taxonomy, accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22199 2025-09-30 cs.RO cs.AI 50%

MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training

Haoyun Li, Ivan Zhang, Runqi Ouyang, Xiaofeng Wang, Zheng Zhu, Zhiqin Yang, Zhentao Zhang, Boyuan Wang, Chaojun Ni, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhenbo Song, Xingang Wang

机构 * GigaAI CASIA NJUST(南京工业大学) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长视频与时序推理 5 篇

2509.25161 2025-09-30 cs.CV 88%

Rolling Forcing: Autoregressive Long Video Diffusion in Real Time

Kunhao Liu, Wenbo Hu, Jiale Xu, Ying Shan, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 长视频与时序推理 :long video(title,abstract);video diffusion(title);video generation(abstract);分类 cs.CV

Comments Project page: https://kunhao-liu.github.io/Rolling_Forcing_Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02850 2025-09-30 cs.CV 86%

METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding

Mengyue Wang, Shuo Chen, Kristian Kersting, Volker Tresp, Yunpu Ma

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(title);分类 cs.CV

Comments EMNLP 2025; 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24943 2025-09-30 cs.CV 83%

Perceive, Reflect and Understand Long Video: Progressive Multi-Granular Clue Exploration with Interactive Agents

Jiahua Li, Kun Wei, Zhe Xu, Zibo Su, Xu Yang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港理工大学计算机科学与工程系) College of Computer and Information, Hohai University(河海大学计算机与信息学院)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24871 2025-09-30 cs.CV 79%

StreamForest: Efficient Online Video Understanding with Persistent Event Memory

Xiangyu Zeng, Kefan Qiu, Qingyu Zhang, Xinhao Li, Jing Wang, Jiaxin Li, Ziang Yan, Kun Tian, Meng Tian, Xinhai Zhao, Yi Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Tech.(云网智能科技)

专题命中 长视频与时序推理 :video understanding(title,abstract);分类 cs.CV

Comments Accepted as a Spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25183 2025-09-30 cs.CV 57%

PAD3R: Pose-Aware Dynamic 3D Reconstruction from Casual Videos

Ting-Hsuan Liao, Haowen Liu, Yiran Xu, Songwei Ge, Gengshan Yang, Jia-Bin Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Comments SIGGRAPH Asia 2025. Project page:https://pad3r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 3 篇

2503.19951 2025-09-30 cs.CV cs.AI 79%

Audio-centric Video Understanding Benchmark without Text Shortcut

Yudong Yang, Jimin Zhuang, Guangzhi Sun, Changli Tang, Yixuan Li, Peihan Li, Yifan Jiang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) ByteDance(字节跳动)

专题命中 视频数据与评测 :video understanding(title,abstract);分类 cs.CV

Comments Accepted for publication in the Proceedings of EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22799 2025-09-30 cs.CV cs.AI cs.CL 70%

VideoScore2: Think before You Score in Generative Video Evaluation

Xuan He, Dongfu Jiang, Ping Nie, Minghao Liu, Zhengxuan Jiang, Mingyi Su, Wentao Ma, Junru Lin, Chun Ye, Yi Lu, Keming Wu, Benjamin Schneider, Quy Duc Do, Zhuofeng Li, Yiming Jia, Yuxuan Zhang, Guo Cheng, Haozhe Wang, Wangchunshu Zhou, Qunshu Lin, Yuanxing Zhang, Ge Zhang, Wenhao Huang, Wenhu Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Waterloo(滑铁卢大学) Independent(独立) M-A-P University of Toronto(多伦多大学) Zhejiang University(浙江大学) Abaka AI

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏