arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2160 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2160 篇

2510.19527 2025-10-23 cs.CV 57%

PoseCrafter: Extreme Pose Estimation with Hybrid Video Synthesis

Qing Mao, Tianxin Huang, Yu Zhu, Jinqiu Sun, Yanning Zhang, Gim Hee Lee

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院) School of Astronautics, Northwestern Polytechnical University(西北工业大学航天学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07670 2025-10-17 cs.CV cs.AI 57%

Ctrl-VI: Controllable Video Synthesis via Variational Inference

Haoyi Duan, Yunzhi Zhang, Yilun Du, Jiajun Wu

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://video-synthesis-variational.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14648 2025-10-17 cs.CV cs.AI 57%

In-Context Learning with Unpaired Clips for Instruction-based Video Editing

Xinyao Liao, Xianfang Zeng, Ziye Song, Zhoujie Fu, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10623 2025-10-17 cs.LG cs.CV 57%

Flows and Diffusions on the Neural Manifold

Daniel Saragih, Deyu Cao, Tejas Balaji

机构 * Queen’s University and Vector Institute(女王大学和向量研究所) University of Tokyo(东京大学) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 43 pages, 11 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13652 2025-10-16 cs.CV 57%

EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection

Huaizhi Qu, Ruichen Zhang, Shuqing Luo, Luchao Qi, Zhihao Zhang, Xiaoming Liu, Roni Sengupta, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Michigan State University(密歇根州立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12283 2025-10-15 cs.CV 57%

Dual Learning with Dynamic Knowledge Distillation and Soft Alignment for Partially Relevant Video Retrieval

Jianfeng Dong, Lei Huang, Daizong Liu, Xianke Chen, Xun Yang, Changting Lin, Xun Wang, Meng Wang

机构 * College of Computer and Information Engineering, Zhejiang Gongshang University(浙江工商大学计算机与信息工程学院) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Binjiang Institute of Zhejiang University(浙江大学滨江学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12231 2025-10-15 cs.CV 57%

BIGFix: Bidirectional Image Generation with Token Fixing

Victor Besnier, David Hurych, Andrei Bursuc, Eduardo Valle

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08789 2025-10-14 cs.CV 57%

Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization

Shuo Xing, Soumik Dey, Mingyang Wu, Ashirbad Mishra, Naveen Ravipati, Binbin Li, Hansi Wu, Zhengzhong Tu

机构 * Department of Computer Science(计算机科学系) Cranberry-Lemon University(Cranberry-Lemon 大学) Texas A&M University(德克萨斯A&M大学) eBay Inc.(eBay公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08561 2025-10-14 cs.CV 57%

MultiCOIN: Multi-Modal COntrollable Video INbetweening

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

机构 * Simon Fraser University(西蒙弗雷泽大学) Adobe Research(Adobe研究院)

专题命中 视频生成 :long video(abstract);分类 cs.CV

Comments Project website: https://multicoinx.github.io/multicoin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08799 2025-10-13 cs.CV cs.AI cs.LG 57%

SkipSR: Faster Super Resolution with Token Skipping

Rohan Choudhury, Shanchuan Lin, Jianyi Wang, Hao Chen, Qi Zhao, Feng Cheng, Lu Jiang, Kris Kitani, Laszlo A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08568 2025-10-10 cs.RO cs.AI cs.CV 57%

NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos

Hongyu Li, Lingfeng Sun, Yafei Hu, Duy Ta, Jennifer Barry, George Konidaris, Jiahui Fu

机构 * Robotics and AI Institute(机器人与人工智能研究所) Brown University(布朗大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07313 2025-10-09 cs.CV cs.RO 57%

WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation

Zezhong Qian, Xiaowei Chi, Yuming Li, Shizun Wang, Zhiyuan Qin, Xiaozhu Ju, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国家大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06512 2025-10-09 cs.CV cs.AI 57%

LogSTOP: Temporal Scores over Prediction Sequences for Matching and Retrieval

Avishree Khare, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Rajeev Alur

机构 * seas.upenn.edu(宾夕法尼亚大学塞as学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10575 2025-10-07 cs.CV 57%

A Survey of Defenses Against AI-Generated Visual Media: Detection,Disruption, and Authentication

Jingyi Deng, Chenhao Lin, Zhengyu Zhao, Shuai Liu, Zhe Peng, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) Interdisciplinary Research Center of Frontier science and technology, Xi'an Jiaotong University(西安交通大学前沿科学与技术交叉研究中心) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Department of Industrial and Systems Engineering, Hong Kong Polytechnic University(香港理工大学工业与系统工程系) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04390 2025-10-07 cs.CV cs.AI cs.CL 57%

MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator

Xuehai He, Shijie Zhou, Thivyanth Venkateswaran, Kaizhi Zheng, Ziyu Wan, Achuta Kadambi, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Los Angeles(加州大学洛杉矶分校) IIT Bombay(印度理工学院班加罗尔) Microsoft(微软公司)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18406 2025-10-06 cs.CV cs.AI cs.CL 57%

RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives

Jaehong Yoon, Shoubin Yu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments EMNLP 2025 main; The first two authors contribute equally. Project Page: https://raccoon-mllm-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10540 2025-10-03 cs.MA cs.CV 57%

AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation

Haoyuan Shi, Yunxin Li, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Alibaba International Digital Commerce, Hangzhou(阿里巴巴国际数字商业)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02259 2025-10-03 cs.CV cs.AI 57%

VideoGen-of-Thought: Step-by-step generating multi-shot video with minimal manual intervention

Mingzhe Zheng, Yongqi Xu, Haojian Huang, Xuran Ma, Yexin Liu, Wenjie Shu, Yatian Pang, Feilong Tang, Qifeng Chen, Harry Yang, Ser-Nam Lim

机构 * Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) University of Hong Kong(香港大学) NUS(南洋理工大学) University of Central Florida(佛罗里达大学) Everlyn AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Code: https://github.com/DuNGEOnmassster/VideoGen-of-Thought.git; Webpage: https://cheliosoops.github.io/VGoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10958 2025-10-02 cs.LG cs.AI cs.CV cs.NE cs.PF 57%

SageAttention2: Efficient Attention with Thorough Outlier Smoothing and Per-thread INT4 Quantization

Jintao Zhang, Haofeng Huang, Pengle Zhang, Jia Wei, Jun Zhu, Jianfei Chen

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Institute for Interdisciplinary Information Sciences, Tsinghua University(交叉信息学院,清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments @inproceedings{zhang2024sageattention2, title={Sageattention2: Efficient attention with thorough outlier smoothing and per-thread int4 quantization}, author={Zhang, Jintao and Huang, Haofeng and Zhang, Pengle and Wei, Jia and Zhu, Jun and Chen, Jianfei}, booktitle={International Conference on Machine Learning (ICML)}, year={2025} }

Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267, 2025 (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14685 2025-10-02 cs.CV 57%

DACoN: DINO for Anime Paint Bucket Colorization with Any Number of Reference Images

Kazuma Nagata, Naoshi Kaneko

机构 * Tokyo Denki University(东京电讯大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted to ICCV 2025. v2: Added results on the subset used by the baseline for consistency; full test set results are also reported (Tables 1 and 2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24652 2025-09-30 cs.CV 57%

Learning Object-Centric Representations Based on Slots in Real World Scenarios

Adil Kaan Akan

机构 * Computer Science and Engineering(计算机科学与工程)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments PhD Thesis, overlap with arXiv:2507.20855 and arXiv:2501.15878

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23169 2025-09-30 cs.CV 57%

Sparse2Dense: A Keypoint-driven Generative Framework for Human Video Compression and Vertex Prediction

Bolin Chen, Ru-Ling Liao, Yan Ye, Jie Chen, Shanzhi Yin, Xinrui Ju, Shiqi Wang, Yibo Fan

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(华潘实验室) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22432 2025-09-29 cs.CV 57%

Shape-for-Motion: Precise and Consistent Video Editing with 3D Proxy

Yuhao Liu, Tengfei Wang, Fang Liu, Zhenwei Wang, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments Accepted by Siggraph Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02045 2025-09-26 cs.GR cs.CV 57%

Generating 360° Video is What You Need For a 3D Scene

Zhaoyang Zhang, Yannick Hold-Geoffroy, Miloš Hašan, Ziwen Chen, Fujun Luan, Julie Dorsey, Yiwei Hu

机构 * Yale University(耶鲁大学) Adobe Research(Adobe研究) Oregon State University(俄勒冈州立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments SIGGRAPH Asia 2025. Project Page: https://zhaoyangzh.github.io/projects/worldprompter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09595 2025-09-18 cs.CV 57%

Kling-Avatar: Grounding Multimodal Instructions for Cascaded Long-Duration Avatar Animation Synthesis

Yikang Ding, Jiwen Liu, Wenyuan Zhang, Zekun Wang, Wentao Hu, Liyuan Cui, Mingming Lao, Yingchao Shao, Hui Liu, Xiaohan Li, Ming Chen, Xiaoqiang Liu, Yu-Shen Liu, Pengfei Wan

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Technical Report. Project Page: https://klingavatar.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09632 2025-09-09 cs.CV cs.AI 57%

Preacher: Paper-to-Video Agentic System

Jingwei Liu, Ling Yang, Hao Luo, Fan Wang, Hongyan Li, Mengdi Wang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) DAMO Academy, Alibaba group(阿里巴巴集团大模型研究院) Hupan Lab(虎扑实验室) National Key Laboratory of General Artificial Intelligence, Peking University(北京人工智能 general artificial intelligence 国家重点实验室) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2025. Code: https://github.com/Gen-Verse/Paper2Video

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01028 2025-09-04 cs.CV 57%

CompSlider: Compositional Slider for Disentangled Multiple-Attribute Image Generation

Zixin Zhu, Kevin Duarte, Mamshad Nayeem Rizve, Chengyuan Xu, Ratheesh Kalarot, Junsong Yuan

机构 * University at Buffalo(布法罗大学) Adobe Inc. (ASML)(Adobe公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12278 2025-09-04 cs.CV 57%

Towards a Universal Synthetic Video Detector: From Face or Background Manipulations to Fully AI-Generated Content

Rohit Kundu, Hao Xiong, Vishal Mohanty, Athula Balachandran, Amit K. Roy-Chowdhury

机构 * Google, Mountain View, USA(谷歌(Mountain View, USA)) University of California, Riverside(加州大学河滨分校)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01232 2025-09-03 cs.CV 57%

FantasyHSI: Video-Generation-Centric 4D Human Synthesis In Any Scene through A Graph-based Multi-Agent Framework

Lingzhou Mu, Qiang Wang, Fan Jiang, Mengchao Wang, Yaqi Fan, Mu Xu, Kai Zhang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments https://fantasy-amap.github.io/fantasy-hsi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00403 2025-09-03 cs.CV 57%

DevilSight: Augmenting Monocular Human Avatar Reconstruction through a Virtual Perspective

Yushuo Chen, Ruizhi Shao, Youxin Pang, Hongwen Zhang, Xinyi Wu, Rihui Wu, Yebin Liu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Honor Device Co., Ltd(荣誉设备有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏