arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-25 至 2025-11-25 共收录 35 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2510.27280 2025-11-25 cs.CV cs.AI cs.LG 88%

FOCUS: Efficient Keyframe Selection for Long Video Understanding

FOCUS: 长视频理解中的高效关键帧选择

Zirui Zhu, Hailun Xu, Yang Luo, Yong Liu, Kanchan Sarkar, Zhenheng Yang, Yang You

机构 * National University of Singapore(新加坡国立大学) TikTok

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 FOCUS通过两阶段探索-利用策略,在严格标记预算下高效选择关键帧,提升长视频理解的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13589 2025-11-25 cs.CV 88%

AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding

AdaVideoRAG:多情境自适应检索增强高效长视频理解

Zhucun Xue, Jiangning Zhang, Xurong Xie, Yuxuan Cai, Yong Liu, Xiangtai Li, Dacheng Tao

机构 * Zhejiang University(浙江大学) Youtu Lab, Tencent(腾讯优图实验室) Huazhong University of Science and Technolog(华中科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 AdaVideoRAG通过自适应检索增强框架提升长视频理解效率与准确性,支持多层级知识检索与深度语义分析。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18831 2025-11-25 cs.CV 79%

VideoCompressa: Data-Efficient Video Understanding via Joint Temporal Compression and Spatial Reconstruction

VideoCompressa: 通过联合时间压缩和空间重建实现数据高效的视频理解

Shaobo Wang, Tianle Niu, Runkang Yang, Deshan Liu, Xu He, Zichen Wen, Conghui He, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) KTH(瑞典皇家理工学院) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 VideoCompressa通过联合时间压缩和空间重建,实现视频数据高效合成,显著提升数据效率和模型性能。

Comments 15 pages, 6 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17943 2025-11-25 cs.CV 79%

SciEducator: Scientific Video Understanding and Educating via Deming-Cycle Multi-Agent System

SciEducator: 基于Deming循环多智能体系统的科学视频理解与教育

Zhiyu Xu, Weilong Yan, Yufei Shi, Xin Meng, Tao He, Huiping Zhuang, Ming Li, Hehe Fan

机构 * Jinan University(济南大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Guangming Laboratory(光明实验室) Zhejiang University(浙江大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 SciEducator通过Deming循环多智能体系统实现科学视频的自演化理解与教育,生成多模态教学内容并超越现有大语言模型和视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21783 2025-11-25 cs.CV 57%

Prompt-guided Disentangled Representation for Action Recognition

基于提示的解耦表示用于动作识别

Tianci Wu, Guangming Zhu, Jiang Lu, Siyuan Wang, Ning Wang, Nuoye Xiong, Zhang Liang

机构 * School of Computer Science and Technology, Xidian University(电子科技大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出ProDA框架,通过动态提示模块和空间时间场景图实现动作解耦,提升多动作场景下的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 12 篇

2511.18991 2025-11-25 cs.CV 85%

View-Consistent Diffusion Representations for 3D-Consistent Video Generation

用于3D一致视频生成的视图一致扩散表示

Duolikun Danier, Ge Gao, Steven McDonagh, Changjian Li, Hakan Bilen, Oisin Mac Aodha

机构 * University of Edinburgh(爱丁堡大学) University of Bristol(布里斯托大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 ViCoDR通过学习多视图一致的扩散表示,提升视频生成的3D一致性,适用于图像到视频、文本到视频和多视图生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 83%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17986 2025-11-25 cs.CV cs.AI 83%

Plan-X: Instruct Video Generation via Semantic Planning

Plan-X: 通过语义规划指导视频生成

Lun Huang, You Xie, Hongyi Xu, Tianpei Gu, Chenxu Zhang, Guoxian Song, Zenan Li, Xiaochen Zhao, Linjie Luo, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) ByteDance Intelligent Creation(字节跳动智能创作) Apple(苹果公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Plan-X通过语义规划框架减少视频生成中的视觉幻觉,实现与多模态上下文一致的精细指令对齐生成。

Comments The project page is at https://byteaigc.github.io/Plan-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12953 2025-11-25 cs.CV 83%

Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction

基于帧级条件的微调扩散模型用于文本到视频预测

Zheyuan Liu, Junyan Wang, Zicheng Duan, Cristian Rodriguez-Opazo, Anton van den Hengel

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出帧级条件适应方法,通过引入帧级文本嵌入提升文本到视频预测的连续性与生成质量。

Comments Accepted by TMLR, 11/2025. 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19049 2025-11-25 cs.CV 79%

Beyond Reward Margin: Rethinking and Resolving Likelihood Displacement in Diffusion Models via Video Generation

超越奖励边际:通过视频生成重新思考和解决扩散模型中的似然位移

Ruojun Xu, Yu Kai, Xuhua Ren, Jiaxiang Cheng, Bing Ma, Tianxiang Zheng, Qinhlin Lu

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PG-DPO方法,通过结合ARS和IPR缓解扩散模型中的似然位移问题,提升视频生成任务的偏好对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18684 2025-11-25 cs.CV 79%

Now You See It, Now You Don't - Instant Concept Erasure for Safe Text-to-Image and Video Generation

现在你看见它,现在你又看不见 - 用于安全文本到图像和视频生成的即时概念消除

Shristi Das Biswas, Arani Roy, Kaushik Roy

机构 * Purdue University(普渡大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 ICE通过无需训练的一次性权重修改方法,实现文本到图像和视频生成中精确且持久的概念消除,无需额外开销,提升安全性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23951 2025-11-25 cs.CV 79%

JointTuner: Appearance-Motion Adaptive Joint Training for Customized Video Generation

JointTuner: 用于定制视频生成的外观-运动自适应联合训练

Fangda Chen, Shanshan Zhao, Chuanfu Xu, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 JointTuner通过联合优化外观和运动组件,提出GLoRA和AiT Loss解决定制视频生成中的外观污染和运动模式学习问题。

Comments Project Page: https://fdchen24.github.io/JointTuner-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18102 2025-11-25 cs.CV 79%

Spotlight: Identifying and Localizing Video Generation Errors Using VLMs

Spotlight: 利用视觉语言模型识别和定位视频生成错误

Aditya Chinchure, Sahithya Ravi, Pushkar Shukla, Vered Shwartz, Leonid Sigal

机构 * The University of British Columbia(不列颠哥伦比亚大学) Vector Institute of AI(向量人工智能研究所) The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 Spotlight任务通过定位和解释视频生成错误,揭示VLMs在错误识别和定位上的不足,并提出改进策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19401 2025-11-25 cs.CV cs.AI 57%

In-Video Instructions: Visual Signals as Generative Control

视频中的指令:将视觉信号作为生成控制

Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本研究提出通过视频中嵌入的视觉信号作为指令,实现可控的图像到视频生成,通过空间感知的指令分配提升多对象场景下的生成可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18919 2025-11-25 cs.CV cs.AI 57%

Learning What to Trust: Bayesian Prior-Guided Optimization for Visual Generation

学习信任什么:基于贝叶斯先验引导的视觉生成优化

Ruiying Liu, Yuanzhi Liang, Haibin Huang, Tianshu Yu, Chi Zhang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出贝叶斯先验引导优化方法,通过建模奖励不确定性提升视觉生成模型的语义对齐和感知保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM 57%

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18277 2025-11-25 cs.CV 57%

Point-to-Point: Sparse Motion Guidance for Controllable Video Editing

点到点:用于可控视频编辑的稀疏运动引导

Yeji Song, Jaehyun Lee, Mijin Koo, JunHoo Lee, Nojun Kwak

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 6 篇

2501.03931 2025-11-25 cs.CV 89%

MagicMirror: ID-Preserved Video Generation in Video Diffusion Transformers

MagicMirror: 视频扩散变换器中的身份保留视频生成

Yuechen Zhang, Yaoyang Liu, Bin Xia, Bohao Peng, Zexin Yan, Eric Lo, Jiaya Jia

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 MagicMirror通过双分支特征提取器和两阶段训练策略,在视频扩散变换器中实现高质量身份保留视频生成,优于现有方法。

Comments ICCV 2025, It is best viewed in Acrobat. Project Page: https://julianjuaner.github.io/projects/MagicMirror/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17839 2025-11-25 cs.CV 83%

Show Me: Unifying Instructional Image and Video Generation with Diffusion Models

Show Me: 用扩散模型统一指令图像和视频生成

Yujiang Pu, Zhanbo Huang, Vishnu Boddeti, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 ShowMe通过统一视频扩散模型的空间和时间组件,提升指令图像和视频生成的性能与一致性。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16864 2025-11-25 cs.CV 83%

Training-Free Efficient Video Generation via Dynamic Token Carving

无需训练的高效视频生成 via 动态令牌雕刻

Yuechen Zhang, Jinbo Xing, Bin Xia, Shaoteng Liu, Bohao Peng, Xin Tao, Pengfei Wan, Eric Lo, Jiaya Jia

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Jenga通过动态注意力雕刻和逐步分辨率生成,实现无需训练的高效视频生成,显著提升生成速度并保持生成质量。

Comments NeurIPS 2025, Project Page: https://julianjuaner.github.io/projects/jenga/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18922 2025-11-25 cs.CV 70%

One4D: Unified 4D Generation and Reconstruction via Decoupled LoRA Control

One4D:通过解耦LoRA控制实现统一的4D生成与重建

Zhenxing Mi, Yuxin Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 One4D通过解耦LoRA控制实现4D生成与重建的统一框架,提升视频扩散模型在几何重建中的性能

Comments Project page: https://mizhenxing.github.io/One4D

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18786 2025-11-25 cs.CV 57%

STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

STCDiT:一种时空一致的扩散变换器用于高质量视频超分辨率

Junyang Chen, Jiangxin Dong, Long Sun, Yixin Yang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 STCDiT通过结合运动感知的VAE重建和锚帧指导方法,实现了高质量视频超分辨率,提升了结构保真度和时间一致性。

Comments Project page: https://jychen9811.github.io/STCDiT_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14208 2025-11-25 cs.CV 57%

InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior

InstantViR: 基于蒸馏扩散先验的实时视频逆问题求解器

Weimin Bai, Suzhe Xu, Yiwei Ren, Jinhua Hao, Ming Sun, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Huaqiao University(华侨大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 InstantViR通过蒸馏扩散先验实现高效实时视频重建,以35 FPS速度在NVIDIA A100 GPU上达到与基线相当的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2511.18399 2025-11-25 cs.CV 57%

ChineseVideoBench: Benchmarking Multi-modal Large Models for Chinese Video Question Answering

ChineseVideoBench: 多模态大模型在中文视频问答中的基准测试

Yuxiang Nie, Han Wang, Yongjie Ye, Haiyang Yu, Weitao Jia, Tao Zeng, Hao Feng, Xiang Fei, Yang Li, Xiaohui Lv, Guozhi Tang, Jingqun Tang, Jinghui Lu, Zehui Dai, Jiacong Wang, Dingkang Yang, An-Lan Wang, Can Huang

机构 * Bytedance Inc.(字节跳动公司)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 ChineseVideoBench通过提供中文视频问答的基准测试,评估多模态大语言模型的性能,揭示了当前模型在复杂中文视频内容上的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 3 篇

2511.18823 2025-11-25 cs.CV 77%

VideoPerceiver: Enhancing Fine-Grained Temporal Perception in Video Multimodal Large Language Models

VideoPerceiver: 提升视频多模态大语言模型的细粒度时序感知能力

Fufangchen Zhao, Liao Zhang, Daiqi Shi, Yuanjun Gao, Chen Ye, Yang Cai, Jian Gao, Danfeng Yan

机构 * State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室)

专题命中 动作与事件理解 :video understanding(abstract);video-language(abstract);long video(abstract);分类 cs.CV

AI总结 VideoPerceiver通过两阶段训练框架提升视频多模态大语言模型对细粒度动作和短暂事件的感知能力,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18920 2025-11-25 cs.CV 70%

EventSTU: Event-Guided Efficient Spatio-Temporal Understanding for Video Large Language Models

EventSTU: 基于事件的高效空间-时间理解用于视频大语言模型

Wenhao Xu, Xin Dong, Yue Li, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 动作与事件理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 EventSTU通过事件引导的方法,高效处理视频大语言模型的空间-时间理解,实现显著的计算效率提升和性能优化。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16669 2025-11-25 cs.CV 70%

Video-as-Answer: Predict and Generate Next Video Event with Joint-GRPO

视频作答:联合GRPO预测并生成下一个视频事件

Junhao Cheng, Liang Hou, Xin Tao, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队)

专题命中 动作与事件理解 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 VANS通过联合GRPO方法,利用强化学习对齐视觉-语言模型与视频扩散模型,实现视频下一个事件预测任务的高精度视频生成与描述生成。

Comments Project page: https://video-as-answer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 5 篇

2411.13093 2025-11-25 cs.CV cs.AI 85%

Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension

Video-RAG: 基于视觉对齐的检索增强长视频理解

Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Nanjing University(南京大学) University of Rochester(罗切斯特大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。

Comments Accepted at NeurIPS 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17945 2025-11-25 cs.CV 83%

Test-Time Temporal Sampling for Efficient MLLM Video Understanding

测试时时间采样用于高效多模态大语言模型视频理解

Kaibin Wang, Mingbao Lin

机构 * SenseTime, China(深睿时代,中国) Rakuten, Singapore(拉结恩,新加坡)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 T3S通过测试时时间采样提高多模态大语言模型处理长视频的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV 70%

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏