arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-05 至 2025-12-05 共收录 13 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2512.04451 2025-12-05 cs.CV 83%

StreamEQA: Towards Streaming Video Understanding for Embodied Scenarios

StreamEQA:迈向具身场景的流式视频理解

Yifei Wang, Zhenkai Li, Tianwen Qian, Huanran Zheng, Zheng Wang, Yuqian Fu, Xiaoling Wang

机构 * School of Computer Science and Technology, East China Normal University(计算机科学与技术学院,华东师范大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 StreamEQA是一个针对具身场景中流式视频问答的基准测试,通过评估模型在感知、交互和规划方面的能力,推动流式视频理解在具身应用中的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15470 2025-12-05 cs.CV cs.AI 79%

EgoDTM: Towards 3D-Aware Egocentric Video-Language Pretraining

EgoDTM: 向3D感知的自体视频-语言预训练迈进

Boshen Xu, Yuting Mei, Xinbi Liu, Sipeng Zheng, Qin Jin

机构 * AIM3 Lab, Renmin University of China(中国人民大学人工智能3实验室)

专题命中 视频理解 :video-language(title,abstract);分类 cs.CV

AI总结 EgoDTM通过结合大规模3D感知视频预训练和视频-文本对比学习,提升视频-语言模型的3D感知能力,实现更丰富的空间理解。

Comments Code: https://github.com/xuboshen/EgoDTM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 57%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 2 篇

2512.04483 2025-12-05 cs.CV 57%

DeRA: Decoupled Representation Alignment for Video Tokenization

DeRA: 解耦表示对齐用于视频标记化

Pengbo Guo, Junke Wang, Zhen Xing, Chengxu Liu, Daoguo Dong, Xueming Qian, Zuxuan Wu

机构 * Xi’an Jiaotong University(西安交通大学) Shanghai Innovation Institute(上海创新研究院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 DeRA通过解耦时空表示学习,提升视频标记化效率和性能,并在视频生成任务中取得新突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25998 2025-12-05 cs.CV cs.AI 57%

VRWKV-Editor: Reducing quadratic complexity in transformer-based video editing

VRWKV-Editor: 降低基于变换器的视频编辑中的二次复杂度

Abdelilah Aitrouga, Youssef Hmamouche, Amal El Fallah Seghrouchni

机构 * International Artificial Intelligence Center of Morocco University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥国际人工智能中心摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) University Mohammed VI Polytechnic Rabat, Morocco(摩洛哥穆莱·伊沙克·穆莱·阿卜杜勒阿齐兹 polytechnic 大学拉巴特分校) Sorbonne University, LIP6 - UMR 7606 CNRS, France(索邦大学,LIP6 - UMR 7606 CNRS,法国)

专题命中 视频生成 :long video(abstract);分类 cs.CV

AI总结 VRWKV-Editor通过引入线性时空聚合模块,降低基于变换器的视频编辑模型的计算复杂度,实现3.7倍加速和60%内存节省,同时保持高质量的帧一致性和文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 1 篇

2503.22622 2025-12-05 cs.CV 88%

Zero4D: Training-Free 4D Video Generation From Single Video Using Off-the-Shelf Video Diffusion

Zero4D: 无需训练的单视频生成4D视频

Jangho Park, Taesung Kwon, Jong Chul Ye

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);分类 cs.CV

AI总结 Zero4D通过无需训练的视频扩散模型,将单视频扩展为多视角4D视频,保持空间时间一致性。

Comments project page: https://zero4dvid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 2 篇

2512.04532 2025-12-05 cs.CV cs.AI 83%

PhyVLLM: Physics-Guided Video Language Model with Motion-Appearance Disentanglement

PhyVLLM:具有运动-外观解耦的物理引导视频语言模型

Yu-Wei Zhan, Xin Wang, Hong Chen, Tongtong Feng, Wei Feng, Ren Wang, Guangyao Li, Qing Li, Wenwu Zhu

机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 动作与事件理解 :video language model(title);video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 PhyVLLM通过引入物理运动建模和运动-外观解耦,提升视频语言模型在物理推理和视频理解任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19430 2025-12-05 cs.RO cs.CV 57%

GigaBrain-0: A World Model-Powered Vision-Language-Action Model

GigaBrain-0:一种由世界模型驱动的视觉-语言-动作模型

GigaBrain Team, Angen Ye, Boyuan Wang, Chaojun Ni, Guan Huang, Guosheng Zhao, Haoyun Li, Jie Li, Jiagang Zhu, Lv Feng, Peng Li, Qiuping Deng, Runqi Ouyang, Wenkang Qin, Xinze Chen, Xiaofeng Wang, Yang Wang, Yifan Li, Yilong Li, Yiran Ding, Yuan Xu, Yun Ye, Yukun Zhou, Zhehao Dong, Zhenan Wang, Zhichao Liu, Zheng Zhu

机构 * GigaBrain Team(GigaBrain团队)

专题命中 动作与事件理解 :video generation(abstract);分类 cs.CV

AI总结 GigaBrain-0通过世界模型生成数据,减少对真实机器人数据的依赖,提升视觉-语言-动作模型的泛化能力和现实世界性能。

Comments https://gigabrain0.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 3 篇

2512.05081 2025-12-05 cs.CV 88%

Deep Forcing: Training-Free Long Video Generation with Deep Sink and Participative Compression

深度强制:免训练 长视频生成与深度Sink和参与性压缩

Jung Yi, Wooseok Jang, Paul Hyunbin Cho, Jisu Nam, Heeji Yoon, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);video diffusion(abstract);分类 cs.CV

AI总结 深度强制通过深度Sink和参与性压缩机制,在无需微调的情况下实现长视频生成,提升生成质量与动态效果。

Comments Project Page: https://cvlab-kaist.github.io/DeepForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04519 2025-12-05 cs.CV 88%

VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory

VideoSSM:基于混合状态-空间记忆的自回归长视频生成

Yifei Yu, Xiaoshan Wu, Xinting Hu, Tao Hu, Yangtian Sun, Xiaoyang Lyu, Bo Wang, Lin Ma, Yuewen Ma, Zhongrui Wang, Xiaojuan Qi

机构 * HKU(香港大学) PICO, ByteDance(字节跳动PICO) SUSTech(南方科技大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 VideoSSM通过结合自回归扩散与混合状态空间记忆,实现了具有全局一致性和运动稳定性的长视频生成,支持提示自适应交互并提升内容多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV 83%

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 2 篇

2512.01424 2025-12-05 cs.CV 79%

ViRectify: A Challenging Benchmark for Video Reasoning Correction with Multimodal Large Language Models

ViRectify:一种用于多模态大语言模型视频推理纠错的挑战性基准

Xusen Hei, Jiali Chen, Jinyu Yang, Mengchen Zhao, Yi Cai

机构 * South China University of Technology(华南理工大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 ViRectify是一个用于评估多模态大语言模型视频推理纠错能力的挑战性基准,通过构建大规模数据集和提出轨迹证据驱动的纠正框架,验证了模型在纠错任务中的性能差异。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11520 2025-12-05 cs.RO 50%

Scalable Policy Evaluation with Video World Models

可扩展的策略评估与视频世界模型

Wei-Cheng Tseng, Jinwei Gu, Qinsheng Zhang, Hanzi Mao, Ming-Yu Liu, Florian Shkurti, Lin Yen-Chen

机构 * Nvidia Research(Nvidia 研究院) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频数据与评测 :video generation(abstract)

AI总结 本文提出利用动作条件视频生成模型进行可扩展的策略评估,通过预训练模型利用互联网视频数据,减少现实世界测试需求,提升机器人策略评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏