arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 648 篇

2605.18733 2026-05-19 cs.CV 86%

Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory

通过无训练的身份感知记忆推进叙事长视频生成

Jinzhuo Liu, Jiangning Zhang, Wencan Jiang, Yabiao Wang, Dingkang Liang, Zhucun Xue, Ran Yi, Yong Liu

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯云智实验室) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 本文提出了一种无训练的身份感知记忆框架IAMFlow,通过显式建模和跟踪持久实体身份,实现一致的生成,同时引入NarraStream-Bench基准测试,在叙事流视频生成中取得最佳性能。

Comments Project page: https://eddie0521.github.io/projects/iamflow/ Code: https://github.com/Eddie0521/IAMFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06869 2026-04-13 cs.CV cs.AI 86%

VSI: Visual Subtitle Integration for Keyframe Selection to enhance Long Video Understanding

VSI:视觉字幕整合用于关键帧选择以增强长视频理解

Jianxiang He, Meisheng Hong, Jungang Li, Weiyu Guo, Xuming Hu, Hui Xiong

机构 * AI Thrust, HKUST(GZ)(香港科技大学(广州)) Shandong University(山东大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(title);分类 cs.CV

AI总结 VSI通过融合视觉与文本信息提升长视频关键帧检索精度,实现在文本相关任务中的突破性表现。

Comments Accepted to CVPR 2026 Findings, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04379 2026-03-05 cs.CV 86%

Helios: Real Real-Time Long Video Generation Model

Helios:实时长视频生成模型

Shenghai Yuan, Yuanyang Yin, Zongjian Li, Xinwei Huang, Xiao Yang, Li Yuan

机构 * Peking University(北京大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 Helios是首个无需并行框架、能实时生成长视频且质量媲美基线模型的14B视频生成模型。

Comments Page: pku-yuangroup.github.io/Helios-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12430 2025-12-16 cs.CV 86%

Endless World: Real-Time 3D-Aware Long Video Generation

无限世界:实时3D感知长视频生成

Ke Zhang, Yiqun Mei, Jiacong Xu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学) Adobe Research(Adobe研究)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 Endless World通过实时3D感知机制生成无限长且连贯的视频,解决长视频生成中的3D一致性与动态场景合成问题。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02850 2025-09-30 cs.CV 86%

METok: Multi-Stage Event-based Token Compression for Efficient Long Video Understanding

Mengyue Wang, Shuo Chen, Kristian Kersting, Volker Tresp, Yunpu Ma

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(title);分类 cs.CV

Comments EMNLP 2025; 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20827 2025-05-28 cs.CV 86%

Frame-Level Captions for Long Video Generation with Complex Multi Scenes

Guangcong Zheng, Jianlong Yuan, Bo Wang, Haoyang Huang, Guoqing Ma, Nan Duan

专题命中 长视频与时序推理 :long video(title,abstract);video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03638 2022-09-27 cs.CV cs.AI 86%

Long Video Generation with Time-Agnostic VQGAN and Time-Sensitive Transformer

Songwei Ge, Thomas Hayes, Harry Yang, Xi Yin, Guan Pang, David Jacobs, Jia-Bin Huang, Devi Parikh

专题命中 长视频与时序推理 :long video(title,abstract);video generation(title);分类 cs.CV

Comments In ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06481 2026-07-08 cs.CV cs.AI 新提交 85%

Prompt-Adapter Context Routing for Parameter-Efficient Multi-Shot Long Video Extrapolation

用于参数高效多镜头长视频外推的提示适配器上下文路由

Anna Córdoba, Adam Puente Tercero, Nerea Angulo Hijo, Mar Linares Tercero, Julia Barrientos, Ainhoa Miranda, Jesús Olivera

机构 * Instituto de Investigación en Visión Artificial(人工视觉研究所)

专题命中 长视频与时序推理 :long video(title,abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究多镜头长视频外推问题,提出PACR-Video框架,通过冻结文本到视频扩散变换器,用低秩时间适配器及递归提示库增强,结合特定调优目标和调度,在多基准测试中优于多种基线,证明其能为长视频外推提供可控能力。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20785 2026-05-22 cs.CV 85%

LongVT: Incentivizing "Thinking with Long Videos" via Native Tool Calling

LongVT: 通过原生工具调用激励'通过长视频思考'

Zuhao Yang, Sudong Wang, Kaichen Zhang, Keming Wu, Sicong Leng, Yifan Zhang, Bo Li, Chengwei Qin, Shijian Lu, Xingxuan Li, Lidong Bing

机构 * MiroMind NTU(国立台湾大学) HKUST(GZ)(香港科技大学(广州)) THU(清华大学) LMMs-Lab(LMMs实验室)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 本文提出LongVT,一种端到端的代理框架,通过交错的多模态工具链式思考实现'通过长视频思考',通过利用LMM的固有时间定位能力作为原生视频裁剪工具,以解决长视频推理中的幻觉问题,并通过VideoSIAH数据集提升训练和评估效果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13093 2025-11-25 cs.CV cs.AI 85%

Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension

Video-RAG: 基于视觉对齐的检索增强长视频理解

Yongdong Luo, Xiawu Zheng, Guilin Li, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Fei Chao, Jiebo Luo, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Nanjing University(南京大学) University of Rochester(罗切斯特大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 Video-RAG通过视觉对齐的辅助文本提升长视频理解性能,无需训练且兼容性强,显著优于专有模型。

Comments Accepted at NeurIPS 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09350 2025-10-03 cs.CV cs.AI cs.LG 85%

Autoregressive Adversarial Post-Training for Real-Time Interactive Video Generation

Shanchuan Lin, Ceyuan Yang, Hao He, Jianwen Jiang, Yuxi Ren, Xin Xia, Yang Zhao, Xuefeng Xiao, Lu Jiang

专题命中 长视频与时序推理 :video generation(title,abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24304 2025-10-01 cs.CV 85%

FrameThinker: Learning to Think with Long Videos via Multi-Turn Frame Spotlighting

Zefeng He, Xiaoye Qu, Yafu Li, Siyuan Huang, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video reasoning(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07966 2025-10-01 cs.CV cs.AI cs.CL 85%

Scaling RL to Long Videos

Yukang Chen, Wei Huang, Baifeng Shi, Qinghao Hu, Hanrong Ye, Ligeng Zhu, Zhijian Liu, Pavlo Molchanov, Jan Kautz, Xiaojuan Qi, Sifei Liu, Hongxu Yin, Yao Lu, Song Han

机构 * NVIDIA MIT(麻省理工学院) HKU(香港大学) UC Berkeley(加州大学伯克利分校)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);video reasoning(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. Code at https://github.com/NVlabs/Long-RL and model at https://huggingface.co/Efficient-Large-Model/LongVILA-R1-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01071 2025-08-05 cs.CV cs.CL 85%

VideoLLaMB: Long Streaming Video Understanding with Recurrent Memory Bridges

Yuxuan Wang, Yiqi Song, Cihang Xie, Yang Liu, Zilong Zheng

机构 * NLCo Lab, State Key Laboratory of General Artificial Intelligence, BIGAI(NLCo实验室、国家一般人工智能重点实验室、BIGAI) School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院、北京理工大学) Computer Science and Engineering, University of California(计算机科学与工程系、加州大学) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所、北京大学)

专题命中 长视频与时序推理 :video understanding(title,abstract);video-language(abstract);long video(abstract);分类 cs.CV

Comments To appear at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23825 2025-07-25 cs.CV 85%

Flash-VStream: Efficient Real-Time Understanding for Long Video Streams

Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Xiaojie Jin

机构 * Tsinghua University(清华大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Beijing Jiaotong University(北京交通大学) ByteDance Inc(字节跳动公司)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12632 2025-07-09 cs.CV cs.LG 85%

MALT Diffusion: Memory-Augmented Latent Transformers for Any-Length Video Generation

Sihyun Yu, Meera Hahn, Dan Kondratyuk, Jinwoo Shin, Agrim Gupta, José Lezama, Irfan Essa, David Ross, Jonathan Huang

机构 * KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind) Georgia Tech(佐治亚理工学院) Luma AI Google Research(谷歌研究)

专题命中 长视频与时序推理 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments CVPR 2025 Workshop on AI for Content Creation (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21070 2025-05-30 cs.CV 85%

Minute-Long Videos with Dual Parallelisms

Zeqing Wang, Bowen Zheng, Xingyi Yang, Zhenxiong Tan, Yuecong Xu, Xinchao Wang

机构 * National University of Singapore(国立新加坡大学) Xidian University(西安电子科技大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments The code is available at https://github.com/DualParal-Project/DualParal

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08689 2025-03-12 cs.CV 85%

QuoTA: Query-oriented Token Assignment via CoT Query Decouple for Long Video Comprehension

Yongdong Luo, Wang Chen, Xiawu Zheng, Weizhong Huang, Shukang Yin, Haojia Lin, Chaoyou Fu, Jinfa Huang, Jiayi Ji, Jiebo Luo, Rongrong Ji

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Project page: https://github.com/MAC-AutoML/QuoTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13468 2025-01-24 cs.CV cs.AI 85%

Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge

Haomiao Xiong, Zongxin Yang, Jiazuo Yu, Yunzhi Zhuge, Lu Zhang, Jiawen Zhu, Huchuan Lu

专题命中 长视频与时序推理 :video understanding(title,abstract);video reasoning(abstract);long video(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Code is available at https://github.com/hmxiong/StreamChat

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08085 2024-07-02 cs.CV 85%

Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams

Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Jifeng Dai, Xiaojie Jin

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);video-language(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05871 2026-03-11 cs.CV 84%

Pathwise Test-Time Correction for Autoregressive Long Video Generation

逐帧测试时校正用于自回归长视频生成

Xunzhi Xiang, Zixuan Duan, Guiyu Zhang, Haiyu Zhang, Zhe Gao, Junta Wu, Shaofeng Zhang, Tengfei Wang, Qi Fan, Chunchao Guo

机构 * Nanjing University(南京大学) Tencent Hunyuan(腾讯文言) Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 长视频与时序推理 :video generation(title);long video(title);分类 cs.CV

AI总结 本文提出TTC方法,通过利用初始帧作为参考锚点,有效校正自回归长视频生成中的漂移问题,提升生成质量并延长生成长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15641 2025-08-22 cs.CV 84%

When and What: Diffusion-Grounded VideoLLM with Entity Aware Segmentation for Long Video Understanding

Pengcheng Fang, Yuxia Chen, Rui Guo

专题命中 长视频与时序推理 :video understanding(title);long video(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09486 2026-03-10 cs.CV cs.AI cs.MM 84%

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

视频-EM:面向长视频理解的事件中心型片段记忆

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu Chen, Xuelong Li

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Tianjin University(天津大学) Nanjing University(南京大学) Zhejiang University(浙江大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV、cs.MM

AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12559 2025-06-10 cs.CV cs.CL cs.MM 84%

AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding

Xiao Wang, Qingyi Si, Jianlong Wu, Shiyu Zhu, Li Cao, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei Technologies Co., Ltd.(华为技术有限公司) Shandong University(山东大学)

专题命中 长视频与时序推理 :video-language(title);video understanding(abstract);long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10443 2025-04-15 cs.CV cs.AI cs.CL cs.LG cs.MM 84%

Multimodal Long Video Modeling Based on Temporal Dynamic Context

Haoran Hao, Jiaming Han, Yiyuan Zhang, Xiangyu Yue

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19772 2025-03-21 cs.CV cs.CL cs.LG cs.MM 84%

LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos

Tiantian Geng, Jinrui Zhang, Qingni Wang, Teng Wang, Jinming Duan, Feng Zheng

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06526 2025-03-11 cs.CV cs.MM 84%

TimeLoc: A Unified End-to-End Framework for Precise Timestamp Localization in Long Videos

Chen-Lin Zhang, Lin Sui, Shuming Liu, Fangzhou Mu, Zhangcheng Wang, Bernard Ghanem

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV、cs.MM

Comments Code & models will be released at https://github.com/sming256/TimeLoc. The first 4 authors contributes equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06094 2026-08-21 cs.CV cs.AI 版本更新 83%

VISD: Enhancing Video Reasoning via Structured Self-Distillation

VISD: 通过结构化自蒸馏增强视频推理

Hao Lin, Kunyang Lv, Xu Jiang, Jingqi Tian, Zhongjing Du, Jiayu Ding, Qiaoman Zhang, Hongbo Jin

机构 * HUST(华中科技大学) Wuhan University(武汉大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出VISD框架,利用结构化自蒸馏和方向-幅度解耦机制,实现细粒度信用分配,提升视频推理准确性和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18532 2026-08-20 cs.CV 新提交 83%

StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

StateTrace:面向长视频中隐状态时空推理的以对象为中心的框架

Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) The University of Sydney(悉尼大学) Central South University(中南大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) SenseTime Research(商汤科技研究院)

专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 StateTrace是一种以对象为中心的框架,为VideoLLMs赋予长视频隐状态推理能力,构建时空状态记忆并经实验显著提升了VideoLLMs在相关基准上的性能。

Comments 10 pages. Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16316 2026-08-18 cs.CV cs.AI cs.CL 新提交 83%

Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning

深度思维对齐:面向视频推理的轨迹级潜在知识蒸馏

Ao Shen, Yongheng Zhang, Yinghui Li, Manning Wang, Di Yin, Xing Sun

专题命中 长视频与时序推理 :video reasoning(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对视频推理LMMs的高计算成本问题,提出Latent-OPD方法,通过轨迹级潜在知识蒸馏与渐进式教师前瞻策略提升轻量模型性能,在6个基准上优于仅输出监督的OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏