arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6790 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 649 篇

1309.6391 2013-09-26 cs.CV 57%

Multiple-object tracking in cluttered and crowded public spaces

Rhys Martin, Ognjen Arandjelović

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

Journal ref Lecture Notes in Computer Science, volume 6455, pp 89-98, 2010

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20481 2026-08-24 cs.CR cs.AI 新提交 50%

AEGIS: Preventing Cross-Domain Resource Abuse in MCP

AEGIS:防止MCP中的跨域资源滥用

Shriti Priya, Teryl Taylor, Frederico Araujo

专题命中 长视频与时序推理 :long video(abstract)

AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28156 2026-07-31 cs.CL 新提交 50%

RRM: Experience-Driven Reflective Retrieval Memory for Long-Horizon Multimodal Reasoning

RRM:用于长周期多模态推理的经验驱动反思式检索记忆

Jingxiang Fan, Junbao Zhuo, Bochao Zou

专题命中 长视频与时序推理 :long video(abstract)

AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18367 2026-07-22 cs.AI 新提交 50%

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

阿莱雅世界:交互式长视野世界建模——完整技术报告

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

机构 * Alaya Lab(阿莱亚实验室)

专题命中 长视频与时序推理 :video diffusion(abstract)

AI总结 研究旨在创建交互式视频世界模型,核心方法是基于15B视频扩散变压器构建阿莱雅世界,通过自回归生成短潜在块等实现多种能力,在iWorld - Bench上长视野生成性能最佳,为相关研究提供开源可扩展基础。

Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01483 2026-07-21 cs.RO cs.AI 版本更新 50%

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解

Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov, Arthur Nigmatzyanov, Dmitrii Nalberskii, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)

专题命中 长视频与时序推理 :long video(abstract)

AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28192 2026-05-28 cs.AI 50%

Agentic Active Omni-Modal Perception for Multi-Hop Audio-Visual Reasoning

面向多跳音视频推理的主动全模态感知代理

Ke Xu, Yuhao Wang, Ziyang Cheng, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :long video(abstract)

AI总结 针对多跳音视频推理中证据稀疏且跨模态分布的问题,提出MOV-Bench基准和AOP-Agent代理框架,通过分层全模态记忆与观察-反思-重规划循环实现主动感知,显著提升开源全模态大模型在长视频和推理密集型问题上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21154 2026-04-24 cs.AI 50%

Agentic AI for Personalized Physiotherapy: A Multi-Agent Framework for Generative Video Training and Real-Time Pose Correction

代理AI用于个性化物理治疗:一种多代理框架用于生成视频训练和实时姿态校正

Abhishek Dharmaratnakar, Srivaths Ranganathan, Anushree Sinha, Debanshu Das

专题命中 长视频与时序推理 :video generation(abstract)

AI总结 本文提出多代理系统框架,结合生成AI和计算机视觉,解决家庭物理治疗依从性低的问题,通过生成个性化视频和实时姿态校正提升康复效果。

Comments 3 pages, 2 figures, submitted to ICDH IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05800 2026-03-09 cs.DC cs.AI 50%

StreamWise: Serving Multi-Modal Generation in Real-Time at Scale

StreamWise: 实时大规模多模态生成服务

Haoran Qiu, Gohar Irfan Chaudhry, Chaojie Zhang, Íñigo Goiri, Esha Choukse, Rodrigo Fonseca, Ricardo Bianchini

机构 * Microsoft Azure Research(微软Azure研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 长视频与时序推理 :video generation(abstract)

AI总结 StreamWise通过实时播客视频生成,整合LLM、文本转语音和视频音频生成,实现高效多模态实时服务,兼顾延迟、成本和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15882 2026-02-19 cs.RO cs.AI 50%

FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution

FUTURE-VLA:在实时执行下统一轨迹预测

Jingjing Fan, Yushan Liu, Shoujie Li, Botao Ren, Siyuan Li, Xiao-Ping Zhang, Wenbo Ding, Zhidong Deng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

专题命中 长视频与时序推理 :long video(abstract)

AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22076 2026-02-02 cs.LG cs.DC 50%

Where Do the Joules Go? Diagnosing Inference Energy Consumption

焦耳去哪儿了?诊断推理能耗

Jae-Won Chung, Ruofan Wu, Jeff J. Ma, Mosharaf Chowdhury

机构 * University of Michigan \& The ML.ENERGY Initiative

专题命中 长视频与时序推理 :video generation(abstract)

AI总结 研究通过大规模测量发现生成式AI中不同任务和硬件配置对能耗的影响差异,并提出框架解释能耗与利用率等隐含指标的关系,为优化数据中心能耗提供依据。

Comments The ML ENERGY Leaderboard v3.0 is open at https://ml.energy/leaderboard

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22853 2025-12-01 cs.LG 50%

TARFVAE: Efficient One-Step Generative Time Series Forecasting via TARFLOW based VAE

TARFVAE:通过TARFLOW基于VAE实现高效的单步生成时间序列预测

Jiawen Wei, Lan Jiang, Pengbo Wei, Ziwen Ye, Teng Song, Chen Chen, Guangrui Ma

机构 * Meituan(美团)

专题命中 长视频与时序推理 :video generation(abstract)

AI总结 TARFVAE结合Transformer自回归流与VAE,实现高效单步生成时间序列预测,提升预测效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09553 2025-10-13 cs.CL 50%

Hierarchical Indexing with Knowledge Enrichment for Multilingual Video Corpus Retrieval

Yu Wang, Tianhao Tan, Yifei Wang

机构 * School of Computing and Information, University of Pittsburgh, PA, USA(计算与信息学院,匹兹堡大学) Wuhan University of Technology(武汉理工大学) Hunan University(湖南大学)

专题命中 长视频与时序推理 :long video(abstract)

Comments Accepted to NLPCC 2025 (Springer), to appear November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08444 2025-08-08 cs.RO 50%

Extracting Visual Plans from Unlabeled Videos via Symbolic Guidance

Wenyan Yang, Ahmet Tikna, Yi Zhao, Yuying Zhang, Luigi Palopoli, Marco Roveri, Joni Pajarinen

机构 * Department of Electrical Engineering and Automation, Aalto University(艾尔沃斯大学电气工程与自动化系) Department of Engineering and Computer Science, University of Trento(特伦托大学工程与计算机科学系)

专题命中 长视频与时序推理 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01873 2025-03-05 cs.LG cs.AI cs.NA cs.PF math.NA 50%

Online Pseudo-average Shifting Attention(PASA) for Robust Low-precision LLM Inference: Algorithms and Numerical Analysis

Long Cheng, Qichen Liao, Fan Wu, Junlin Mu, Tengfei Han, Zhe Qiu, Lianqiang Li, Tianyi Liu, Fangzheng Miao, Keming Gao, Liang Wang, Zhen Zhang, Qiande Yin

专题命中 长视频与时序推理 :video generation(abstract)

Comments 21 Pages, 14 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08368 2025-02-04 cs.LG 50%

ElasticTok: Adaptive Tokenization for Image and Video

Wilson Yan, Volodymyr Mnih, Aleksandra Faust, Matei Zaharia, Pieter Abbeel, Hao Liu

专题命中 长视频与时序推理 :long video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17906 2025-01-22 cs.RO 50%

VIEW: Visual Imitation Learning with Waypoints

Ananth Jonnavittula, Sagar Parekh, Dylan P. Losey

专题命中 长视频与时序推理 :long video(abstract)

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07494 2024-10-11 cs.RO 50%

G$^{2}$TR: Generalized Grounded Temporal Reasoning for Robot Instruction Following by Combining Large Pre-trained Models

Riya Arora, Niveditha Narendranath, Aman Tambi, Sandeep S. Zachariah, Souvik Chakraborty, Rohan Paul

专题命中 长视频与时序推理 :video-language(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.14276 2023-09-01 cs.IR 50%

Alleviating Video-Length Effect for Micro-video Recommendation

Yuhan Quan, Jingtao Ding, Chen Gao, Nian Li, Lingling Yi, Depeng Jin, Yong Li

专题命中 长视频与时序推理 :long video(abstract)

Comments Accept by TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09500 2022-10-19 cs.LG 50%

A Human-ML Collaboration Framework for Improving Video Content Reviews

Meghana Deodhar, Xiao Ma, Yixin Cai, Alex Koes, Alex Beutel, Jilin Chen

专题命中 长视频与时序推理 :long video(abstract)

Comments 5 pages, Human-in-the-Loop Data Curation Workshop CIKM'22

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.04211 2022-05-10 math.HO math.AG math.OC 50%

Real Algebraic Geometry, Positivity and Convexity

Markus Schweighofer

专题命中 长视频与时序推理 :long video(abstract)

Comments 195 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.00827 2022-01-05 cs.DB 50%

Approximate Selection with Guarantees using Proxies

Daniel Kang, Edward Gan, Peter Bailis, Tatsunori Hashimoto, Matei Zaharia

专题命中 长视频与时序推理 :long video(abstract)

Journal ref PVLDB 2020

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频数据与评测 578 篇

2601.10649 2026-04-08 cs.CV 89%

MINERVA-Cultural: A Benchmark for Cultural and Multilingual Long Video Reasoning

MINERVA-Cultural: 一个用于文化和多语言长视频推理的基准

Darshan Singh, Arsha Nagrani, Kawshik Manikantan, Harman Singh, Dinesh Tewari, Tobias Weyand, Cordelia Schmid, Anelia Angelova, Shachi Dave

机构 * Google DeepMind(谷歌DeepMind) UC Berkeley(加州大学伯克利分校)

专题命中 视频数据与评测 :video reasoning(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出MINERVA-Cultural基准,旨在解决现有视频评估中文化偏见问题,通过多语言多文化视频数据和原生语言问题,推动视频推理模型的发展。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15262 2025-04-01 cs.CV 89%

MovieBench: A Hierarchical Movie Level Dataset for Long Video Generation

Weijia Wu, Mingyu Liu, Zeyu Zhu, Xi Xia, Haoen Feng, Wen Wang, Kevin Qinghong Lin, Chunhua Shen, Mike Zheng Shou

专题命中 视频数据与评测 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

Comments The project website is at: https://weijiawu.github.io/MovieBench/. Code: https://github.com/showlab/MovieBecnh

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16211 2024-12-24 cs.CV cs.CL cs.GR 89%

Is Your World Simulator a Good Story Presenter? A Consecutive Events-Based Benchmark for Future Long Video Generation

Yiping Wang, Xuehai He, Kuan Wang, Luyao Ma, Jianwei Yang, Shuohang Wang, Simon Shaolei Du, Yelong Shen

专题命中 视频数据与评测 :video generation(title,abstract);long video(title,abstract);text-to-video(abstract);分类 cs.CV

Comments benchmark paper, project page: https://ypwang61.github.io/project/StoryEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29186 2026-04-01 cs.CV cs.AI 88%

SLVMEval: Synthetic Meta Evaluation Benchmark for Text-to-Long Video Generation

SLVMEval: 合成元评估基准用于文本到长视频生成

Ryosuke Matsuda, Keito Kudo, Haruto Yoshida, Nobuyuki Shimizu, Jun Suzuki

机构 * Tohoku University(东北大学) LY Corporation

专题命中 视频数据与评测 :long video(title,abstract);video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SLVMEval基准,用于元评估文本到视频系统,通过合成降质视频对评估系统在长视频质量评估中的可靠性,实验显示人类评估准确率高于现有系统。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14017 2025-12-17 cs.CV cs.AI 88%

KFS-Bench: Comprehensive Evaluation of Key Frame Sampling in Long Video Understanding

KFS-Bench: 长视频理解中关键帧采样的全面评估

Zongyao Li, Kengo Ishida, Satoshi Yamazaki, Xiaotong Ji, Jianquan Liu

机构 * Visual Intelligence Research Laboratories, NEC Corporation(NEC公司视觉智能研究实验室)

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 KFS-Bench通过多场景标注评估关键帧采样策略,提出新度量标准和方法提升问答性能。

Comments WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08035 2025-08-12 cs.CV cs.AI 88%

LVBench: An Extreme Long Video Understanding Benchmark

Weihan Wang, Zehai He, Wenyi Hong, Yean Cheng, Xiaohan Zhang, Ji Qi, Xiaotao Gu, Shiyu Huang, Bin Xu, Yuxiao Dong, Ming Ding, Jie Tang

机构 * Zhipu AI(智谱AI) Tsinghua University(清华大学)

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23922 2025-06-02 cs.CV cs.CL 88%

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

David Ma, Huaqing Yuan, Xingjian Wang, Qianbo Zang, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Ni Jiahui, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang, Shiwen Ni, Xiaojie Jin

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14640 2025-05-21 cs.CV 88%

VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation

Wentao Ma, Weiming Ren, Yiming Jia, Zhuofeng Li, Ping Nie, Ge Zhang, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) Vector Institute(向量研究所) Shanghai University(上海大学)

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

Comments Dataset: https://huggingface.co/datasets/TIGER-Lab/VideoEval-Pro, Project Webpage: https://tiger-ai-lab.github.io/VideoEval-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07298 2025-04-02 cs.CV 88%

ALLVB: All-in-One Long Video Understanding Benchmark

Xichen Tan, Yuanjing Luo, Yunfan Ye, Fang Liu, Zhiping Cai

专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏