Multiple-object tracking in cluttered and crowded public spaces
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
Journal ref Lecture Notes in Computer Science, volume 6455, pp 89-98, 2010
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
Journal ref Lecture Notes in Computer Science, volume 6455, pp 89-98, 2010
AEGIS:防止MCP中的跨域资源滥用
专题命中 长视频与时序推理 :long video(abstract)
AI总结 本文提出AEGIS,该组件借助LLM将MCP工具调用归一化为统一表示,结合Open Policy Agent与ContextForge AI Gateway,可防止跨异构MCP工具和模态的资源滥用。
RRM:用于长周期多模态推理的经验驱动反思式检索记忆
专题命中 长视频与时序推理 :long video(abstract)
AI总结 该研究针对现有多模态长期智能体检索机制不足的问题,提出RRM框架,通过反思式经验记忆提炼跨任务检索策略,在多个多模态推理数据集上取得优于现有方法的性能。
阿莱雅世界:交互式长视野世界建模——完整技术报告
机构 * Alaya Lab(阿莱亚实验室)
专题命中 长视频与时序推理 :video diffusion(abstract)
AI总结 研究旨在创建交互式视频世界模型,核心方法是基于15B视频扩散变压器构建阿莱雅世界,通过自回归生成短潜在块等实现多种能力,在iWorld - Bench上长视野生成性能最佳,为相关研究提供开源可扩展基础。
Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details
VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解
机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)
专题命中 长视频与时序推理 :long video(abstract)
AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。
面向多跳音视频推理的主动全模态感知代理
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 长视频与时序推理 :long video(abstract)
AI总结 针对多跳音视频推理中证据稀疏且跨模态分布的问题,提出MOV-Bench基准和AOP-Agent代理框架,通过分层全模态记忆与观察-反思-重规划循环实现主动感知,显著提升开源全模态大模型在长视频和推理密集型问题上的性能。
代理AI用于个性化物理治疗:一种多代理框架用于生成视频训练和实时姿态校正
专题命中 长视频与时序推理 :video generation(abstract)
AI总结 本文提出多代理系统框架,结合生成AI和计算机视觉,解决家庭物理治疗依从性低的问题,通过生成个性化视频和实时姿态校正提升康复效果。
Comments 3 pages, 2 figures, submitted to ICDH IEEE conference
StreamWise: 实时大规模多模态生成服务
机构 * Microsoft Azure Research(微软Azure研究院) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 长视频与时序推理 :video generation(abstract)
AI总结 StreamWise通过实时播客视频生成,整合LLM、文本转语音和视频音频生成,实现高效多模态实时服务,兼顾延迟、成本和质量。
FUTURE-VLA:在实时执行下统一轨迹预测
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) ; Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) ; School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)
专题命中 长视频与时序推理 :long video(abstract)
AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。
焦耳去哪儿了?诊断推理能耗
机构 * University of Michigan \& The ML.ENERGY Initiative
专题命中 长视频与时序推理 :video generation(abstract)
AI总结 研究通过大规模测量发现生成式AI中不同任务和硬件配置对能耗的影响差异,并提出框架解释能耗与利用率等隐含指标的关系,为优化数据中心能耗提供依据。
Comments The ML ENERGY Leaderboard v3.0 is open at https://ml.energy/leaderboard
TARFVAE:通过TARFLOW基于VAE实现高效的单步生成时间序列预测
机构 * Meituan(美团)
专题命中 长视频与时序推理 :video generation(abstract)
AI总结 TARFVAE结合Transformer自回归流与VAE,实现高效单步生成时间序列预测,提升预测效率与性能。
机构 * School of Computing and Information, University of Pittsburgh, PA, USA(计算与信息学院,匹兹堡大学) ; Wuhan University of Technology(武汉理工大学) ; Hunan University(湖南大学)
专题命中 长视频与时序推理 :long video(abstract)
Comments Accepted to NLPCC 2025 (Springer), to appear November 2025
机构 * Department of Electrical Engineering and Automation, Aalto University(艾尔沃斯大学电气工程与自动化系) ; Department of Engineering and Computer Science, University of Trento(特伦托大学工程与计算机科学系)
专题命中 长视频与时序推理 :video generation(abstract)
专题命中 长视频与时序推理 :video generation(abstract)
Comments 21 Pages, 14 figures, conference paper
专题命中 长视频与时序推理 :long video(abstract)
专题命中 长视频与时序推理 :long video(abstract)
Comments 27 pages, 17 figures
专题命中 长视频与时序推理 :video-language(abstract)
专题命中 长视频与时序推理 :long video(abstract)
Comments Accept by TOIS
专题命中 长视频与时序推理 :long video(abstract)
Comments 5 pages, Human-in-the-Loop Data Curation Workshop CIKM'22
专题命中 长视频与时序推理 :long video(abstract)
Comments 195 pages
专题命中 长视频与时序推理 :long video(abstract)
Journal ref PVLDB 2020
MINERVA-Cultural: 一个用于文化和多语言长视频推理的基准
机构 * Google DeepMind(谷歌DeepMind) ; UC Berkeley(加州大学伯克利分校)
专题命中 视频数据与评测 :video reasoning(title,abstract);long video(title,abstract);video understanding(abstract);分类 cs.CV
AI总结 本文提出MINERVA-Cultural基准,旨在解决现有视频评估中文化偏见问题,通过多语言多文化视频数据和原生语言问题,推动视频推理模型的发展。
Comments Accepted to CVPR 2026
专题命中 视频数据与评测 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV
Comments The project website is at: https://weijiawu.github.io/MovieBench/. Code: https://github.com/showlab/MovieBecnh
Journal ref CVPR 2025
专题命中 视频数据与评测 :video generation(title,abstract);long video(title,abstract);text-to-video(abstract);分类 cs.CV
Comments benchmark paper, project page: https://ypwang61.github.io/project/StoryEval
SLVMEval: 合成元评估基准用于文本到长视频生成
机构 * Tohoku University(东北大学) ; LY Corporation
专题命中 视频数据与评测 :long video(title,abstract);video generation(title);text-to-video(abstract);分类 cs.CV
AI总结 本文提出SLVMEval基准,用于元评估文本到视频系统,通过合成降质视频对评估系统在长视频质量评估中的可靠性,实验显示人类评估准确率高于现有系统。
Comments Accepted to CVPR 2026
KFS-Bench: 长视频理解中关键帧采样的全面评估
机构 * Visual Intelligence Research Laboratories, NEC Corporation(NEC公司视觉智能研究实验室)
专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
AI总结 KFS-Bench通过多场景标注评估关键帧采样策略,提出新度量标准和方法提升问答性能。
Comments WACV2026
机构 * Zhipu AI(智谱AI) ; Tsinghua University(清华大学)
专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
机构 * University of Waterloo(滑铁卢大学) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Shanghai University(上海大学)
专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
Comments Dataset: https://huggingface.co/datasets/TIGER-Lab/VideoEval-Pro, Project Webpage: https://tiger-ai-lab.github.io/VideoEval-Pro
专题命中 视频数据与评测 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV
Comments AAAI 2025