MinD: Learning A Dual-System World Model for Real-Time Planning and Implicit Risk Analysis
专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract)
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract)
专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract)
从逐字到概要:基于语义信息瓶颈的金字塔多模态记忆压缩用于长视界视频智能体
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 长视频与时序推理 :video understanding(abstract,comments);分类 cs.CV、cs.MM
AI总结 本文提出MM-Mem架构,通过金字塔多模态记忆压缩,结合语义信息瓶颈目标,实现长视界视频理解中的高效记忆组织与任务相关信息保留。
Comments Accepted by ACL 2026 Main. 17 pages, 7 figures, 8 tables. TL;DR: We propose MM-Mem, a cognition-inspired, dual-trace hierarchical memory framework for long-horizon video understanding grounded in Fuzzy-Trace Theory. It features adaptive memory compression via the Information Bottleneck and employs an entropy-driven top-down retrieval to access fine-grained details only when necessary
Omni-LiveAvatar:分钟级实时流式视听联动数字人生成
专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV、cs.MM
AI总结 本研究提出Omni-LiveAvatar框架,通过渐进式自回归蒸馏等技术,实现分钟级实时流式视听联动数字人生成,速度较LTX-2提升33倍且性能优于基线模型。
通过语义长期跟踪实现手术视频的分割:SAM2S
机构 * National University of Singapore(新加坡国立大学) ; University of Sheffield(谢菲尔德大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
AI总结 SAM2S通过语义长期跟踪提升手术视频分割性能,实现更准确的零样本泛化和实时推理
Comments 19 pages, 7 figures, 11 tables
跨极端复杂度和质量尺度的增强型神经视频表示压缩
机构 * Visual Information Lab, University of Bristol, UK(布里斯托大学视觉信息实验室,英国) ; Network Connectivity Services Research, BT, UK(BT公司网络连接服务研究,英国)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
AI总结 提出NVRC++,一种基于隐式神经表示的轻量级视频编解码器,通过多分辨率特征网格和高效优化框架,在多种复杂度级别下实现宽比特率范围的高质量压缩,支持实时解码。
测试时自适应条件用于稳定音频驱动说话头生成
机构 * School of Business, University of New South Wales (UNSW)(新南威尔士大学商学院) ; School of Engineering and Built Environment, Griffith University(格里菲斯大学工程与环境学院)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV、cs.MM
AI总结 提出一种无需参数训练的测试时自适应条件框架(TT-SAC),通过反馈循环调整条件表示,提升预训练说话头生成器的身份保持、时间一致性和感知质量。
Comments Research report
Slot-BERT: 在手术视频中实现自监督的对象发现
机构 * Outcomes Laboratory, Department of Surgery, University of Pennsylvania, Philadelphia, PA, USA. ; Department of Computer ; Information Science, University of Pennsylvania, Philadelphia, PA, USA. ; Division of Thoracic Surgery, Toronto General Hospital, University Health Network, Toronto, Ontario, Canada. ; Surgical Artificial Intelligence Research Academy, University Health Network, Toronto, ON, Canada.
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
AI总结 Slot-BERT通过双向长距离模型在手术视频中实现自监督的对象发现,提升时间一致性和跨领域适应能力。
Comments Accepted to Medical Image Analysis Journal, 2026
ChronusOmni: 提升 Omni 大语言模型的时间感知能力
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光荣人工智能学院) ; Baichuan Inc.(百川科技公司)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
AI总结 ChronusOmni 通过增强时间感知能力,提升音频视觉时间定位任务的性能,实现跨模态统一建模和细粒度推理。
Comments Code available at https://github.com/YJCX330/Chronus/
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments ICCV2025
机构 * Computer Science Engineering(计算机科学与工程) ; Hindustan Institute of Technology and Science(印度恒河理工学院与科学研究院)
专题命中 长视频与时序推理 :text-to-video(abstract);分类 cs.CV、cs.MM
Comments 10 pages, seven figures about Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments Accepted by ACM MM 2021
机构 * National University of Singapore(新加坡国立大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments Accepted to SIGIR'25
专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments 24 pages
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
Comments 11 pages, 9 figures, accepted for presentation at IEEE VIS 2022, will be published in conference proceedings, supplementary material and more can be found on our project page at https://fw.cs.wwu.edu/~wehrwes/TemporalPyramids
专题命中 长视频与时序推理 :long video(abstract);分类 eess.IV、cs.MM
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments Accepted as a spotlight presentation for the BMVC 2022. Code: https://github.com/v-iashin/SparseSync Project page: https://v-iashin.github.io/SparseSync
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
Comments 9 pages, 8 figures
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、eess.IV
专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.CV、eess.IV
Comments accepted for IEEE ISM Conference, 2019
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV、cs.MM
Comments To appear in WACV 2018
SAM2Dual:用于长期视频目标分割的无训练双内存机制
机构 * Chung-Ang University(中央大学)
专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV
AI总结 本文针对长期视频目标分割的误差累积问题,提出无训练即插即用的SAM2Dual,通过双内存设计与文本感知内存提升长视频鲁棒性,在MOSEv2、LVOSv2基准上取得性能提升。
ODEWorld:一种基于物理时间流的连续预测架构
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Berkeley Artificial Intelligence Research (BAIR), University of California, Berkeley(加州大学伯克利分校伯克利人工智能研究院(BAIR))
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 研究针对现有世界建模机器学习范式局限于离散时间预测的问题,提出基于PT-Flow的连续时间潜在世界模型ODEWorld,解决表示崩溃问题,在视频生成和机器人控制任务中表现出色。
Avatar-Forever:用于高质量实时无限虚拟形象的解耦并行训练
机构 * The Hong Kong Polytechnic University(香港理工大学) ; ByteDance(字节跳动) ; AMD(超威半导体公司)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 Avatar-Forever是一种解耦并行训练框架,通过双分支设计与ForeverCache机制,在单张H100 GPU上实现27.2 FPS的768x512音频驱动无限虚拟形象生成,保障质量与效率,推进稳定数字人研究。
Vorch-Streamer:将人类音视频生扩展至实时长格式流式生成
机构 * Vorch Team(Vorch团队) ; Tongji University(同济大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 长视频与时序推理 :video generation(abstract);分类 cs.CV
AI总结 Vorch-Streamer是一款后训练框架,通过混合训练、自强制与DMD蒸馏等技术,实现了超24 FPS的实时长格式T2AV流式音视频生成,兼具音唇同步性与身份保留能力。
Comments Project page: https://vorch-project.github.io/Vorch-Streamer-project/
ChronoVision:基于潜在状态重构的时序推理
专题命中 长视频与时序推理 :video reasoning(abstract);分类 cs.CV
AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。