VideoNSA: Native Sparse Attention Scales Video Understanding
VideoNSA:原生稀疏注意力扩展视频理解
专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化
Comments ICLR 2026
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
VideoNSA:原生稀疏注意力扩展视频理解
专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV
AI总结 VideoNSA通过端到端训练提升视频理解,结合原生稀疏注意力实现长视频和时间推理的性能优化
Comments ICLR 2026
少即是多:基于标签的程序性和教学视频摘要
机构 * University of Tübingen(图宾根大学) ; Vellore Institute of Technology(维洛雷理工学院) ; Brown University(布朗大学)
专题命中 视频理解 :long video(abstract);分类 cs.CV
AI总结 PRISM提出了一种基于标签的视频摘要方法,通过集成语义和多模态分析,生成语义准确且上下文连贯的摘要,有效提升摘要质量。
Comments 22 pages, 6 figures
超越修复:释放3D理解以实现精确的相机控制视频生成
机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(BNRist,计算机科学与技术系,清华大学)
专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV
AI总结 DepthDirector通过双流条件机制和LoRA适配器实现精确摄像机控制,提升视频生成的3D理解和视觉质量。
Comments Project page: https://eleanor6725.github.io/DepthDirector/
FlashVideo: 为高效高分辨率视频生成实现流畅的细节保真度
机构 * The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学) ; ByteDance(字节跳动)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 FlashVideo通过两阶段框架在高效高分辨率视频生成中实现流畅细节保真度,优化计算效率并提升商业应用潜力。
Comments Model and Weight: https://github.com/FoundationVision/FlashVideo
熵引导的k-guard采样用于长 Horizon 自回归视频生成
机构 * Nanjing University(南京大学) ; Horizon Robotics ; China Mobile(中国移动)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 熵引导的k-guard采样用于长Horizon自回归视频生成,通过自适应调整令牌候选集大小以提升视频生成的质量和稳定性。
身份保持的多人类视频生成优化:通过强化学习进行优化
机构 * Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学)
专题命中 视频生成 :video generation(title,abstract);分类 cs.CV
AI总结 Identity-GRPO通过强化学习优化多人类身份保持的视频生成,显著提升一致性指标。
Comments Our project and code are available at https://ali-videoai.github.io/identity_page, https://github.com/alibaba/identity-grpo
人工智能进展:面向创意产业的综述
机构 * Visual Information Laboratory, University of Bristol, Bristol, UK(布里斯托大学视觉信息实验室)
专题命中 视频生成 :video generation(abstract)
AI总结 本文综述了自2022年以来人工智能在创意产业中的进展,探讨了生成式AI、大语言模型和扩散模型等技术对创意生产流程的影响,并分析了人类与AI协作的新趋势及面临的挑战。
Comments This is an updated review of our previous paper (see https://doi.org/10.1007/s10462-021-10039-7), and has been accepted by Artificial Intelligence Review journal
VMonarch:具有结构注意力的高效视频扩散变换器
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队)
专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV
AI总结 VMonarch通过结构化注意力机制提升视频扩散变换器的效率,减少计算量并提高处理速度。
通过低秩拒绝向量实现视频去学习
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; ItalAI ; Paradigma ; NVIDIA
专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV
AI总结 提出一种无需训练的视频扩散模型概念去除方法,通过低秩拒绝向量实现安全生成,有效减少不安全内容生成。
Triage: 分层视觉预算机制用于视觉语言模型中的高效视频推理
机构 * Huazhong University of Science and Technology(华中科技大学) ; Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)
专题命中 长视频与时序推理 :video reasoning(title,abstract);分类 cs.CV
AI总结 Triage通过分层视觉预算机制优化视频推理,提升效率并保持性能。
Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)
焦耳去哪儿了?诊断推理能耗
机构 * University of Michigan \& The ML.ENERGY Initiative
专题命中 长视频与时序推理 :video generation(abstract)
AI总结 研究通过大规模测量发现生成式AI中不同任务和硬件配置对能耗的影响差异,并提出框架解释能耗与利用率等隐含指标的关系,为优化数据中心能耗提供依据。
Comments The ML ENERGY Leaderboard v3.0 is open at https://ml.energy/leaderboard