SPOC: Spatially-Progressing Object State Change Segmentation in Video
SPOC: 视频中空间性推进的对象状态变化分割
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 SPOC提出空间性推进的对象状态变化分割任务,通过伪标签和动态约束方法,解决视频中对象变化位置和速度的精确定位问题。
Comments Accepted at WACV 2026
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
SPOC: 视频中空间性推进的对象状态变化分割
专题命中 视频理解 :video understanding(abstract);分类 cs.CV
AI总结 SPOC提出空间性推进的对象状态变化分割任务,通过伪标签和动态约束方法,解决视频中对象变化位置和速度的精确定位问题。
Comments Accepted at WACV 2026
RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV
AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。
ACD: 通过注意力监督实现视频扩散模型的直接条件控制
机构 * Sun Yat-sen University(中山大学) ; Yonsei University(延世大学) ; Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era人工智能实验室)
专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV
AI总结 ACD通过注意力监督实现视频扩散模型的直接条件控制,引入稀疏3D-aware对象布局和专用布局控制网络,提升视频生成的可控性和一致性。
大规模扩散模型中的数据正则化强化学习
机构 * Stanford University(斯坦福大学) ; NVIDIA ; Tsinghua University(清华大学)
专题命中 视频扩散模型 :video generation(abstract)
AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。