arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-25 至 2025-12-25 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2503.11953 2025-12-25 cs.CV 57%

SPOC: Spatially-Progressing Object State Change Segmentation in Video

SPOC: 视频中空间性推进的对象状态变化分割

Priyanka Mandikal, Tushar Nagarajan, Alex Stoken, Zihui Xue, Kristen Grauman

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 SPOC提出空间性推进的对象状态变化分割任务,通过伪标签和动态约束方法,解决视频中对象变化位置和速度的精确定位问题。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 1 篇

2512.02622 2025-12-25 cs.CV 83%

RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence

RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能

Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, Boxi Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2512.21268 2025-12-25 cs.CV 83%

ACD: Direct Conditional Control for Video Diffusion Models via Attention Supervision

ACD: 通过注意力监督实现视频扩散模型的直接条件控制

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Yonsei University(延世大学) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 ACD通过注意力监督实现视频扩散模型的直接条件控制,引入稀疏3D-aware对象布局和专用布局控制网络,提升视频生成的可控性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04332 2025-12-25 cs.LG 50%

Data-regularized Reinforcement Learning for Diffusion Models at Scale

大规模扩散模型中的数据正则化强化学习

Haotian Ye, Kaiwen Zheng, Jiashu Xu, Puheng Li, Huayu Chen, Jiaqi Han, Sheng Liu, Qinsheng Zhang, Hanzi Mao, Zekun Hao, Prithvijit Chattopadhyay, Dinghao Yang, Liang Feng, Maosheng Liao, Junjie Bai, Ming-Yu Liu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学) NVIDIA Tsinghua University(清华大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 DDRL通过数据正则化方法提升扩散模型的奖励表现,有效缓解奖励黑客问题,实现高分辨率视频生成中的高人偏好和可扩展训练。

详情

展开后加载摘要…

URL PDF HTML 收藏