arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-08-31 至 2026-08-31 共收录 4 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 4 篇

2608.28404 2026-08-31 cs.CV 新提交 83%

How Far Can 5,500 Hours of Driving Take You? A Scaling Law Analysis of Video Diffusion Models

5500小时驾驶数据能带来多大提升?视频扩散模型的缩放定律分析

Victor Besnier, Anh-Quan Cao, Elias Ramzi, Spyros Gidaris, Tuan-Hung Vu, Andrei Bursuc, Eloi Zablocki, Matthieu Cord

机构 * Sorbonne Université(索邦大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本研究针对自动驾驶视频生成,通过对100万至90亿参数的视频扩散模型开展缩放定律分析,明确训练时长、模型规模、数据量的影响,训练出的90亿参数模型在nuScenes上达到开源最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27073 2026-08-31 cs.CV cs.RO 版本更新 57%

SpatialCrafter: Single Image World Modeling with Generative 3D Proxies

SpatialCrafter:基于生成式3D代理的单图像世界建模

Chuan Fang, Lingteng Qiu, Yixun Liang, Rui Chen, Kunming Luo, Zhaohua Zheng, Tongyuan Bai, Feipeng Tian, Zilong Dong, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ManyCore Tech Inc.(ManyCore科技公司) Jilin University(吉林大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 SpatialCrafter是解决图像到场景生成问题的两阶段框架,通过3D代理及相关策略提升3D一致性,构建了115K场景的新数据集,性能优于现有方法且鲁棒性强。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07572 2026-08-31 cs.CV cs.AI 版本更新 57%

BRACE: Taming Sharp Irregularities via Barycentric Rational Forecasting for Fast Diffusion Transformers Inference

BRACE:利用重心有理预测控制快速扩散Transformer推理中的尖锐不规则性

Jinlong Yang, Jinke Wu, Lizilin, Yao Zhou

机构 * Sichuan University(四川大学) School of Artificial Intelligence, Sichuan University(四川大学人工智能学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本研究针对扩散Transformer(DiTs)高加速推理时的质量下降问题,提出带切比雪夫增强的重心有理预测方法BRACE,通过特征驱动的有理预测实现最优质量-效率权衡,且计算开销极低。

Comments Accepted at ACM MM 2026. Project page: this https URL (https://youngkinlon.github.io/BRACE-Taming-Sharp-Irregularities-via-Barycentric-Rational-Forecasting-for-Fast-DiT-Inference/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27443 2026-08-31 cs.LG cs.AI 版本更新 50%

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归

Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏