arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1308 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1308 篇

2311.01567 2023-11-06 cs.CV 57%

Exploring the Hyperparameter Space of Image Diffusion Models for Echocardiogram Generation

Hadrien Reynaud, Bernhard Kainz

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments MedNeurIPS 2023 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11497 2023-10-19 cs.CV 57%

FreeU: Free Lunch in Diffusion U-Net

Chenyang Si, Ziqi Huang, Yuming Jiang, Ziwei Liu

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Method update: we proposed structure-based scaling to enhance the performance of FreeU. Project page: https://chenyangsi.top/FreeU/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14108 2023-10-13 cs.CV 57%

3DDesigner: Towards Photorealistic 3D Object Generation and Editing with Text-guided Diffusion Models

Gang Li, Heliang Zheng, Chaoyue Wang, Chang Li, Changwen Zheng, Dacheng Tao

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Submitted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14073 2023-08-04 cs.CV 57%

VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet

Zhihao Hu, Dong Xu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03396 2023-08-01 cs.CV 57%

Diffused Heads: Diffusion Models Beat GANs on Talking-Face Generation

Michał Stypułkowski, Konstantinos Vougioukas, Sen He, Maciej Zięba, Stavros Petridis, Maja Pantic

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11743 2023-06-21 cs.CV cs.LG 57%

SinFusion: Training Diffusion Models on a Single Image or Video

Yaniv Nikankin, Niv Haim, Michal Irani

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project Page: https://yanivnik.github.io/sinfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04001 2023-05-24 cs.CV cs.AI 57%

AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion

Seungwoo Lee, Chaerin Kong, Donghyeon Jeon, Nojun Kwak

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments CVPR2023 Workshop on AI for Content Creation. Project Page: https://lifrary.github.io/AADiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00235 2022-12-02 cs.CV 57%

VIDM: Video Implicit Diffusion Models

Kangfu Mei, Vishal M. Patel

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments AAAI2023 https://kfmei.page/vidm/

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.04403 2019-01-17 cs.CV cs.LG 57%

Label Denoising with Large Ensembles of Heterogeneous Neural Networks

Pavel Ostyakov, Elizaveta Logacheva, Roman Suvorov, Vladimir Aliev, Gleb Sterkin, Oleg Khomenko, Sergey I. Nikolenko

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1303.5913 2013-03-26 cs.CV cs.LG cs.RO stat.ML 57%

A Diffusion Process on Riemannian Manifold for Visual Tracking

Marcus Chen, Cham Tat Jen, Pang Sze Kim, Alvina Goh

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18804 2026-08-10 stat.ML cs.LG math.ST stat.TH 版本更新 50%

Convergence of Diffusion Models Under the Manifold Hypothesis in High-Dimensions

高维流形假设下扩散模型的收敛性

Iskander Azangulov, George Deligiannidis, Judith Rousseau

专题命中 视频扩散模型 :video generation(abstract)

AI总结 该研究在流形假设下证明 DDPM 的分数学习和采样复杂度均实现与高维 ambient 空间维度无关的速率,通过建立扩散模型与高斯过程极值理论的新框架完成,解释了其经验成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 50%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15846 2026-07-20 cs.AR 新提交 50%

DSTAR: Accelerating Diffusion Transformers via Spatial and Temporal Redundancy Reduction

DSTAR:通过减少空间和时间冗余加速扩散变换器

Chi Zhang, Jieru Zhao, Yu Feng, Chen Zhang, Quan Chen, Minyi Guo

专题命中 视频扩散模型 :video generation(abstract)

AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21210 2026-07-01 cs.LG cs.CE 版本更新 50%

Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows

预训练视频模型作为可微物理模拟器用于城市风流

Janne Perini, Rafael Bischof, Moab Arar, Ayça Duran, Michael A. Kraus, Siddhartha Mishra, Bernd Bickel

机构 * ETH Zurich(苏黎世联邦理工学院) Tel Aviv University(特拉维夫大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出WinDiNet,一种预训练视频扩散模型,用于快速模拟城市风流,通过反向传播优化建筑布局以提升风安全性和行人舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11025 2026-06-30 cs.LG 新提交 50%

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Flow-DPPO:用于流匹配模型的散度近端策略优化

Bowen Ping, Xiangxin Zhou, Penghui Qi, Minnan Luo, Liefeng Bo, Tianyu Pang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent Hunyuan(腾讯混元) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 50%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19163 2026-06-18 cs.DC 新提交 50%

Pulse: Training Acceleration for Large Diffusion Models with Automatic Pipeline Parallelism

Pulse: 面向大规模扩散模型的自动流水线并行训练加速

Boran Sun, Guoyong Jiang, Lin Zhang, Chen Chen, Yuechen Tao, Zhishu Che, Jieling Yu, Shan Chang, Huaxi Gu, Fangming Liu, Bo Li

专题命中 视频扩散模型 :video generation(abstract)

AI总结 提出PULSE自动流水线并行策略,通过将跳跃连接层同设备放置、局部缓存激活值,消除跨流水线通信,结合动态规划分区器、ILP调度合成器和混合并行调优器,在通信受限硬件上实现最高2.3倍吞吐提升。

Comments Accepted by International Conference on Distributed Computing Systems(ICDCS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17566 2026-06-17 cs.DC cs.LG 新提交 50%

AoiZora: Topology-Aware Auto-Parallel Optimization for Inference of Diffusion Transformers

AoiZora: 面向扩散变换器推理的拓扑感知自动并行优化

Kaijian Wang, Yuanyuan Xu, Fanjiang Ye, Ye Cao, Jingwei Zuo, T. S. Eugene Ng, Yarong Mu, Yuke Wang

机构 * Rice University(里士大学) Independent Researcher(独立研究者) Google(谷歌)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 针对扩散变换器推理中的低延迟需求,提出AoiZora编译器,通过拓扑感知的物理布局优化自动并行策略,在TPU子片上实现高达1.42倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14988 2026-06-16 cs.GR 新提交 50%

Toward Richer Material Generation via Procedural Data Enhancement

通过程序化数据增强实现更丰富的材质生成

Yunchen Yu, Jacob Munkberg, Jon Hasselgren, Chris Cummings, Steve Marschner, Andrea Weidlich

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出一种程序化数据增强方法,将简单PBR材质的单瓣GGX镜面反射扩展为多层模型,以捕获更丰富的非漫反射效果,并通过神经材质编码和扩散模型生成实现更丰富的材质生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01205 2026-06-09 cs.RO 版本更新 50%

ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning

ImagineUAV:通过世界-动作建模和动力学规划实现空中视觉语言导航

Xuchen Liu, Jiawei Huang, Shihao Xia, Bingxi Liu, Jinqiang Cui, Jiankun Yang

机构 * Pengcheng Laboratory(鹏城实验室) School of Computer Science and Cyber Engineering(计算机科学与网络工程学院) Guangzhou University(广州大学) Southern University of Science and Technology(南方科技大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 针对无人机视觉语言导航中几何不一致和动力学失配问题,提出基于潜视频扩散模型的世界-动作建模框架,通过生成未来观测推断6自由度运动并规划无碰撞轨迹,以1.3B参数在基准和实际飞行中超越先前方法。

Comments Video demo: https://www.youtube.com/watch?v=Ng1alP0yhc0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29864 2026-05-29 cs.RO 50%

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

LLM引导的未来假设用于多步机器人操作中的视野感知探索

Mohammad Khoshnazar, Andrew Melnik, Michael Beetz

机构 * Institute of Artificial Intelligence, University of Bremen(人工智能研究所,不莱梅大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出未来经验条件化(FEC)框架,利用LLM生成短期未来视频作为结构化先验,结合行为克隆和强化学习微调,提升多步机器人操作中的探索和策略适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17119 2026-05-25 cs.LG cs.AI 50%

Diffusion and Flow Matching Models for Tabular Data: A Survey

表格数据的扩散与流匹配模型:综述

Zhong Li, Qi Huang, Lincen Yang, Jiayang Shi, Zhao Yang, Niki van Stein, Thomas Bäck, Matthijs van Leeuwen

机构 * Great Bay University(大湾大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) LIACS, Leiden University(莱顿大学LIACS)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文系统综述了扩散模型和流匹配模型在表格数据生成、缺失值填补、可信数据生成和异常检测等任务中的应用,分析了数据工程挑战、设计选择、评估维度及开放问题。

Comments We substantially updated the previous version "Diffusion Models for Tabular Data: Challenges, Current Progress, and Future Directions" by including flow matching models for tabular data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03924 2026-05-20 cs.LG cs.AI physics.ao-ph 50%

WIND: Weather Inverse Diffusion for Zero-Shot Atmospheric Modeling

WIND:用于零样本大气建模的天气反向扩散

Michael Aich, Andreas Fürst, Florian Sestak, Carlos Ruiz-Gonzalez, Niklas Boers, Johannes Brandstetter

机构 * Munich Climate Center(慕尼黑气候中心) Earth System Modelling Group, TUM School of Engineering(地球系统建模组,技术大学工程学院) Design, Technical University of Munich, Germany(设计,慕尼黑技术大学,德国) ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz, Austria(ELLIS单元,LIT人工智能实验室,机器学习研究所,JKU林茨,奥地利) Emmi AI GmbH, Linz, Austria(Emmi AI GmbH,林茨,奥地利) Potsdam Institute for Climate Impact Research, Potsdam, Germany(波茨坦气候影响研究所,波茨坦,德国) Department of Mathematics, University of Exeter, Exeter, United Kingdom(数学系,埃克塞特大学,埃克塞特,英国)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出WIND,一种统一的预训练基础模型,能够无需任务特定微调即可替代各种任务的专用基线,通过自监督视频重建目标预训练,实现了对大气的鲁棒、任务无关的先验学习,从而解决天气和气候问题,如概率预报、空间时间降尺度、从稀疏观测重建空间场以及强制全球干空气质量守恒。

Comments Published at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21893 2026-05-19 cs.LG cs.AI 50%

SIPO: Stabilized and Improved Preference Optimization for Aligning Diffusion Models

SIPO: 用于对齐扩散模型的人类偏好优化的稳定与改进方法

Xiaomeng Yang, Mengping Yang, Junyan Wang, Zhijian Zhou, Zhiyu Tan, Hao Li

机构 * Shanghai Science and Intelligence Institute, Shanghai, China(上海科学与智能研究所) Fudan University, Shanghai, China(复旦大学) Australian Institute for Machine Learning, The University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本研究提出SIPO框架,通过时间步感知的重要性重新加权和梯度稳定技术,解决扩散模型对齐中训练不稳定和策略偏差问题,提升了对齐效果和稳定性。

Comments This version supplements with more detailed content on reasoning and proof, additional experimental results, and ablation studies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07322 2026-05-08 cs.RO cs.AI 50%

Action-to-Action Flow Matching

动作到动作流匹配

Jindou Jia, Gen Li, Xiangyu Chen, Tuo An, Yuxuan Hu, Jingliang Li, Xinying Guo, Jianfei Yang

机构 * MARS Lab, Nanyang Technological University(南洋理工大学MARS实验室)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出A2A方法,通过利用前一动作的本体感知信息进行初始化,避免了随机噪声采样带来的高延迟问题,提升了动作生成的效率和鲁棒性。

Comments 20 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27871 2026-05-01 cs.GR 50%

D-Rex : Diffusion Rendering for Relightable Expressive Avatars

D-Rex:基于扩散的可重新照明表达性人体虚拟角色

Timo Teufel, Xilong Zhou, Umar Iqbal, Jan Kautz, Marc Habermann, Vladislav Golyanik, Christian Theobalt

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 D-Rex提出一种人特定框架,实现真实感、可重新照明、表达性和可动画化的全身体虚拟角色,通过图像空间后处理实现与虚拟角色建模的解耦,优于基于物理的可重新照明虚拟角色基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27443 2026-05-01 cs.LG cs.AI 50%

ABC: Any-Subset Autoregression via Non-Markovian Diffusion Bridges in Continuous Time and Space

ABC:通过非马尔可夫扩散桥实现连续时间和空间中的任意子集自回归

Gabe Guo, Thanawat Sornwanee, Lutong Hao, Elon Litman, Stefano Ermon, Jose Blanchet

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ABC模型,通过非马尔可夫扩散桥在连续时间和空间中实现任意子集的自回归,解决了传统方法在结构相似性捕捉、噪声注入和条件化任意子集方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19683 2026-04-23 cs.RO 50%

Mask World Model: Predicting What Matters for Robust Robot Policy Learning

遮罩世界模型:为鲁棒机器人策略学习预测重要的内容

Yunfan Lou, Xiaowei Chi, Xiaojie Zhang, Zezhong Qian, Chengxuan Li, Rongyu Zhang, Yaoxu Lyu, Guoyu Song, Chuyao Fu, Haoxuan Xu, Pengwei Wang, Shanghang Zhang

机构 * Peking University, Beijing, China State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University Beijing Academy of Artificial Intelligence, Beijing, China National University of Singapore, Singapore The Hong Kong University of Science Nanjing University, Nanjing, China

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出Mask World Model,通过预测语义遮罩而非像素,提升机器人策略学习的鲁棒性与泛化能力,实验证明其在仿真和现实任务中均优于现有方法。

Comments 16 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18611 2026-04-21 cs.LG cs.AI 50%

Flow marching for a generative PDE foundation model

基于生成PDE基础模型的流推进

Zituo Chen, Sili Deng

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出Flow Marching算法,结合物理动力学误差分析,构建生成PDE基础模型,通过联合采样噪声和时间步长,学习统一速度场以减少长期漂移并实现不确定性感知的生成。同时引入P2VAE和FMT提升效率,实现大规模预训练。

Comments This work has been substantially expanded and superseded by arXiv:2602.11229

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04335 2026-04-10 cs.DC 50%

GENSERVE: Efficient Co-Serving of Heterogeneous Diffusion Model Workloads

GENSERVE:高效共服务异构扩散模型工作负载

Fanjiang Ye, Zhangke Li, Xinrui Zhong, Ethan Ma, Russell Chen, Kaijian Wang, Jingwei Zuo, Desen Sun, Ye Cao, Triston Cao, Myungjin Lee, Arvind Krishnamurthy, Yuke Wang

专题命中 视频扩散模型 :text-to-video(abstract)

AI总结 GENSERVE通过利用扩散过程的可预测性,优化共服务效率,解决异构工作负载下的延迟SLA问题,实验表明其在多种配置下将SLA达成率提升44%。

详情

展开后加载摘要…

URL PDF HTML 收藏