arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-09-01 至 2026-09-01 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 5 篇

2608.29598 2026-09-01 cs.LG 新提交 88%

On the Resilience of Text-to-Video Diffusion Models to Hardware Faults

文本到视频扩散模型对硬件故障的鲁棒性研究

Zachary Coalson, A M Aahad, Stella Doehring, Zane Ma, Sanghyun Hong

机构 * Oregon State University(俄勒冈州立大学)

专题命中 视频扩散模型 :text-to-video(title,abstract);video diffusion(title);video generation(abstract)

AI总结 本研究首次系统性探究文本到视频(T2V)扩散模型对硬件故障的鲁棒性,发现单个故障可降低性能、改变语义,内存故障危害更大,揭示了已部署T2V系统的可靠性风险。

Comments Accepted to ICML 2026 Workshop on From Frames to Stories (F2S)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29322 2026-09-01 cs.CV 新提交 79%

Test-Time Scaling for Video Diffusion Models via Diagnosis-Guided Candidate Recycling

基于诊断引导候选回收的视频扩散模型测试时缩放

Hangzhou He, Lunhao Duan, Shanshan Zhao, Kaiwen Li, Qing-Guo Chen, Weihua Luo, Yanye Lu

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频扩散模型测试时缩放的“生成-丢弃”范式缺陷,提出无需训练的 GEARS 框架,通过阶段感知调度器与候选回收器提升轻量模型性能,在 VBench 上使 13 亿参数模型得分接近 140 亿参数模型。

Comments Accepted by ACM TOG (SIGGRAPH Asia 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20308 2026-09-01 cs.CV 版本更新 79%

ACE-Ego-Hand: Repurposing Video Diffusion Models for Occlusion-Robust Egocentric 3D Hand Motion Recovery

DreamHand:复用视频扩散模型实现遮挡鲁棒的第一人称视角3D手部运动恢复

Yufei Liu, Xixi Wang, Hao Li, Ganlong Zhao, Kaitong Cai, Chengkai Jin, Chunxiao Liu, Jianbo Liu, Siyuan Huang, Xingang Pan, Hongsheng Li

机构 * ACE Robotics(ACE机器人公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 DreamHand是复用视频扩散模型的离线片段级框架,通过确定性干净潜在编码器与双向时空解码器恢复带度量位置的连续双手轨迹,在五个第一人称视角基准测试中实现最佳性能,为机器人操作数据提供可扩展路径。

Comments Project Page: https://ggxxii.github.io/ace-ego-hand

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-09-01 cs.CV cs.AI cs.RO 版本更新 79%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

Comments v2:Expanded the experiment section with more baselines and add more experiments in supplementary--corrected some typographical errors, and corrected author-affiliation information that was inaccurate in the previous version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28670 2026-09-01 cs.CV 新提交 57%

Memory-Efficient Training-Free Acceleration of Diffusion Transformers with BaryCache

基于BaryCache的内存高效无训练扩散Transformer加速方法

Chengjie Lu, Tianchi Deng, Zhengqi He, Zhijian Gao, Huisi Wu, Xueliang Li

机构 * College of Electronics and Information Engineering, Shenzhen University(深圳大学电子与信息工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本研究提出无训练加速方法BaryCache,采用重心外推器缓解扩散Transformer采样的振荡伪影,在图像与视频生成中实现最高3.30倍采样加速,兼顾内存与感知质量。

Comments Accepted by ICITES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏