arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-15 至 2026-01-15 共收录 1 信号源:cs.CV, eess.IV, cs.MM

1. 动作与事件理解 1 篇

2601.09452 2026-01-15 cs.CV 57%

MAD: Motion Appearance Decoupling for efficient Driving World Models

MAD:用于高效驾驶世界模型的运动外观解耦

Ahmad Rahimi, Valentin Gerard, Eloi Zablocki, Matthieu Cord, Alexandre Alahi

机构 * Sorbonne Université(索邦大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 MAD通过解耦运动学习与外观合成,高效地将通用视频扩散模型转化为可控的驾驶世界模型,实现低计算成本和高性能

详情

展开后加载摘要…

URL PDF HTML 收藏