arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-05-15 至 2026-05-15 共收录 3
2605.15185 2026-05-15 cs.CV cs.AI

Quantitative Video World Model Evaluation for Geometric-Consistency

几何一致性定量视频世界模型评估

Jiaxin Wu, Yihao Pi, Yinling Zhang, Yuheng Li, Xueyan Zou

机构 * Tsinghua University - IEI Lab(清华大学-IEI实验室) UW-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究院)

AI总结 本文提出PDI-Bench框架,通过分割与点跟踪获取物体中心观测,利用单目重建获取3D坐标,计算投影几何残差以评估生成视频的几何一致性,揭示视频生成器的特定失败模式。

Comments 12 pages, 5 figures. Project page : https://pdi-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15181 2026-05-15 cs.CV

From Plans to Pixels: Learning to Plan and Orchestrate for Open-Ended Image Editing

从计划到像素:学习计划与协调以实现开放性图像编辑

Anirudh Sundara Rajan, Krishna Kumar Singh, Yong Jae Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

AI总结 本文提出一种长期视图图像编辑框架,通过规划器生成结构化原子分解和协调器选择工具和区域执行每一步,结合视觉语言判断者提供基于结果的奖励,提升编辑的连贯性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11042 2026-05-15 cs.CV cs.AI cs.LG cs.MM cs.SD

V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation

V2M-Zero:零配对时间对齐视频到音乐生成

Yan-Bo Lin, Jonah Casebeer, Long Mai, Aniruddha Mahapatra, Gedas Bertasius, Nicholas J. Bryan

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

AI总结 V2M-ZERO通过解耦的时间同步和语义控制生成与视频事件时间对齐的音乐,无需训练数据,实现更高质量的音频生成和语义对齐。

Comments Project page: https://genjib.github.io/v2m_zero/

详情

展开后加载摘要…

URL PDF HTML 收藏