arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Kuaishou(快手)

2026-03-25 至 2026-03-25 共收录 2
2603.19643 2026-03-25 cs.CV cs.AI

OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework

OmniDiT:将扩散变换器扩展到Omni-VTON框架

Weixuan Zeng, Pengcheng Wei, Huaiqing Wang, Boheng Zhang, Jia Sun, Dewen Fan, Lin HE, Long Chen, Qianqian Gan, Fan Yang, Tingting Gao

机构 * The Chinese University of Hong Kong, ShenZhen(香港中文大学(深圳)) Beihang University(北京航空航天大学) KuaiShou(快手)

AI总结 本文提出OmniDiT框架,通过自进化数据采集管道构建大规模VTON数据集,结合多参考条件和Shifted Window Attention提升生成质量,在复杂场景中实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03405 2026-03-25 cs.CV

ViDiC: Video Difference Captioning

ViDiC:视频差异描述

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) Kling Team, Kuaishou Technology(快手科技Kling团队)

AI总结 本文提出ViDiC任务及ViDiC-1K数据集,旨在评估多模态大语言模型对视频对相似性与差异性的细粒度描述能力,揭示现有模型在比较描述和差异感知上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏