DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary
DISPLAY:通过稀疏运动引导和多任务辅助实现可直接控制的人机交互视频生成
机构 * Baidu Inc.(百度公司)
AI总结 DISPLAY通过稀疏运动引导和多任务辅助训练,实现高保真且可控的人机交互视频生成。
大厂专区
DISPLAY:通过稀疏运动引导和多任务辅助实现可直接控制的人机交互视频生成
机构 * Baidu Inc.(百度公司)
AI总结 DISPLAY通过稀疏运动引导和多任务辅助训练,实现高保真且可控的人机交互视频生成。
识别协同场景文本编辑
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Peng Cheng Laboratory(鹏城实验室) ; Tencent(腾讯) ; Department of Computer Vision Technology, Baidu Inc.(百度公司计算机视觉技术部门)
AI总结 RS-STE通过整合文本识别与编辑的协同效应,提出了一种统一框架,实现高效且一致的场景文本编辑,提升了复杂场景下的性能。
Comments accepted by CVPR2025