Reflection Generation for Composite Image Using Diffusion Model
基于扩散模型的复合图像反射生成
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出通过扩散模型生成复合图像中反射的方法,引入反射位置和外观先验信息,构建首个大规模物体反射数据集DEROBA,实现物理一致且视觉真实的反射生成。
高校专区
基于扩散模型的复合图像反射生成
机构 * Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出通过扩散模型生成复合图像中反射的方法,引入反射位置和外观先验信息,构建首个大规模物体反射数据集DEROBA,实现物理一致且视觉真实的反射生成。
LatentUM:通过潜在空间统一模型释放交错跨模态推理的潜力
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学)
AI总结 本文提出LatentUM,通过共享语义潜在空间实现跨模态推理与生成,提升计算效率并减少编码器偏差,取得视觉空间规划基准的最优性能。
PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; BAAI(北京智源人工智能研究院) ; SJTU(上海交通大学) ; Eastern Institute of Technology(东方理工高等研究院) ; University of Cambridge(剑桥大学)
AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。
Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM
通过可行动作邻域先验提升视觉-语言-动作微调
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Technologies(华为技术有限公司)
AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。
Comments Accepted by CVPR 2026
手机使用代理是否尊重您的隐私?
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Shanghai Jiao Tong University(上海交通大学) ; Hunyuan Team, Tencent(腾讯混元团队)
AI总结 研究手机使用代理在完成良性移动任务时是否尊重隐私,通过MyPhoneBench框架评估隐私行为,发现任务成功率、隐私合规完成和后续会话偏好使用是不同能力,无单一模型主导。
Comments work in progress