Video Generation Models in Robotics -- Applications, Research Challenges, Future Directions
机器人中的视频生成模型——应用、研究挑战与未来方向
机构 * Princeton University(普林斯顿大学) ; Temple University(Temple 大学)
AI总结 本文综述了视频生成模型在机器人学中的应用、研究挑战及未来方向,探讨了其在物理模拟、动作预测和策略评估中的作用及面临的挑战。
高校专区
机器人中的视频生成模型——应用、研究挑战与未来方向
机构 * Princeton University(普林斯顿大学) ; Temple University(Temple 大学)
AI总结 本文综述了视频生成模型在机器人学中的应用、研究挑战及未来方向,探讨了其在物理模拟、动作预测和策略评估中的作用及面临的挑战。
使用双耳空间自适应神经网络(BSANN)的立体声音频渲染用于个人声音区域
机构 * Princeton University(普林斯顿大学)
AI总结 本文提出使用BSANN生成耳部优化的扬声器滤波器,以实现多听众独立的立体声音频渲染,提升空间感知和声学准确性。
Comments Submitted to IEEE Transactions on Audio, Speech, and Language Processing (TASLP)
RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调
机构 * Columbia University(哥伦比亚大学) ; Amazon(亚马逊) ; Princeton University(普林斯顿大学) ; Capital One
AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。