VL-JEPA: Joint Embedding Predictive Architecture for Vision-language
VL-JEPA:面向视觉-语言的联合嵌入预测架构
机构 * Meta FAIR ; HKUST(香港科技大学) ; Sorbonne Université(索邦大学) ; NYU(纽约大学)
AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。
作者
Deep Learning / Vision
VL-JEPA:面向视觉-语言的联合嵌入预测架构
机构 * Meta FAIR ; HKUST(香港科技大学) ; Sorbonne Université(索邦大学) ; NYU(纽约大学)
AI总结 VL-JEPA通过联合嵌入预测架构,在减少参数的情况下实现更强的视觉-语言性能,支持多种任务且无需架构修改。
并行随机梯度规划用于世界模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta FAIR ; New York University(纽约大学)
AI总结 GRASP是一种基于世界模型的并行随机梯度规划方法,通过引入随机性和软约束,有效解决长时间跨度的控制任务,优于现有规划算法。
Comments 23 pages, 7 figures