OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta AI
AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。
作者
Robotics
OTTER: 一种具有文本感知视觉特征提取的视觉-语言-动作模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Meta AI
AI总结 OTTER通过文本感知的视觉特征提取,提升视觉-语言-动作模型的零样本泛化能力。