VISUALSKILL: Multimodal Skills for Computer-Use Agents
VISUALSKILL:面向计算机使用智能体的多模态技能
机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; MIT-IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)
AI总结 提出VISUALSKILL分层多模态技能库,通过结合文档与UI探索构建,使智能体在CUA基准上平均得分提升15.3点,且多模态优于纯文本技能。