KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models
机构 * ETRI(韩国科学技术院)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * ETRI(韩国科学技术院)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; New Laboratory of Pattern Recognition (NLPR), CASIA(中国科学院自动化所模式识别新实验室) ; State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), CASIA(中国科学院多模态人工智能系统国家重点实验室) ; Hong Kong Institute of Science & Innovation, CASIA(中国科学院香港创新科学研究院) ; PolyU ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学计算机科学系) ; Army Research Laboratory(陆军研究实验室) ; Sony AI(索尼人工智能)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Conference on Robot Learning (CoRL) 2025 Project site: https://amrl.cs.utexas.edu/ComposableNav/
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by 2025 Recsys EARL Workshop
机构 * NICS-EFC Lab, Department of Electronic Engineering, Tsinghua University(清华大学电子工程系NICS-EFC实验室) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) ; Infinigence AI ; Tsinghua University(清华大学) ; Zhongguancun Academy(中关村学院)
专题命中 GUI与屏幕智能体 :visual language model(abstract);分类 cs.AI、cs.LG
Comments 13 pages, 5 figures, Accepted by EMNLP 2025 (main conference)
机构 * Lionrock AI Lab(狮岩人工智能实验室) ; China Merchants Research Institute of Advanced Technology(中国商人先进科技研究院)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI