Galaxea Open-World Dataset and G0 Dual-System VLA Model
机构 * Galaxea Team(Galaxea 团队)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments https://opengalaxea.github.io/G0/
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Galaxea Team(Galaxea 团队)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments https://opengalaxea.github.io/G0/
机构 * Nanyang Technological University(南洋理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments Project website is at: https://denghaoyuan123.github.io/SafeBimanip/
机构 * Beihang University(北京航空航天大学) ; Sangfor Technologies Inc.(深信服科技有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by ACM MM 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Beijing University of Technology(北京理工大学) ; Chinese Academy of Sciences(中国科学院) ; Capital Medical University(首都医科大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University and Key Laboratory of System Control and Information Processing, Ministry of Education of China(自动化与智能感知学院,上海交通大学;系统控制与信息处理重点实验室,中华人民共和国教育部)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract);分类 cs.LG
机构 * Emineo Private Hospital(埃米尼欧私人医院)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments The paper has been submitted to a journal and waiting for review
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA Research(NVIDIA研究)
专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.AI
机构 * Department of Multimedia Systems, National University of Kyiv-Mohyla Academy, Kyiv, Ukraine(多媒体系统系,基辅-莫希拉学院国家大学,乌克兰基辅) ; Department of Mathematics, National University of Kyiv-Mohyla Academy, Kyiv, Ukraine(数学系,基辅-莫希拉学院国家大学,乌克兰基辅)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Submitted to ICTERI 2024 Posters Track
Journal ref ICTERI 2024: Communications in Computer and Information Science, vol. 2020, pp. 370-381, Springer, 2025
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院) ; CUHK(香港中文大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * New York University(纽约大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments Under review
机构 * H Company(H公司)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments Alphabetical order
机构 * Fudan University(复旦大学) ; ShanghaiTech University(上海科技大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.AI
机构 * Physical Intelligence
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.LG
机构 * State Key Laboratory of Intelligent Game(智能游戏国家重点实验室) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments This work has been submitted for possible publication
机构 * MiLAB, Westlake University, Hangzhou, 310030, China(西交利物浦大学微实验室,杭州,310030,中国) ; Zhejiang University, Hangzhou, 310027, China(浙江大学,杭州,310027,中国) ; Beijing University of Posts and Telecommunications, Beijing, 100876, China(北京邮电大学,北京,100876,中国)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted to ICRA 2025; Github page: https://quart-online.github.io
机构 * vivo AI Lab(vivo人工智能实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.AI
Comments Updated UI-R1-E-3B
机构 * Warsaw University of Technology(华沙技术大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);MLLM(abstract);分类 cs.AI
Comments Accepted to Interspeech 2025
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; School of Computer Science & Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)
专题命中 GUI与屏幕智能体 :vision language model(abstract);VLM(abstract);分类 cs.AI
Comments 10 pages. Submitted to EMNLP 2025
机构 * Northwestern Polytechnical University(西北工业大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments Accepted by FSE 2025
专题命中 GUI与屏幕智能体 :vision language model(abstract);grounding(abstract);分类 cs.CV
Comments Paper accepted to CVPR 2025
专题命中 GUI与屏幕智能体 :grounding(abstract);MLLM(abstract);分类 cs.AI
Comments ICLR 2025 Spotlight
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 GUI与屏幕智能体 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :vision-language model(abstract);grounding(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments Accept to CVPR 2025, Project page: https://cybertronagent.github.io/Optimus-2.github.io/