Maestro: Orchestrating Robotics Modules with Vision-Language Models for Zero-Shot Generalist Robots
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Comments Plan to resubmit after significant revisions
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Comments Plan to resubmit after significant revisions
机构 * Brown University(布朗大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);InternVL(abstract);分类 cs.CV
Comments Workshop on Interpreting Cognition in Deep Learning Models at NeurIPS 2025
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted by AAAI 2026
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by AAAI 2025. Hongyang Wang and Yichen Shi contribute equally. Corresponding author: Zitong Yu
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
Comments AAAI 2026
机构 * Tianyu Guo, Shanwei Zhao, Shiai Zhu, Chenguang Ma(作者)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * Department of Artificial Intelligence Convergence(人工智能融合系)
专题命中 VLM训练与架构 :LLaVA(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * German Research Centre for Artificial Intelligence (DFKI)(德国人工智能研究中心) ; Max Planck Research School for Intelligent Systems (IMPRS-IS)(马克斯·普朗克智能系统研究学校) ; University of Stuttgart(斯图加特大学) ; University Medical Center Gottingen(哥廷根大学医学中心) ; Max Planck Institute for Multidisciplinary Sciences(马克斯·普朗克多学科科学研究所) ; ARC Centre of Excellence for the Mathematical Analysis of Cellular Systems(细胞系统数学分析卓越中心) ; School of Mathematical Sciences, Queensland University of Technology(昆士兰科技大学数学科学学院) ; University of Oldenburg(奥尔登堡大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California San Diego(加州大学圣地亚哥分校) ; MBZUAI(马克斯·普朗克人工智能研究所) ; ETH Zurich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学)
专题命中 VLM训练与架构 :vision-language model(title);LLaVA(abstract);grounding(abstract);分类 cs.LG
Comments Accepted at NeurIPS 2025
机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) ; University of Twente(特文特大学) ; University of Bath(巴斯大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);grounding(abstract);分类 cs.CV
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
机构 * College of Computer Science and Technology, National University of Defense Technology, China(中国国防科技大学计算机科学与技术学院) ; Beijing University of Posts and Telecommunications, China(北京邮电大学) ; School of Computer Science, Wuhan University, China(武汉大学计算机学院) ; Zhongguancun Academy, China(中关村学院) ; Tsinghua University, China(清华大学) ; Beihang University, China(北航大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
Comments NeurlPS 2025 Spotlight
机构 * University of California, Merced(加州大学默塞德分校) ; Bytedance Seed(字节跳动种子) ; Wuhan University(武汉大学) ; Peking University(北京大学)
专题命中 VLM训练与架构 :LLaVA(title);vision-language model(abstract);MLLM(abstract);分类 cs.CV
Comments Code: https://github.com/Bytedance/Sa2VA
机构 * The Harker School(哈克尔学校) ; University of California, Merced(加州大学默塞德分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Wangxuan Institute of Computer Technology, Peking University(计算机技术研究院,北京大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025 as a spotlight
机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能MoE实验室,上海交通大学) ; Ant Group(蚂蚁集团) ; Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究所,东部技术研究所,宁波)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.LG
机构 * NVIDIA ; KAIST(韩国科学技术院) ; National Taiwan University(国立台湾大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments CVPR 2025, Project page: https://byungkwanlee.github.io/VLsI-page/
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构 * NVIDIA ; MIT(麻省理工学院) ; UC San Diego(南加州大学圣地亚哥分校) ; University of Toronto(多伦多大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments 14 pages, 7 figures
机构 * National University of Singapore(新加坡国立大学) ; University of Toronto(多伦多大学) ; Peking University(北京大学) ; Sichuan University(四川大学) ; Zhejiang University(浙江大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Journal ref Robotics: Science and Systems 2025
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯优图实验室) ; CASIA(中国科学院自动化研究所)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Homepage: https://ltbai.github.io/VITA-VLA/
机构 * University of California, Merced(加州大学梅尔德分校) ; vivo Mobile Communication Co., Ltd.(vivo移动通信有限公司) ; University of Queensland(昆士兰大学) ; UCLA(加州大学洛杉矶分校) ; University at Buffalo(布法罗大学)
专题命中 VLM训练与架构 :vision language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * CASIA(中国科学院自动化研究所) ; ByteDance Seed(字节跳动种子实验室) ; UCAS(中国科学院大学) ; FiveAges ; NJU(南京大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI
Comments NeurIPS 2025
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Tsinghua University(清华大学) ; Sensetime Research(商汤科技研究院) ; Nanjing University(南京大学)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by NeurIPS 2025. 22 pages, link: https://github.com/OpenGVLab/NaViL
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Tsinghua University(清华大学) ; InspireOmni AI ; Alibaba Group(阿里巴巴集团) ; Case Western Reserve University(凯斯西储大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV
Comments Accepted at NeurIPS 2025
机构 * Stanford University(斯坦福大学) ; NVIDIA USA(NVIDIA公司)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV