Talking Spell: A Wearable System Enabling Real-Time Anthropomorphic Voice Interaction with Everyday Objects
专题命中 视觉定位与Grounding :vision-language model(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :vision-language model(abstract)
机构 * Arizona State University(亚利桑那州立大学) ; University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)
专题命中 视觉定位与Grounding :grounding(abstract)
机构 * University of Denver(丹佛大学)
专题命中 视觉定位与Grounding :grounding(abstract)
专题命中 文档图表理解 :vision-language model(title);分类 cs.CV
Comments Accepted by EMNLP 2025 Main Conference
机构 * CSE Department, HKUST(香港科技大学计算机科学与工程系) ; Tencent AI Lab(腾讯AI实验室) ; Robotics X, Tencent(腾讯机器人实验室) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 GUI与屏幕智能体 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments EMNLP 2025
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ant Group(蚂蚁集团)
专题命中 GUI与屏幕智能体 :vision language model(title);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments 10pageV0
机构 * Galaxea Team(Galaxea 团队)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments https://opengalaxea.github.io/G0/
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
Comments Accepted to CoRL 2025. Project Page: https://gary3410.github.io/MoTo/
机构 * Meituan(美团) ; Zhejiang University(浙江大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * Institute of Parallel and Distributed Systems (IPADS)(并行与分布式系统研究所)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
机构 * University of Liverpool(利物浦大学) ; University of Exeter(埃克塞特大学) ; Purple Mountain Laboratories(紫金山实验室) ; University of Bristol(布里斯托大学)
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * Sensetime(秒氏科技)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments To be presented at SPIE: Sensors + Imaging, Artificial Intelligence for Security and Defence Applications II
机构 * Hong Kong University of Science(香港科学与技术大学) ; South China Normal University, Shanwei, Guangdong, China(华南师范大学,汕尾,广东,中国) ; Shenzhen Technology University, Shenzhen, Guangdong, China(深圳科技大学,深圳,广东,中国) ; University of Science(科学大学)
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG
机构 * Tsinghua University(清华大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; OpenRL ; Chongqing University(重庆大学)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI
专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV
Comments Preprint,Underreview
机构 * University of Maryland College Park(马里兰大学 College Park 分校) ; The Ohio State University(俄亥俄州立大学) ; National University of Singapore(新加坡国立大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
机构 * University of Manchester(曼彻斯特大学) ; Microsoft Research(微软研究院)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);LLaVA(abstract)
Comments Accepted to EMNLP 2025 Main Conference
机构 * Vocational School of Social Sciences, Marmara University(马尔马拉大学社会科学职业学校) ; Geospatial Data Science Group, School of Geographical & Earth Sciences, University of Glasgow(格拉斯哥大学地理与地球科学学院空间数据科学小组)
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI
机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) ; Cognitive AI Lab, Shanghai Huawei Technologies, China(上海华为技术有限公司认知人工智能实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by EMNLP 2025
机构 * University of Trento(特伦托大学) ; University of Bergamo(贝拉姆奥大学) ; Indian Institute of Technology Bombay(印度班加罗尔理工学院) ; LNMIIT Jaipur(斋普尔LNMIIT) ; The University of Queensland(昆士兰大学) ; Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted in ICCV 2025
机构 * The University of Adelaide(阿德莱德大学) ; Macquarie University(麦考瑞大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments 25 Pages Accepted in DICTA 2025
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV
Comments 9 pages
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * École de Technologie Supérieure (ÉTS)(École de Technologie Supérieure) ; Université Catholique de Louvain (UCLouvain)(Université Catholique de Louvain) ; Université de Mons (UMons)(Université de Mons)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * School of Computer Science, Carleton University(计算机科学学院,卡尔顿大学)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * University of Houston(德克萨斯大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Connecticut(康涅狄格大学) ; NEC Laboratories America(日本 NEC 美国实验室) ; Florida International University(佛罗里达国际大学)
专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Argonne National Laboratory(阿贡国家实验室) ; Illinois Institute of Technology(伊利诺伊理工学院)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG
Comments Accepted by ICCV Bivision Workshop 2025