Intentional Gesture: Deliver Your Intentions with Gestures for Speech
机构 * University of Rochester(罗切斯特大学) ; University of Tokyo(东京大学) ; University of Michigan(密歇根大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Rochester(罗切斯特大学) ; University of Tokyo(东京大学) ; University of Michigan(密歇根大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Washington(华盛顿大学) ; NVIDIA(NVIDIA公司) ; University of Southern California(南加州大学) ; Allen Institute for AI(人工智能研究所)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments 11 pages
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 19 pages, 12 figures, 6 tables
机构 * Embia, Computer Science Department, Faculty of Science, Université de Moncton(Embia计算机科学系,科学学院,蒙特龙大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 9 pages, 3 figures, IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)
机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Pengcheng Laboratory(鹏城实验室) ; Shandong Jianzhu University(山东建筑大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025 as a Spotlight
机构 * Department of Physics, J.K. Institute of Science(J.K.科学研究院物理系) ; World Scientific University(世界科学大学) ; University of Intelligent Studies(智能研究大学) ; East China Normal University(华东师范大学) ; Nanyang Technological University(南洋理工大学) ; SenseTime Research(商汤科技研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 17 pages, 16 figures
机构 * organization= Data Science \& Artificial Intelligence Research Institute, China Unicom , city= Beijing , postcode= 100033 , country= PR China
专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI
Comments accepted by Image and Vision Computing
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments Tech report. Project page: https://robix-seed.github.io/robix/
机构 * University of Amsterdam(阿姆斯特丹大学) ; College of Business(商学院) ; Economics, University of Johannesburg(经济系,约翰内斯堡大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Syracuse University Syracuse New York USA ; Arizona State University Tempe Arizona USA ; Scientific Systems Company, Inc. Woburn Massachusetts USA ; Department of Computer Science ; Engineering, Universidad Nacional del Sur (UNS) \& Institute for Computer Science ; Syracuse University ; Arizona State University ; Scientific Systems Company, Inc.
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
机构 * University of Science and Technology of China(中国科学技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI
Comments https://videorewardbench.github.io/
机构 * Toyota Technological Institute at Chicago (TTIC)(丰田技术研究所(芝加哥))
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments 26 Pages, 10 Figures, Technical report, Fix Typo
机构 * Brown University(布朗大学) ; University of Warwick(沃里克大学) ; Samsung US(三星美国分公司) ; Boston University(波士顿大学) ; University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; Rutgers University(罗格斯大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments COLM 2025, 30 pages, 10 figures, 16 tables
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * CMU(卡内基梅隆大学) ; WUSTL(华盛顿大学) ; UIUC(伊利诺伊大学香槟分校)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Socially Intelligent Robotics Lab, Institute for Artificial Intelligence, University of Stuttgart(社会智能机器人实验室,人工智能研究所,斯图加特大学) ; Robot Perception and Learning Lab, LAMARR Institute for Machine Learning and Artificial Intelligence, University of Bonn(机器人感知与学习实验室,LAMARR机器学习与人工智能研究所,波恩大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments Paper accepted for IROS 2025
机构 * Lenovo Research(联想研究院) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) ; Institute of Automation, CAS(中国科学院自动化研究所) ; Macau University of Science and Technology(澳门科学理工学院) ; School of Computer Science and Technology, UCAS(中国科学院大学计算机科学与技术学院)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI
Comments preprint
机构 * Key Laboratory of Network Data Science and Technology(网络数据科学与技术重点实验室) ; Institute of Computing Technology(计算技术研究所) ; Chinese Academy of Sciences(中国科学院) ; State Key Laboratory of AI Safety(人工智能安全国家重点实验室) ; University of Chinese Academy of Science(中国科学院大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments Accepted by CCIR25 and published by Springer LNCS or LNAI
机构 * Bosch Research North America(博世北美研究部) ; Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) ; Texas A&M University(德克萨斯A&M大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
机构 * Sun Yat-sen University(中山大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Shanghai Jiaotong University(上海交通大学) ; University of Hong Kong(香港大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2411.11930
机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) ; University of Trento(特伦托大学) ; Istituto Italiano di Tecnologia(意大利技术研究院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to IROS 2025. Project website: https://tev-fbk.github.io/FreeGrasp/
机构 * Durham University(杜ham大学) ; DAMO Academy, Alibaba Group(达摩院,阿里集团) ; Tsinghua University(清华大学) ; UCAS-Terminus AI Lab(北航-terminate人工智能实验室)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025 (Highlight)
机构 * Yale University(耶鲁大学) ; Hong Kong University of Science(香港科学大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments 11 Pages, SIGKDD 2025
机构 * University of West Florida(乌斯托尔大学) ; Florida Institute for Human and Machine Cognition (IHMC)(佛罗里达人类与机器认知研究所)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * UNIST(全南大学) ; NVIDIA Foundation Models Lab(NVIDIA基础模型实验室) ; MODULABS ; NAVER AI Lab(NAVER AI实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments To be presented as a poster at MMFM 2025
机构 * University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(人工智能向量研究所)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Journal ref Transactions on Machine Learning Research (TMLR), 07/2025, https://openreview.net/forum?id=Al72Fp0rCg
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Project page: https://mxllc.github.io/EmbRACE-3K/
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI-25