In-Context Adaptation of VLMs for Few-Shot Cell Detection in Optical Microscopy
机构 * Iowa State University(爱荷华州立大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Iowa State University(爱荷华州立大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * KAUST(卡塔尔科技大学) ; Monash University(墨尔本大学) ; RICE University(里士满大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted for oral presentation at the EMNLP 2025 main conference
机构 * MIT(麻省理工学院) ; HHMI(霍华德·休斯医学研究所) ; McGovern Institute(麦戈文研究所) ; MIT Departments of Brain and Cognitive Sciences(麻省理工学院脑科学与认知科学系)
专题命中 视觉定位与Grounding :InternVL(abstract);分类 cs.CV、cs.AI、cs.LG
Comments To appear in NeurIPS 2025 Datasets and Benchmarks Track
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 5 figure references, 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) submission
机构 * Heinrich Heine University of Düsseldorf(海因里希-海涅大学杜塞尔多夫分校)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted in WACV 2026. Code in https://github.com/HHU-MMBS/clustermine_wacv_official 9 Tables, 11 Figures
机构 * Virtual Vehicle Research GmbH(虚拟车辆研究有限公司) ; ASFINAG Maut Service GmbH(ASFINAG收费服务有限公司) ; Tongji University(同济大学)
专题命中 视觉定位与Grounding :multimodal large language model(abstract)
Comments submitted to TRA 2026
机构 * Zhejiang University(浙江大学)
专题命中 视觉定位与Grounding :grounding(abstract)
机构 * Google DeepMind(谷歌DeepMind)
专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision-language model(abstract);分类 cs.LG
Comments accepted by PRL Workshop Series @ ICAPS 2025. 11 main body pages, 21 appendix pages
机构 * Arizona State University(亚利桑那州立大学) ; Emory University(埃默里大学) ; University of California, Berkeley(加州大学伯克利分校) ; Delft University of Technology(代尔夫特理工大学) ; Algoverse AI Research(Algoverse AI 研究)
专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.CV、cs.AI、cs.LG
Comments Accepted at NeurIPS 2025 SpaVLE, for code see https://github.com/nbabey20/groundactrec , 9 pages, 1 figure
机构 * Show Lab, National University of Singapore(新加坡国立大学展示实验室)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 GUI与屏幕智能体 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Department of Cyber-Physical Systems, Clark Atlanta University(克雷克阿特拉大学计算机物理系统系) ; Siemens Corporation(西门子公司)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
Comments NAACL 2025 Demo Track [code] https://github.com/OpenDFM/MobA [dataset] https://huggingface.co/datasets/OpenDFM/MobA-MobBench
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted as a poster in AAAI 2026
机构 * Nanjing University(南京大学) ; Microsoft(微软) ; ZJU-UIUC(浙大-UIUC) ; Peking University(北京大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * Lanzhou University, China(兰州大学) ; National University of Singapore, Singapore(新加坡国立大学) ; Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院计算技术研究所) ; NExT++ Research Centre, National University of Singapore, Singapore(新加坡国立大学NExT++研究中心)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI
机构 * Faculty of Mathematics, University of Waterloo(滑铁卢大学数学系) ; The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程集团) ; Zhipu AI(智谱AI)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI
Comments 36 pages, 30 figures
专题命中 GUI与屏幕智能体 :VLM(abstract)
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV、cs.AI
机构 * School of Computing, KAIST(计算学院,韩国科学技术院)
专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.CV、cs.LG
Journal ref International Conference on Learning Representations (ICLR), 2024
机构 * Korea University(韩国大学) ; Kyung Hee University(庆熙大学)
专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV
Comments 18 pages, 9 figures. Preprint
机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
Comments Accepted at GenProCC NeurIPS 2025 Workshop
机构 * School of Computer and Communication Sciences, EPFL(瑞士联邦理工学院计算机与通信科学学院) ; Department of Computer Science and Engineering, Chalmers University of Technology(楚科奇技术大学计算机科学与工程系) ; IVRL, EPFL(EPFL智能机器人实验室)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Department of Artificial Intelligence Convergence(人工智能融合系)
专题命中 VLM训练与架构 :LLaVA(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract)
专题命中 VLM训练与架构 :VLM(title,abstract);visual language model(abstract)
Comments Accepted for the 40th Annual AAAI Conference on Artificial Intelligence (2026)
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Brown University(布朗大学) ; University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Boise State University(博伊西州立大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments 45 pages
机构 * University of Texas at Arlington(德克萨斯理工大学) ; Clemson University(克莱姆森大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to ECAI 2025 Main Track
机构 * Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV、cs.AI