SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Toyota Technological Institute(丰田技术研究所)
专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
Comments 10 pages, Accepted to ICCV2025
机构 * Southeast University(东南大学) ; Zhejiang University(浙江大学) ; Baidu VIS(百度视觉) ; Jiangnan University(江南大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
Comments ICCV2025
机构 * KAIST AI(韩国科学技术院人工智能研究所) ; AITRICS(人工智能与机器人技术研究所在线)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI
Comments accepted to EMNLP 2025
机构 * Insight Research Ireland Centre for Data Analytics, DCU, Dublin, Ireland(爱尔兰洞察研究爱尔兰数据分析中心,都柏林大学,都柏林) ; Research Ireland Centre for Research Training in Machine Learning, DCU, Dublin, Ireland(爱尔兰研究爱尔兰机器学习研究培训中心,都柏林大学,都柏林) ; School of Computing, Dublin City University, Dublin, Ireland(计算学院,都柏林城市大学,都柏林)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV
Comments Medical Imaging with Deep Learning (MIDL 2025) short paper
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI
Comments 4 figures, 6 pages, presented at CHI 2025 Workshop on Human-AI Interaction for Augmented Reasoning
专题命中 视觉定位与Grounding :grounding(title)
Comments Chapter draft for the Blackwell Companion to the Philosophy and the Multiverse
机构 * Accenture Labs(埃森哲实验室)
专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.LG
机构 * Mercedes-Benz AG, Germany(梅赛德斯-奔驰集团,德国) ; Technical University of Munich, Germany(慕尼黑技术大学,德国) ; Ferdinand-Steinbeis-Institut der Steinbeis-Stiftung, Germany(施坦贝格基金会费尔迪南-斯坦贝格研究所,德国)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI
机构 * University of Pennsylvania(宾夕法尼亚大学) ; Archimedes, Athena RC(阿基米德、阿提卡RC)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV
Comments ICCV 2025