arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-08 至 2025-09-08 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 10 篇

2509.04908 2025-09-08 cs.AI cs.CL cs.CV cs.HC 86%

SparkUI-Parser: Enhancing GUI Perception with Robust Grounding and Parsing

Hongyi Jing, Jiafu Chen, Chen Rao, Ziqiang Dang, Jiajie Teng, Tianyi Chu, Juncheng Mo, Shuo Fang, Huaizhong Lin, Rui Lv, Chenguang Ma, Lei Zhao

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04758 2025-09-08 cs.CV 83%

Dynamic Group Detection using VLM-augmented Temporal Groupness Graph

Kaname Yokoyama, Chihiro Nakatani, Norimichi Ukita

机构 * Toyota Technological Institute(丰田技术研究所)

专题命中 视觉定位与Grounding :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

Comments 10 pages, Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04833 2025-09-08 cs.CV cs.AI 81%

PropVG: End-to-End Proposal-Driven Visual Grounding with Multi-Granularity Discrimination

Ming Dai, Wenxuan Cheng, Jiedong Zhuang, Jiang-jiang Liu, Hongshen Zhao, Zhenhua Feng, Wankou Yang

机构 * Southeast University(东南大学) Zhejiang University(浙江大学) Baidu VIS(百度视觉) Jiangnan University(江南大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03025 2025-09-08 cs.CV cs.AI 81%

Unveiling the Response of Large Vision-Language Models to Visually Absent Tokens

Sohee Kim, Soohyun Ryu, Joonhyung Park, Eunho Yang

机构 * KAIST AI(韩国科学技术院人工智能研究所) AITRICS(人工智能与机器人技术研究所在线)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05154 2025-09-08 eess.IV cs.CV 79%

VLSM-Ensemble: Ensembling CLIP-based Vision-Language Models for Enhanced Medical Image Segmentation

Julia Dietlmeier, Oluwabukola Grace Adegboro, Vayangi Ganepola, Claudia Mazo, Noel E. O'Connor

机构 * Insight Research Ireland Centre for Data Analytics, DCU, Dublin, Ireland(爱尔兰洞察研究爱尔兰数据分析中心,都柏林大学,都柏林) Research Ireland Centre for Research Training in Machine Learning, DCU, Dublin, Ireland(爱尔兰研究爱尔兰机器学习研究培训中心,都柏林大学,都柏林) School of Computing, Dublin City University, Dublin, Ireland(计算学院,都柏林城市大学,都柏林)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Medical Imaging with Deep Learning (MIDL 2025) short paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04676 2025-09-08 cs.AI cs.HC 79%

An Approach to Grounding AI Model Evaluations in Human-derived Criteria

Sasha Mitts

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 4 figures, 6 pages, presented at CHI 2025 Workshop on Human-AI Interaction for Augmented Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04918 2025-09-08 physics.hist-ph 71%

Holistic Versus Fragmented Multiverses: Empirical Access via Causal and Grounding Signatures

Baptiste Le Bihan

专题命中 视觉定位与Grounding :grounding(title)

Comments Chapter draft for the Blackwell Companion to the Philosophy and the Multiverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04894 2025-09-08 cs.CV cs.LG 62%

SynGen-Vision: Synthetic Data Generation for training industrial vision models

Alpana Dubey, Suma Mani Kuriakose, Nitish Bhardwaj

机构 * Accenture Labs(埃森哲实验室)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05112 2025-09-08 cs.SE cs.AI 57%

GenAI-based test case generation and execution in SDV platform

Denesa Zyberaj, Lukasz Mazur, Nenad Petrovic, Pankhuri Verma, Pascal Hirmer, Dirk Slama, Xiangwei Cheng, Alois Knoll

机构 * Mercedes-Benz AG, Germany(梅赛德斯-奔驰集团,德国) Technical University of Munich, Germany(慕尼黑技术大学,德国) Ferdinand-Steinbeis-Institut der Steinbeis-Stiftung, Germany(施坦贝格基金会费尔迪南-斯坦贝格研究所,德国)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17422 2025-09-08 cs.RO cs.CV 57%

Multimodal LLM Guided Exploration and Active Mapping using Fisher Information

Wen Jiang, Boshu Lei, Katrina Ashton, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学) Archimedes, Athena RC(阿基米德、阿提卡RC)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏