arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-26 至 2025-09-26 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 12 篇

2509.21050 2025-09-26 cs.LG cs.AI 84%

GeoRef: Referring Expressions in Geometry via Task Formulation, Synthetic Supervision, and Reinforced MLLM-based Solutions

Bing Liu, Wenqiang Yv, Xuzheng Yang, Shichang Wang, Junzhuo Liu, Peng Wang, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * University of Electronic Science and Technology of China(电子科技大学) Tongji University(同济大学)

专题命中 视觉定位与Grounding :MLLM(title);grounding(abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19096 2025-09-26 cs.CV cs.SE 79%

Investigating Traffic Accident Detection Using Multimodal Large Language Models

Ilhan Skender, Kailin Tong, Selim Solmaz, Daniel Watzenig

机构 * Embedded Systems Group (Dept.-E)(嵌入式系统组) Virtual Vehicle Research GmbH(虚拟车辆研究公司) Control Systems Group (Dept.-E)(控制系统组) Institute of Visual Computing(视觉计算研究所) Graz University of Technology(格拉茨技术大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments Accepted for presentation at the 2025 IEEE International Automated Vehicle Validation Conference (IAVVC 2025). Final version to appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24372 2025-09-26 cs.CV 79%

Beyond Quantity: Distribution-Aware Labeling for Visual Grounding

Yichi Zhang, Gongwei Chen, Jun Zhu, Jia Wan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 18pages, 8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07019 2025-09-26 cs.HC 78%

Case Law Grounding: Using Precedents to Align Decision-Making for Humans and AI

Quan Ze Chen, Amy X. Zhang

专题命中 视觉定位与Grounding :grounding(title,abstract)

Comments Accepted at ACM Collective Intelligence 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02977 2025-09-26 cs.CV 70%

Efficiently Disentangling CLIP for Multi-Object Perception

Samyak Rawlekar, Yujun Cai, Yiwei Wang, Ming-Hsuan Yang, Narendra Ahuja

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) University of Queensland(昆士兰大学) UC Merced(加州大学默塞德分校) Yonsei University(延世大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14119 2025-09-26 cs.CV cs.AI cs.CL cs.LG 67%

NoHumansRequired: Autonomous High-Quality Image Editing Triplet Mining

Maksim Kuprashevich, Grigorii Alekseenko, Irina Tolstykh, Georgii Fedorov, Bulat Suleimanov, Vladimir Dokholyan, Aleksandr Gordeev

机构 * R&D Department, SALUTEDEV(SALUTEDEV 研发部)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20524 2025-09-26 cs.CV cs.AI 62%

InstructVTON: Optimal Auto-Masking and Natural-Language-Guided Interactive Style Control for Inpainting-Based Virtual Try-On

Julien Han, Shuwen Qiu, Qi Li, Xingzi Xu, Mehmet Saygin Seyfioglu, Kavosh Asadi, Karim Bouyarmane

机构 * Amazon(亚马逊公司) University of California, Los Angeles (UCLA)(加州大学洛杉矶分校) Duke University(杜克大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

Comments Submitted to CVPR 2025 and Published at CVPR 2025 AI for Content Creation workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16421 2025-09-26 cs.CV cs.AI 62%

AHA -- Predicting What Matters Next: Online Highlight Detection Without Looking Ahead

Aiden Chang, Celso De Melo, Stephanie M. Lukin

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted at NeurIPS 2025, 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08705 2025-09-26 cs.CV cs.AI 62%

Instance-aware Image Colorization with Controllable Textual Descriptions and Segmentation Masks

Yanru An, Ling Gui, Chunlei Cai, Tianxiao Ye, JIangchao Yao, Guangtao Zhai, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10787 2025-09-26 cs.CV cs.LG 62%

Lightweight Modular Parameter-Efficient Tuning for Open-Vocabulary Object Detection

Bilal Faye, Hanane Azzag, Mustapha Lebbah

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20369 2025-09-26 cs.CY cs.AI cs.HC 57%

AI-driven formative assessment and adaptive learning in data-science education: Evaluating an LLM-powered virtual teaching assistant

Fadjimata I Anaroua, Qing Li, Yan Tang, Hong P. Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.15356 2025-09-26 cs.AI cs.HC 57%

A Decision Theoretic Framework for Measuring AI Reliance

Ziyang Guo, Yifan Wu, Jason Hartline, Jessica Hullman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏