arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-06 至 2025-08-06 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 8 篇

2505.05895 2025-08-06 cs.CV cs.AI 87%

Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI

Benjamin Raphael Ernhofer, Daniil Prokhorov, Jannica Langner, Dominik Bollmann

机构 * SPARKS Solutions GmbH(SPARKS解决方案有限公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02890 2025-08-06 cs.CV cs.CL 85%

VisuCraft: Enhancing Large Vision-Language Models for Complex Visual-Guided Creative Content Generation via Structured Information Extraction

Rongxin Jiang, Robert Long, Chenghao Gu, Mingrui Yan

机构 * Heilongjiang University of Science and Technology(黑龙江科技大学) University of Padua(帕多瓦大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03654 2025-08-06 cs.CL cs.CV 79%

Can Large Vision-Language Models Understand Multimodal Sarcasm?

Xinyu Wang, Yue Zhang, Liqiang Jing

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 视觉定位与Grounding :vision-language model(title);visual language model(abstract);分类 cs.CV

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02951 2025-08-06 cs.AI 70%

MedBLINK: Probing Basic Perception in Multimodal Language Models for Medicine

Mahtab Bigverdi, Wisdom Ikezogwo, Kevin Zhang, Hyewon Jeong, Mingyu Lu, Sungjae Cho, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Massachusetts Institute of Technology(麻省理工学院) Seoul National University(首尔国立大学)

专题命中 视觉定位与Grounding :LLaVA(abstract);grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08808 2025-08-06 cs.LG math.OC stat.ML 57%

A First-order Generative Bilevel Optimization Framework for Diffusion Models

Quan Xiao, Hui Yuan, A F M Saif, Gaowen Liu, Ramana Kompella, Mengdi Wang, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Princeton University(普林斯顿大学) Cisco Research(思科研究) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Cameral-ready version: added experiments using the HPSv2 reward, improved notation consistency for the diffusion model, and added related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02988 2025-08-06 cs.RO cs.AI 57%

GACL: Grounded Adaptive Curriculum Learning with Active Task and Performance Monitoring

Linji Wang, Zifan Xu, Peter Stone, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系) Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 7 pages, IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02973 2025-08-06 cs.CV 57%

Diffusion Models with Adaptive Negative Sampling Without External Resources

Alakh Desai, Nuno Vasconcelos

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03340 2025-08-06 cs.SE 50%

Key-Augmented Neural Triggers for Knowledge Sharing

Alex Wolf, Marco Edoardo Palma, Pooja Rani, Harald C. Gall

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏