arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-09 至 2026-02-09 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 5 篇

2602.06351 2026-02-09 cs.AI cs.CV 84%

Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion

Trifuse: 通过多模态融合增强基于注意力的GUI定位

Longhui Ma, Di Zhao, Siwei Wang, Zhao Lv, Miao Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) Intelligent Game and Decision Lab, Academy of Military Sciences(智能游戏与决策实验室,军事科学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Trifuse通过多模态融合提升GUI定位性能,整合注意力、OCR文本和图标描述语义,无需任务微调即可实现高效定位。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19647 2026-02-09 cs.CV cs.AI 84%

Show or Tell? Effectively prompting Vision-Language Models for semantic segmentation

展示还是讲述?有效提示视觉-语言模型进行语义分割

Niccolo Avogaro, Thomas Frick, Mattia Rigotti, Andrea Bartezzaghi, Filip Janicki, Cristiano Malossi, Konrad Schindler, Roy Assaf

机构 * IBM Research(IBM研究院) ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出PromptMatcher,通过结合文本和视觉提示提升VLMs在语义分割中的性能,实现优于现有方法的改进。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04692 2026-02-09 cs.CV cs.AI 73%

DRMOT: A Dataset and Framework for RGBD Referring Multi-Object Tracking

DRMOT:用于RGBD参照多目标跟踪的数据集和框架

Sijia Chen, Lijuan Ma, Yanqiu Yu, En Yu, Liman Liu, Wenbing Tao

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DRMOT任务,通过融合RGB、深度和语言信息,构建DRSet数据集并提出DRTrack框架,提升多目标跟踪的3D感知能力。

Comments https://github.com/chen-si-jia/DRMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06592 2026-02-09 cs.CV cs.AI 62%

ProtoQuant: Quantization of Prototypical Parts For General and Fine-Grained Image Classification

ProtoQuant:用于通用和细粒度图像分类的原型部分量化

Mikołaj Janusz, Adam Wróbel, Bartosz Zieliński, Dawid Rymarczyk

机构 * Jagiellonian University, Faculty of Mathematics and Computer Science(杰洛尼莫夫大学数学与计算机科学系) Jagiellonian University, Doctoral School of Exact and Natural Sciences(杰洛尼莫夫大学精确与自然科学研究博士学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ProtoQuant通过潜在向量量化实现原型稳定性和可解释性,适用于通用和细粒度图像分类任务。

Comments Work under review. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06474 2026-02-09 cs.CV 57%

LAB-Det: Language as a Domain-Invariant Bridge for Training-Free One-Shot Domain Generalization in Object Detection

LAB-Det: 语言作为域不变桥梁用于无训练的一 shot 域泛化在目标检测

Xu Zhang, Zhe Chen, Jing Zhang, Dacheng Tao

机构 * The University of Sydney, Australia(悉尼大学) La Trobe University, Australia(拉特罗布大学) Wuhan University, China(武汉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 LAB-Det通过语言条件替代梯度微调,实现无训练的一 shot 域泛化,在数据稀缺的检测任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏