arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-26 至 2026-02-26 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 13 篇

2509.24072 2026-02-26 cs.CV cs.AI 84%

Uncovering Grounding IDs: How External Cues Shape Multimodal Binding

揭示地面ID:外部线索如何塑造多模态绑定

Hosein Hasani, Amirmohammad Izadi, Fatemeh Askari, Mobin Bagherian, Sadegh Mohammadian, Mohammad Izadi, Mahdieh Soleymani Baghshah

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出地面ID概念,揭示外部线索通过增强多模态绑定的注意力机制,提升跨模态定位精度并减少幻觉。

Comments Under review as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21865 2026-02-26 cs.LG 79%

Beyond RAG vs. Long-Context: Learning Distraction-Aware Retrieval for Efficient Knowledge Grounding

超越RAG与长上下文:学习抗干扰检索以实现高效的知识 grounding

Seongwoong Shim, Myunsoo Kim, Jae Hyeon Cho, Byung-Jun Lee

机构 * Korea University, Decision Making Lab(韩国大学,决策实验室) LG CNS

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

AI总结 本文提出LDAR方法,通过学习抗干扰检索提升知识 grounding 的效率与性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21406 2026-02-26 cs.CV 79%

Exploring Vision-Language Models for Open-Vocabulary Zero-Shot Action Segmentation

探索用于开放词汇零样本动作分割的视觉-语言模型

Asim Unmesh, Kaki Ramesh, Mayank Patel, Rahul Jain, Karthik Ramani

机构 * Purdue University(普渡大学) Birla Institute of Technology and Science (BITS) Hyderabad(比拉理工学院和科学研究院(BITS)海得拉巴)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出开放词汇零样本时间动作分割方法,利用视觉-语言模型的零样本能力,通过帧-动作嵌入相似性和相似性矩阵时间分割实现无需训练的分割任务,展示了其在结构化时间理解中的潜力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22033 2026-02-26 cs.CV 70%

RT-RMOT: A Dataset and Framework for RGB-Thermal Referring Multi-Object Tracking

RT-RMOT:一种用于RGB-热成像参照多目标跟踪的数据集和框架

Yanqiu Yu, Zhifan Jin, Sijia Chen, Tongfei Chu, En Yu, Liman Liu, Wenbing Tao

机构 * Huazhong University of Science and Technology(华中科技大学) South-Central Minzu University(西南民族大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 RT-RMOT提出一种融合RGB和热成像特征的多目标跟踪框架,通过改进的RL策略优化提升全天候跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03594 2026-02-26 cs.CV 70%

TIPS Over Tricks: Simple Prompts for Effective Zero-shot Anomaly Detection

TIPS Over Tricks: 简单提示用于有效的零样本异常检测

Alireza Salehi, Ehsan Karami, Sepehr Noey, Sahand Noey, Makoto Yamada, Reshad Hosseini, Mohammad Sabokrou

机构 * University of Tehran(塔里哈大学) Amirkabir University of Technology(阿米尔卡比尔技术大学) Okinawa Institute of Science and Technology(冲绳科学技术大学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出TIPS模型,通过改进的backbone和解耦提示策略,在无需复杂模块的情况下提升零样本异常检测的图像和像素级性能。

Comments This is the extended version of the paper accepted in ICASSP'26, which will be publicly available in May. Authors' contributions may vary among the versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21613 2026-02-26 cs.CV cs.AI 62%

Virtual Biopsy for Intracranial Tumors Diagnosis on MRI

颅内肿瘤MRI上的虚拟活检

Xinzhe Luo, Shuai Shao, Yan Wang, Jiangtao Wang, Yutong Bai, Jianguo Zhang

机构 * School of Artificial Intelligence and Data Science University of Science and Technology of China(人工智能与数据科学学院 中国科学技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出虚拟活检框架,利用MRI和视觉-语言模型实现颅内肿瘤的非侵入性病理预测,准确率超过90%

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21231 2026-02-26 cs.LG cs.AI cs.CL 62%

ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces

ACAR:适应复杂度的多模型集合路由

Ramchand Kumaresan

机构 * Ramchand Kumaresan(独立研究者)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 ACAR是一种用于多模型集合的可审计路由框架,通过自一致性方差实现任务路由,提升准确率并避免过度融合,同时揭示归因计算的挑战。

Comments 12 pages, 9 figures. Measurement framework for adaptive multi-model routing with auditable execution traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21735 2026-02-26 cs.CV 57%

SigVLP: Sigmoid Volume-Language Pre-Training for Self-Supervised CT-Volume Adaptive Representation Learning

SigVLP:基于sigmoid体积-语言预训练的自监督CT体积自适应表示学习

Jiayi Wang, Hadrien Reynaud, Ibrahim Ethem Hamamci, Sezgin Er, Suprosanna Shit, Bjoern Menze, Bernhard Kainz

机构 * Friedrich-Alexander University Erlangen-Nürnberg(弗里德里希-亚历山大大学埃尔兰根-纽伦堡) Department of Quantitative Biomedicine, University of Zurich(苏黎世大学定量生物医学系) ETH AI Center, ETH Zurich(苏黎世联邦理工学院AI中心) International School of Medicine, Istanbul Medipol University(伊斯坦布尔梅迪波尔大学国际医学院) Department of Computing, Imperial College London(伦敦帝国学院计算机系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 SigVLP通过引入旋转位置嵌入和块级对齐方法,改进CT体积与文本的自监督表示学习,提升文本到体积对齐的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21716 2026-02-26 cs.CV 57%

TranX-Adapter: Bridging Artifacts and Semantics within MLLMs for Robust AI-generated Image Detection

TranX-Adapter: 在MLLMs中弥合artifact与语义以实现鲁棒的AI生成图像检测

Wenbin Wang, Yuge Huang, Jianqing Xu, Yue Yu, Jiangtao Yan, Shouhong Ding, Pan Zhou, Yong Luo

机构 * Wuhan University(武汉大学) Tencent YouTu Lab(腾讯YouTu实验室) Singapore Management University(新加坡管理学院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 TranX-Adapter通过引入任务感知的最优传输融合和X-Fusion机制,在MLLMs中提升AI生成图像检测的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21598 2026-02-26 cs.IR cs.AI 57%

Retrieval Challenges in Low-Resource Public Service Information: A Case Study on Food Pantry Access

低资源公共信息服务中的检索挑战:食品储藏室访问案例研究

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威斯科州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于AI的对话式检索系统,用于解决低资源环境下食品储藏室信息检索的挑战,通过RAG流程提升自然语言查询的准确性与可靠性。

Comments 3 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21723 2026-02-26 cs.RO 50%

LessMimic: Long-Horizon Humanoid Interaction with Unified Distance Field Representations

LessMimic:基于统一距离场表示的长时域人形交互

Yutang Lin, Jieming Cui, Yixuan Li, Baoxiong Jia, Yixin Zhu, Siyuan Huang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 LessMimic通过统一距离场表示实现人形机器人长时域交互,无需参考动作,利用变分自编码器和对抗交互先验进行训练,实现高成功率和多任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21681 2026-02-26 cs.SE 50%

AkiraRust: Re-thinking LLM-aided Rust Repair Using a Feedback-guided Thinking Switch

AkiraRust:重新思考利用反馈引导的思考开关的LLM辅助Rust修复

Renshuang Jiang, Yichong Wang, Pan Dong, Xiaoxiang Fang, Zhenling Duan, Tinglue Wang, Yuchen Hu, Jie Yu, Zhe Jiang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 AkiraRust通过反馈引导的思考开关机制,实现Rust修复的语义正确性和效率提升。

Comments 7 pages, 11 figures, accepted to DAC

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21604 2026-02-26 cs.DB 50%

Towards Autonomous Graph Data Analytics with Analytics-Augmented Generation

迈向具有分析增强生成的自主图数据分析

Qiange Wang, Chaoyi Chen, Jingqi Gao, Zihan Wang, Yanfeng Zhang, Ge Yu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出分析增强生成(AAG)范式,通过知识驱动的任务规划和算法中心的LLM-分析交互,实现端到端的图分析流水线,将自然语言意图转化为自动执行和可解释结果。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏