arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-08-07 至 2025-08-07 共收录 15 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 15 篇

2404.06798 2025-08-07 cs.CV 85%

Uncertainty-aware Medical Diagnostic Phrase Identification and Grounding

Ke Zou, Yang Bai, Bo Liu, Yidi Chen, Zhihao Chen, Yang Zhou, Xuedong Yuan, Meng Wang, Xiaojing Shen, Xiaochun Cao, Yih Chung Tham, Huazhu Fu

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Department of Radiology, West China Hospital, Sichuan University(四川大学华西医院放射科) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Department of Mathematics, Sichuan University(四川大学数学系) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院) Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore and the Singapore Eye Research Institute, Singapore National Eye Centre(新加坡国立大学 Yong Loo Lin 医学院眼科系及新加坡眼科研所、新加坡国家眼科中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17125 2025-08-07 cs.CV cs.AI 84%

DOGR: Towards Versatile Visual Document Grounding and Referring

Yinan Zhou, Yuxin Chen, Haokun Lin, Yichen Wu, Shuyu Yang, Zhongang Qi, Chen Ma, Li Zhu, Ying Shan

机构 * Xi’an Jiaotong University(西安交通大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) City University of Hongkong(香港城市大学) Institute of Automation, CAS(中国科学院自动化研究所) Harvard University(哈佛大学) vivo Mobile Communication Co.(vivo移动通信公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

Comments 22 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04572 2025-08-07 cs.CV 83%

Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding

Jun Li, Che Liu, Wenjia Bai, Mingxuan Liu, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国学院) University of Trento(特伦托大学) Helmholtz AI and Helmholtz Munich(海德堡人工智能与海德堡慕尼黑) King’s College London(伦敦国王学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04389 2025-08-07 cs.AI 83%

GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning

Weitai Kang, Bin Lei, Gaowen Liu, Caiwen Ding, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Minnesota(明尼苏达大学) Cisco Research(思科研究)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04546 2025-08-07 cs.CV 79%

Hierarchical Event Memory for Accurate and Low-latency Online Video Temporal Grounding

Minghang Zheng, Yuxin Peng, Benyuan Sun, Yi Yang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04299 2025-08-07 cs.CV 79%

Length Matters: Length-Aware Transformer for Temporal Sentence Grounding

Yifan Wang, Ziyi Liu, Xiaolong Sun, Jiawei Wang, Hongmin Liu

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04175 2025-08-07 cs.CV 77%

AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization

Jingyi Liao, Yongyi Su, Rong-Cheng Tu, Zhao Jin, Wenhao Sun, Yiting Li, Dacheng Tao, Xun Xu, Xulei Yang

专题命中 视觉定位与Grounding :vision-language model(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03967 2025-08-07 cs.CV cs.CR cs.IR 70%

RAVID: Retrieval-Augmented Visual Detection: A Knowledge-Driven Approach for AI-Generated Image Identification

Mamadou Keita, Wassim Hamidouche, Hessen Bougueffa Eutamene, Abdelmalik Taleb-Ahmed, Abdenour Hadid

机构 * Laboratory of IEMN, Univ. Polytechnique Hauts-de-France(IEMN实验室,法国高等技术法国大学) KU 6G Research Center, Khalifa University(KU 6G研究中心,哈利法大学) Sorbonne Center for Artificial Intelligence, Sorbonne University(人工智能研究中心,索邦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04418 2025-08-07 cs.MM cs.CV cs.MA cs.SD eess.AS 57%

Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation

Jinxing Zhou, Yanghao Zhou, Mingfei Han, Tong Wang, Xiaojun Chang, Hisham Cholakkal, Rao Muhammad Anwer

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Project page: https://github.com/jasongief/TGS-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04120 2025-08-07 cs.CV 57%

CLIPVehicle: A Unified Framework for Vision-based Vehicle Search

Likai Wang, Ruize Han, Xiangqun Zhang, Wei Feng

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00099 2025-08-07 cs.CY cs.MA physics.soc-ph 50%

Finance as Extended Biology: Reciprocity as the Cognitive Substrate of Financial Behavior

Egil Diau

专题命中 视觉定位与Grounding :grounding(abstract)

Comments Position paper on LLM-agent simulation of financial structures. This update clarifies setup and adds a reciprocity-based table. Builds on arXiv:2505.02945 and 2505.08319

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04598 2025-08-07 cs.RO 50%

$NavA^3$: Understanding Any Instruction, Navigating Anywhere, Finding Anything

Lingfeng Zhang, Xiaoshuai Hao, Yingbo Tang, Haoxiang Fu, Xinyu Zheng, Pengwei Wang, Zhongyuan Wang, Wenbo Ding, Shanghang Zhang

专题命中 视觉定位与Grounding :VLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04504 2025-08-07 cs.CY 50%

Moving beyond harm. A critical review of how NLP research approaches discrimination

Katrin Schulz, Marjolein Lanzing, Giulia Martinez Brenner

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04183 2025-08-07 cs.CL 50%

Characterizing Deep Research: A Benchmark and Formal Definition

Abhinav Java, Ashmit Khandelwal, Sukruta Midigeshi, Aaron Halfaker, Amit Deshpande, Navin Goyal, Ankur Gupta, Nagarajan Natarajan, Amit Sharma

机构 * Microsoft Research(微软研究院)

专题命中 视觉定位与Grounding :grounding(abstract)

Comments First three authors contributed equally (ordered alphabetically)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03830 2025-08-07 cs.PL 50%

If-T: A Benchmark for Type Narrowing

Hanwen Guo, Ben Greenman

专题命中 视觉定位与Grounding :grounding(abstract)

Journal ref The Art, Science, and Engineering of Programming, 2025, Vol. 10, Issue 2, Article 17

详情

展开后加载摘要…

URL PDF HTML 收藏