arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-22 至 2025-10-22 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 8 篇

2509.25528 2025-10-22 cs.CV cs.AI cs.RO 86%

LLM-RG: Referential Grounding in Outdoor Scenarios using Large Language Models

Pranav Saxena, Avigyan Bhattacharya, Ji Zhang, Wenshan Wang

机构 * Birla Institute of Technology and Science Pilani, K.K Birla Goa Campus(比拉理工学院和科学学院,K.K Birla Goa校区) Carnegie Mellon University, Robotics Institute(卡内基梅隆大学,机器人研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

Comments Human-aware Embodied AI Workshop @ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13365 2025-10-22 cs.CV cs.AI cs.LG 85%

VLLFL: A Vision-Language Model Based Lightweight Federated Learning Framework for Smart Agriculture

Long Li, Jiajia Li, Dong Chen, Lina Pu, Haibo Yao, Yanbo Huang

机构 * Department of Electrical and Computer Engineering, The University of Alabama(电气与计算机工程系,阿拉巴马大学) Electrical and Computer Engineering, Michigan State University(电气与计算机工程,密歇根州立大学) Agricultural and Biological Engineering, Mississippi State University(农业与生物工程,密苏里州立大学) Department of Computer Science, University of Alabama(计算机科学系,阿拉巴马大学) USDA-ARS Genetics and Sustainbale Agriculture(美国农业部ARS基因与可持续农业)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18188 2025-10-22 cs.CV cs.AI 84%

RadDiagSeg-M: A Vision Language Model for Joint Diagnosis and Multi-Target Segmentation in Radiology

Chengrun Li, Corentin Royer, Haozhe Luo, Bastian Wittmann, Xia Li, Ibrahim Hamamci, Sezgin Er, Anjany Sekuboyina, Bjoern Menze

专题命中 视觉定位与Grounding :vision language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18262 2025-10-22 cs.CV 77%

UWBench: A Comprehensive Vision-Language Benchmark for Underwater Understanding

Da Zhang, Chenggang Rong, Bingyu Li, Feiyu Wang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI)、中国电信)

专题命中 视觉定位与Grounding :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV

Comments We have released V1, which only reports the test results. Our work is still ongoing, and the next version will be coming soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17875 2025-10-22 cs.CV cs.AI 62%

3D Weakly Supervised Semantic Segmentation via Class-Aware and Geometry-Guided Pseudo-Label Refinement

Xiaoxu Xu, Xuexun Liu, Jinlong Li, Yitian Yuan, Qiudan Zhang, Lin Ma, Nicu Sebe, Xu Wang

机构 * College of Computer Science, Beihang University(北京航空航天大学计算机科学学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Meituan(美团)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18476 2025-10-22 cs.AI cs.CL 57%

Probabilistic Modeling of Intentions in Socially Intelligent LLM Agents

Feifan Xia, Yuyang Fang, Defang Li, Yantong Xie, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) Imperial College London(伦敦帝国学院) Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11741 2025-10-22 cs.AI cs.CR 57%

MTRE: Multi-Token Reliability Estimation for Hallucination Detection in VLMs

Geigh Zollicoffer, Minh Vu, Manish Bhattarai

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15845 2025-10-22 math.ST math.OC stat.TH 50%

On Learning the Optimal Regularization Parameter in Inverse Problems

Jonathan Chirinos Rodriguez, Ernesto De Vito, Cesare Molinari, Lorenzo Rosasco, Silvia Villa

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏