arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-09-24 至 2025-09-24 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7 篇

2509.18405 2025-09-24 cs.CV cs.AI 88%

Check Field Detection Agent (CFD-Agent) using Multimodal Large Language and Vision Language Models

Sourav Halder, Jinjun Tong, Xinyu Wu

机构 * U.S. Bank(美国银行)

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);multimodal large language model(abstract);MLLM(abstract)

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17537 2025-09-24 cs.CV 70%

SimToken: A Simple Baseline for Referring Audio-Visual Segmentation

Dian Jin, Yanghao Zhou, Jinxing Zhou, Jiaqi Ma, Ruohao Guo, Dan Guo

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project page: https://github.com/DianJin-HFUT/SimToken

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19017 2025-09-24 cs.LG cs.AI 62%

Fully Learnable Neural Reward Machines

Hazem Dewidar, Elena Umili

机构 * La Sapienza University of Rome(拉维亚大学罗马分校) Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) Joint Institute for Nuclear Research(联合核子研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18733 2025-09-24 cs.CV 57%

Knowledge Transfer from Interaction Learning

Yilin Gao, Kangyi Chen, Zhongxing Peng, Hengjie Lu, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05023 2025-09-24 cs.CV 57%

Split Matching for Inductive Zero-shot Semantic Segmentation

Jialei Chen, Xu Zheng, Dongyue Li, Chong Yi, Seigo Ito, Danda Pani Paudel, Luc Van Gool, Hiroshi Murase, Daisuke Deguchi

机构 * Graduate School of Informatics, Nagoya University (NU)(名古屋大学信息研究生院) Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou) (HKUST (GZ))(香港科学与技术大学(广州)人工智能推进部) Institute for Computer Science, Artificial Intelligence and Technology (INSAIT), Sofia University, St. Kliment Ohridski(索菲亚大学计算机科学、人工智能与技术研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15794 2025-09-24 cs.AI cs.LO 57%

Finite Groundings for ASP with Functions: A Journey through Consistency

Lukas Gerlach, David Carral, Markus Hecher

机构 * Knowledge-Based Systems Group, TU Dresden(图腾大学达姆施塔特分校知识系统小组) LIRMM, Inria, University of Montpellier, CNRS(里尔毫米研究所、法国国家信息与自动化技术研究院、蒙彼利埃大学、国家科学研究中心) Massachusetts Institute of Technology(麻省理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments to be published at IJCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18509 2025-09-24 cs.CY 50%

Developing a Decolonial Mindset for Indigenising Computing Education (CE)

Jianhua Li, Yin Paradies, Trina Myers, Robin Doss, Armita Zarnegar, Jack Reis

专题命中 视觉定位与Grounding :grounding(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏