arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2403.17918 2025-02-17 cs.AI 57%

AgentStudio: A Toolkit for Building General Virtual Agents

Longtao Zheng, Zhiyuan Huang, Zhenghai Xue, Xinrun Wang, Bo An, Shuicheng Yan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments ICLR 2025. Project page: https://ltzheng.github.io/agent-studio

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09230 2025-02-14 cs.LO cs.AI cs.PL 57%

Relating Answer Set Programming and Many-sorted Logics for Formal Verification

Zachary Hansen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments In Proceedings ICLP 2024, arXiv:2502.08453

Journal ref EPTCS 416, 2025, pp. 332-344

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06428 2025-02-12 cs.CV 57%

CoS: Chain-of-Shot Prompting for Long Video Understanding

Jian Hu, Zixu Cheng, Chenyang Si, Wei Li, Shaogang Gong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments A training-free test-time optimisation approach for long video understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06194 2025-02-11 cs.CV 57%

Multimodal Task Representation Memory Bank vs. Catastrophic Forgetting in Anomaly Detection

You Zhou, Jiangshan Zhao, Deyu Zeng, Zuo Zuo, Weixiang Liu, Zongze Wu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05887 2025-02-11 cs.CL cs.AI 57%

MTPChat: A Multimodal Time-Aware Persona Dataset for Conversational Agents

Wanqi Yang, Yanda Li, Meng Fang, Ling Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments NAACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16037 2025-02-11 cs.CV 57%

Addressing Out-of-Label Hazard Detection in Dashcam Videos: Insights from the COOOL Challenge

Anh-Kiet Duong, Petra Gomez-Krämer

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments WACV 2025, 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07430 2025-02-11 cs.CL cs.AI 57%

Knowledge Graph Guided Evaluation of Abstention Techniques

Kinshuk Vasisht, Navreet Kaur, Danish Pruthi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted to NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12821 2025-02-11 cs.RO cs.CV 57%

Talk2Radar: Bridging Natural Language with 4D mmWave Radar for 3D Referring Expression Comprehension

Runwei Guan, Ruixiao Zhang, Ningwei Ouyang, Jianan Liu, Ka Lok Man, Xiaohao Cai, Ming Xu, Jeremy Smith, Eng Gee Lim, Yutao Yue, Hui Xiong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14924 2025-02-10 cs.CV 57%

DiPEx: Dispersing Prompt Expansion for Class-Agnostic Object Detection

Jia Syuen Lim, Zhuoxiao Chen, Mahsa Baktashmotlagh, Zhi Chen, Xin Yu, Zi Huang, Yadan Luo

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04883 2025-02-07 cs.LG cs.SI q-bio.BM q-bio.GN q-bio.MN 57%

Graph Representation Learning in Biomedicine

Michelle M. Li, Kexin Huang, Marinka Zitnik

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02589 2025-02-05 cs.CV 57%

COCONut-PanCap: Joint Panoptic Segmentation and Grounded Captions for Fine-Grained Understanding and Generation

Xueqing Deng, Qihang Yu, Ali Athar, Chenglin Yang, Linjie Yang, Xiaojie Jin, Xiaohui Shen, Liang-Chieh Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments project website: https://xdeng7.github.io/coconut.github.io/coconut_pancap.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20753 2025-02-05 cs.CL cs.LG 57%

Plan*RAG: Efficient Test-Time Planning for Retrieval Augmented Generation

Prakhar Verma, Sukruta Prakash Midigeshi, Gaurav Sinha, Arno Solin, Nagarajan Natarajan, Amit Sharma

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments 19 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00011 2025-02-04 cs.CY cs.AI cs.HC 57%

TOAST Framework: A Multidimensional Approach to Ethical and Sustainable AI Integration in Organizations

Dian Tjondronegoro

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 25 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01201 2025-02-04 cs.CV 57%

One-to-Normal: Anomaly Personalization for Few-shot Anomaly Detection

Yiyue Li, Shaoting Zhang, Kang Li, Qicheng Lao

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments In The Thirty-eighth Annual Conference on Neural Information Processing Systems (NeurIPS2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01167 2025-02-04 cs.RO cs.LG 57%

ConditionNET: Learning Preconditions and Effects for Execution Monitoring

Daniel Sliwowski, Dongheui Lee

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.LG

Comments 9 pages, 5 figures, 3 tables

Journal ref in IEEE Robotics and Automation Letters, vol. 10, no. 2, pp. 1337-1344, Feb. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00719 2025-02-04 cs.CV 57%

Vision and Language Reference Prompt into SAM for Few-shot Segmentation

Kosuke Sakurai, Ryotaro Shimizu, Masayuki Goto

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18954 2025-02-03 cs.CV 57%

LLMDet: Learning Strong Open-Vocabulary Object Detectors under the Supervision of Large Language Models

Shenghao Fu, Qize Yang, Qijie Mo, Junkai Yan, Xihan Wei, Jingke Meng, Xiaohua Xie, Wei-Shi Zheng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18753 2025-02-03 cs.CV 57%

INT: Instance-Specific Negative Mining for Task-Generic Promptable Segmentation

Jian Hu, Zixu Cheng, Shaogang Gong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments A new task-generic promptable segmentation approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16246 2025-01-28 cs.CV 57%

CLISC: Bridging clip and sam by enhanced cam for unsupervised brain tumor segmentation

Xiaochuan Ma, Jia Fu, Wenjun Liao, Shichuan Zhang, Guotai Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 22st IEEE International Symposium on Biomedical Imaging (ISBI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15438 2025-01-28 cs.CV cs.MM 57%

Cross-Modal Transfer from Memes to Videos: Addressing Data Scarcity in Hateful Video Detection

Han Wang, Rui Yang Tan, Roy Ka-Wei Lee

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 4 figures, THE WEB CONFERENCE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14905 2025-01-28 cs.CV 57%

Measuring and Mitigating Hallucinations in Vision-Language Dataset Generation for Remote Sensing

Madeline Anderson, Miriam Cha, William T. Freeman, J. Taylor Perron, Nathaniel Maidel, Kerri Cahoy

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12931 2025-01-23 cs.CV 57%

DynamicEarth: How Far are We from Open-Vocabulary Change Detection?

Kaiyu Li, Xiangyong Cao, Yupeng Deng, Chao Pang, Zepeng Xin, Deyu Meng, Zhi Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12539 2025-01-23 cs.LG cs.CL 57%

Compositional Instruction Following with Language Models and Reinforcement Learning

Vanya Cohen, Geraud Nangue Tasse, Nakul Gopalan, Steven James, Matthew Gombolay, Ray Mooney, Benjamin Rosman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments TMLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07524 2025-01-22 cs.AI cs.LO 57%

Fast Inference for Probabilistic Answer Set Programs via the Residual Program

Damiano Azzolini, Fabrizio Riguzzi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments The paper has been accepted at the ICLP2024 conference and under consideration in Theory and Practice of Logic Programming (TPLP)

Journal ref Theory and Practice of Logic Programming 24 (2024) 682-697

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07510 2025-01-22 cs.AI 57%

Dominating Set Reconfiguration with Answer Set Programming

Masato Kato, Torsten Schaub, Takehide Soh, Naoyuki Tamura, Mutsunori Banbara

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Journal ref Theory and Practice of Logic Programming 24 (2024) 755-771

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06863 2025-01-22 cs.CV 57%

Beyond Aesthetics: Cultural Competence in Text-to-Image Models

Nithish Kannen, Arif Ahmad, Marco Andreetto, Vinodkumar Prabhakaran, Utsav Prabhu, Adji Bousso Dieng, Pushpak Bhattacharyya, Shachi Dave

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments NeurIPS 2024 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09887 2025-01-20 cs.CV 57%

FLORA: Formal Language Model Enables Robust Training-free Zero-shot Object Referring Analysis

Zhe Chen, Zijing Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14816 2025-01-16 cs.CV 57%

TextSleuth: Towards Explainable Tampered Text Detection

Chenfan Qu, Jian Liu, Haoxing Chen, Baihan Yu, Jingjing Liu, Weiqiang Wang, Lianwen Jin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments The first work for explainable tampered text detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07857 2025-01-15 cs.SE cs.AI 57%

Hierarchical Repository-Level Code Summarization for Business Applications Using Local LLMs

Nilesh Dhulshette, Sapan Shah, Vinay Kulkarni

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments To appear at LLM4Code@ICSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16779 2025-01-15 cs.CL cs.AI cs.LO 57%

Inductive Learning of Logical Theories with LLMs: An Expressivity-Graded Analysis

João Pedro Gandarela, Danilo S. Carvalho, André Freitas

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏