arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2503.23105 2025-04-01 cs.CV 57%

Open-Vocabulary Semantic Segmentation with Uncertainty Alignment for Robotic Scene Understanding in Indoor Building Environments

Yifan Xu, Vineet Kamat, Carol Menassa

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14723 2025-04-01 cs.CV 57%

Effective SAM Combination for Open-Vocabulary Semantic Segmentation

Minhyeok Lee, Suhwan Cho, Jungho Lee, Sunghun Yang, Heeseung Choi, Ig-Jae Kim, Sangyoun Lee

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11498 2025-04-01 cs.RO cs.AI 57%

Verifiably Following Complex Robot Instructions with Foundation Models

Benedict Quartey, Eric Rosen, Stefanie Tellex, George Konidaris

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22291 2025-03-31 cs.CV 57%

VisTa: Visual-contextual and Text-augmented Zero-shot Object-level OOD Detection

Bin Zhang, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19274 2025-03-26 cs.CL cs.IR cs.LG 57%

CoMAC: Conversational Agent for Multi-Source Auxiliary Context with Sparse and Symmetric Latent Interactions

Junfeng Liu, Christopher T. Symons, Ranga Raju Vatsavai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments The 29th Pacific-Asia Conference on Knowledge Discovery and Data Mining (PAKDD2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19145 2025-03-26 cs.CV 57%

Compositional Caching for Training-free Open-vocabulary Attribute Detection

Marco Garosi, Alessandro Conti, Gaowen Liu, Elisa Ricci, Massimiliano Mancini

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025. Project website at https://comca-attributes.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13652 2025-03-26 cs.CV 57%

RelationField: Relate Anything in Radiance Fields

Sebastian Koch, Johanna Wald, Mirco Colosi, Narunas Vaskevicius, Pedro Hermosilla, Federico Tombari, Timo Ropinski

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://relationfield.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18880 2025-03-25 cs.CV cs.SD eess.AS 57%

Seeing Speech and Sound: Distinguishing and Locating Audios in Visual Scenes

Hyeonggon Ryu, Seongyu Kim, Joon Son Chung, Arda Senocak

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18814 2025-03-25 cs.AI 57%

Towards Responsible AI Music: an Investigation of Trustworthy Features for Creative Systems

Jacopo de Berardinis, Lorenzo Porcaro, Albert Meroño-Peñuela, Angelo Cangelosi, Tess Buckley

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18812 2025-03-25 cs.CV 57%

SKDU at De-Factify 4.0: Vision Transformer with Data Augmentation for AI-Generated Image Detection

Shrikant Malviya, Neelanjan Bhowmik, Stamos Katsigiannis

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments De-Factify 4.0 workshop at the 39th Annual AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12334 2025-03-25 q-bio.NC cs.AI cs.HC 57%

When neural implant meets multimodal LLM: A dual-loop system for neuromodulation and naturalistic neuralbehavioral research

Edward Hong Wang, Cynthia Xin Wen

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09478 2025-03-25 cs.CR cs.LG 57%

Data Reconstruction Attacks and Defenses: A Systematic Evaluation

Sheng Liu, Zihan Wang, Yuxiao Chen, Qi Lei

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05186 2025-03-25 cs.CV 57%

HiLM-D: Enhancing MLLMs with Multi-Scale High-Resolution Details for Autonomous Driving

Xinpeng Ding, Jianhua Han, Hang Xu, Wei Zhang, Xiaomeng Li

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17354 2025-03-24 cs.AI 57%

HCAST: Human-Calibrated Autonomy Software Tasks

David Rein, Joel Becker, Amy Deng, Seraphina Nix, Chris Canal, Daniel O'Connel, Pip Arnott, Ryan Bloom, Thomas Broadley, Katharyn Garcia, Brian Goodrich, Max Hasin, Sami Jawhar, Megan Kinniment, Thomas Kwa, Aron Lajko, Nate Rush, Lucas Jun Koba Sato, Sydney Von Arx, Ben West, Lawrence Chan, Elizabeth Barnes

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 32 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16199 2025-03-21 cs.LG 57%

Deferring Concept Bottleneck Models: Learning to Defer Interventions to Inaccurate Experts

Andrea Pugnana, Riccardo Massidda, Francesco Giannini, Pietro Barbiero, Mateo Espinosa Zarlenga, Roberto Pellungrini, Gabriele Dominici, Fosca Giannotti, Davide Bacciu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15949 2025-03-21 cs.CV 57%

CausalCLIPSeg: Unlocking CLIP's Potential in Referring Medical Image Segmentation with Causal Intervention

Yaxiong Chen, Minghong Wei, Zixuan Zheng, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lichao Mou

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments MICCAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15739 2025-03-21 cs.AI 57%

ECLAIR: Enhanced Clarification for Interactive Responses

John Murzaku, Zifan Liu, Md Mehrab Tanjim, Vaishnavi Muppala, Xiang Chen, Yunyao Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15538 2025-03-21 q-bio.NC cs.AI 57%

There must be encapsulated nonconceptual content in vision

Vincent C. Müller

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Journal ref (2005) in Athanassios Raftopoulos (ed.), Cognitive penetrability of perception: Attention, action, attention and bottom-up constraints (Huntington: Nova Science), 157-70

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15337 2025-03-20 cs.CV 57%

Recover and Match: Open-Vocabulary Multi-Label Recognition through Knowledge-Constrained Optimal Transport

Hao Tan, Zichang Tan, Jun Li, Ajian Liu, Jun Wan, Zhen Lei

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06350 2025-03-19 cs.CV 57%

T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation

Kaiyi Huang, Chengqi Duan, Kaiyue Sun, Enze Xie, Zhenguo Li, Xihui Liu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

Comments This is the journal version. For conference version (T2I-CompBench): arXiv:2307.06350v2. Project page: https://karine-h.github.io/T2I-CompBench-new/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12951 2025-03-18 cs.CV 57%

On the Consistency of Video Large Language Models in Temporal Comprehension

Minjoon Jung, Junbin Xiao, Byoung-Tak Zhang, Angela Yao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to CVPR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10779 2025-03-17 cs.CV 57%

The Power of One: A Single Example is All it Takes for Segmentation in VLMs

Mir Rayat Imtiaz Hossain, Mennatullah Siam, Leonid Sigal, James J. Little

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10307 2025-03-14 cs.CV cs.RO 57%

6D Object Pose Tracking in Internet Videos for Robotic Manipulation

Georgy Ponimatkin, Martin Cífka, Tomáš Souček, Médéric Fourmy, Yann Labbé, Vladimir Petrik, Josef Sivic

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to ICLR 2025. Project page available at https://ponimatkin.github.io/wildpose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10152 2025-03-14 cs.CV 57%

A Hierarchical Semantic Distillation Framework for Open-Vocabulary Object Detection

Shenghao Fu, Junkai Yan, Qize Yang, Xihan Wei, Xiaohua Xie, Wei-Shi Zheng

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to TMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09968 2025-03-14 cs.CV 57%

Style Evolving along Chain-of-Thought for Unknown-Domain Object Detection

Zihao Zhang, Aming Wu, Yahong Han

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14529 2025-03-14 cs.CV 57%

AnomalyDINO: Boosting Patch-based Few-shot Anomaly Detection with DINOv2

Simon Damm, Mike Laszkiewicz, Johannes Lederer, Asja Fischer

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted at WACV 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03346 2025-03-14 cs.CV 57%

Enhancing Vision-Language Pre-training with Rich Supervisions

Yuan Gao, Kunyu Shi, Pengkai Zhu, Edouard Belval, Oren Nuriel, Srikar Appalaraju, Shabnam Ghadar, Vijay Mahadevan, Zhuowen Tu, Stefano Soatto

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06788 2025-03-13 cs.AI cs.CY cs.HC 57%

Dubito Ergo Sum: Exploring AI Ethics

Viktor Dorfler, Giles Cuthbert

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 10 pages, 1 figure, HICSS 57: Hawaii International Conference on System Sciences, Honolulu, HI, published January 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11464 2025-03-13 cs.CV 57%

High-Quality Mask Tuning Matters for Open-Vocabulary Segmentation

Quan-Sheng Zeng, Yunheng Li, Daquan Zhou, Guanbin Li, Qibin Hou, Ming-Ming Cheng

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Revised version according to comments from reviewers of ICLR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16038 2025-03-13 cs.CV 57%

LiveScene: Language Embedding Interactive Radiance Fields for Physical Scene Rendering and Control

Delin Qu, Qizhi Chen, Pingrui Zhang, Xianqiang Gao, Junzhe Li, Bin Zhao, Dong Wang, Xuelong Li

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted at Neurips 2024

详情

展开后加载摘要…

URL PDF HTML 收藏