arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2504.15470 2025-04-23 cs.CV 57%

Manifold Induced Biases for Zero-shot and Few-shot Detection of Generated Images

Jonathan Brokman, Amit Giloni, Omer Hofman, Roman Vainshtein, Hisashi Kojima, Guy Gilboa

机构 * Fujitsu(富士通)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to ICLR 2025 (The International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15397 2025-04-23 cs.CV 57%

MirrorVerse: Pushing Diffusion Models to Realistically Reflect the World

Ankit Dhiman, Manan Shah, R Venkatesh Babu

机构 * Vision and AI Lab, IISc Bangalore(视觉与人工智能实验室,班加罗尔IISc) Samsung R & D Institute India - Bangalore(三星研发研究所-印度班加罗尔)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project Page: https://mirror-verse.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14638 2025-04-22 cs.CV 57%

NVSMask3D: Hard Visual Prompting with Camera Pose Interpolation for 3D Open Vocabulary Instance Segmentation

Junyuan Fang, Zihan Wang, Yejun Zhang, Shuzhe Wang, Iaroslav Melekhov, Juho Kannala

机构 * Aalto University(阿莱大学) University of Helsinki(赫尔辛基大学) University of Oulu(奥卢大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 15 pages, 4 figures, Scandinavian Conference on Image Analysis 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11608 2025-04-18 cs.CV 57%

Visually Consistent Hierarchical Image Classification

Seulki Park, Youren Zhang, Stella X. Yu, Sara Beery, Jonathan Huang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17619 2025-04-17 cs.CV 57%

Kernel-Aware Graph Prompt Learning for Few-Shot Anomaly Detection

Fenfang Tao, Guo-Sen Xie, Fang Zhao, Xiangbo Shu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted to AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02548 2025-04-16 cs.CV 57%

Mosaic3D: Foundation Dataset and Model for Open-Vocabulary 3D Segmentation

Junha Lee, Chunghyun Park, Jaesung Choe, Yu-Chiang Frank Wang, Jan Kautz, Minsu Cho, Chris Choy

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments project page: https://nvlabs.github.io/Mosaic3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01007 2025-04-16 cs.AI 57%

Unlocking the Wisdom of Large Language Models: An Introduction to The Path to Artificial General Intelligence

Edward Y. Chang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 153 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09513 2025-04-15 cs.CV 57%

DiffuMural: Restoring Dunhuang Murals with Multi-scale Diffusion

Puyu Han, Jiaju Kang, Yuhang Pan, Erting Pan, Zeyu Zhang, Qunchao Jin, Juntao Jiang, Zhichen Liu, Luqi Gong

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09291 2025-04-15 cs.CV cs.MM 57%

Towards Explainable Partial-AIGC Image Quality Assessment

Jiaying Qian, Ziheng Jia, Zicheng Zhang, Zeyu Zhang, Guangtao Zhai, Xiongkuo Min

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09277 2025-04-15 cs.IR cs.AI 57%

SynthTRIPs: A Knowledge-Grounded Framework for Benchmark Query Generation for Personalized Tourism Recommenders

Ashmi Banerjee, Adithi Satish, Fitri Nur Aisyah, Wolfgang Wörndl, Yashar Deldjoo

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted for publication at SIGIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09267 2025-04-15 cs.CV cs.RO 57%

Are Open-Vocabulary Models Ready for Detection of MEP Elements on Construction Sites

Abdalwhab Abdalwhab, Ali Imran, Sina Heydarian, Ivanka Iordanova, David St-Onge

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 4 pages, 3 figures, Accepted for presentation at the 42nd International Symposium on Automation and Robotics in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12044 2025-04-15 cs.CV 57%

ITACLIP: Boosting Training-Free Semantic Segmentation with Image, Text, and Architectural Enhancements

M. Arda Aydın, Efe Mert Çırpar, Elvin Abdinli, Gozde Unal, Yusuf H. Sahin

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12499 2025-04-15 cs.CV 57%

End-to-end Open-vocabulary Video Visual Relationship Detection using Multi-modal Prompting

Yongqi Wang, Xinxiao Wu, Shuo Yang, Jiebo Luo

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06553 2025-04-14 cs.RO cs.CV 57%

ASHiTA: Automatic Scene-grounded HIerarchical Task Analysis

Yun Chang, Leonor Fermoselle, Duy Ta, Bernadette Bucher, Luca Carlone, Jiuguang Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06672 2025-04-10 cs.CV 57%

RAGME: Retrieval Augmented Video Generation for Enhanced Motion Realism

Elia Peruzzo, Dejia Xu, Xingqian Xu, Humphrey Shi, Nicu Sebe

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Code available at: https://github.com/helia95/ragme

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06618 2025-04-10 cs.CV 57%

Human-like compositional learning of visually-grounded concepts using synthetic environments

Zijun Lin, M Ganesh Kumar, Cheston Tan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06389 2025-04-10 cs.CV 57%

SemiDAViL: Semi-supervised Domain Adaptation with Vision-Language Guidance for Semantic Segmentation

Hritam Basak, Zhaozheng Yin

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05541 2025-04-10 cs.CV 57%

Caption Anything in Video: Fine-grained Object-centric Captioning via Spatiotemporal Multimodal Prompting

Yunlong Tang, Jing Bi, Chao Huang, Susan Liang, Daiki Shimada, Hang Hua, Yunzhong Xiao, Yizhi Song, Pinxin Liu, Mingqian Feng, Junjia Guo, Zhuo Liu, Luchuan Song, Ali Vosoughi, Jinxi He, Liu He, Zeliang Zhang, Jiebo Luo, Chenliang Xu

专题命中 视觉定位与Grounding :InternVL(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06269 2025-04-10 cs.IR cs.AI cs.CL 57%

EXCLAIM: An Explainable Cross-Modal Agentic System for Misinformation Detection with Hierarchical Retrieval

Yin Wu, Zhengxuan Zhang, Fuling Wang, Yuyu Luo, Hui Xiong, Nan Tang

专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.AI

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06473 2025-04-09 cs.RO cs.AI 57%

GRAPPA: Generalizing and Adapting Robot Policies via Online Agentic Guidance

Arthur Bucker, Pablo Ortega-Kral, Jonathan Francis, Jean Oh

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 21 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05227 2025-04-08 cs.CV 57%

A Reality Check of Vision-Language Pre-training in Radiology: Have We Progressed Using Text?

Julio Silva-Rodríguez, Jose Dolz, Ismail Ben Ayed

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments IPMI 2025. Code and weights: https://github.com/jusiro/DLILP

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17150 2025-04-08 cs.CV 57%

Distilling Spectral Graph for Object-Context Aware Open-Vocabulary Semantic Segmentation

Chanyoung Kim, Dayun Ju, Woojung Han, Ming-Hsuan Yang, Seong Jae Hwang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09654 2025-04-08 cs.CV cs.MM 57%

Do LLMs Understand Visual Anomalies? Uncovering LLM's Capabilities in Zero-shot Anomaly Detection

Jiaqi Zhu, Shaofeng Cai, Fang Deng, Beng Chin Ooi, Junran Wu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Accepted by MM'24 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16198 2025-04-07 cs.CV 57%

Interpreting Object-level Foundation Models via Visual Precision Search

Ruoyu Chen, Siyuan Liang, Jingzhi Li, Shiming Liu, Maosen Li, Zhen Huang, Hua Zhang, Xiaochun Cao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted to CVPR 2025 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02426 2025-04-04 cs.AI 57%

Narrative Studio: Visual narrative exploration using LLMs and Monte Carlo Tree Search

Parsa Ghaffari, Chris Hokamp

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01833 2025-04-03 cs.CL cs.AI 57%

YourBench: Easy Custom Evaluation Sets for Everyone

Sumuk Shashidhar, Clémentine Fourrier, Alina Lozovskia, Thomas Wolf, Gokhan Tur, Dilek Hakkani-Tür

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01561 2025-04-03 eess.IV cs.CV 57%

STPNet: Scale-aware Text Prompt Network for Medical Image Segmentation

Dandan Shan, Zihan Li, Yunxiang Li, Qingde Li, Jie Tian, Qingqi Hong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11005 2025-04-03 cs.CV 57%

Cyclic Contrastive Knowledge Transfer for Open-Vocabulary Object Detection

Chuhan Zhang, Chaoyang Zhu, Pingcheng Dong, Long Chen, Dong Zhang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 10 pages, 5 figures, Published as a conference paper at ICLR 2025

Journal ref Proceedings of the 13th International Conference on Learning Representations (ICLR 2025), Paper ID: 4226

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00476 2025-04-02 cs.CV 57%

4th PVUW MeViS 3rd Place Report: Sa2VA

Haobo Yuan, Tao Zhang, Xiangtai Li, Lu Qi, Zilong Huang, Shilin Xu, Jiashi Feng, Ming-Hsuan Yang

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV

Comments Technical Report, 4 pages, Code: https://github.com/magic-research/Sa2VA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24096 2025-04-01 cs.CV 57%

DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description

Adrienne Deganutti, Simon Hadfield, Andrew Gilbert

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏