arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2412.16108 2024-12-23 cs.CV cs.AI 62%

Demystifying the Potential of ChatGPT-4 Vision for Construction Progress Monitoring

Ahmet Bahaddin Ersoz

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Journal ref 8th International Project and Construction Management Conference (IPCMC2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07024 2024-12-20 cs.CV cs.AI 62%

Exploring Scalability of Self-Training for Open-Vocabulary Temporal Action Localization

Jeongseok Hyun, Su Ho Han, Hyolim Kang, Joon-Young Lee, Seon Joo Kim

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10719 2024-12-17 cs.CV cs.AI 62%

Just a Few Glances: Open-Set Visual Perception with Image Prompt Paradigm

Jinrong Zhang, Penghui Wang, Chunxiao Liu, Wei Liu, Dian Jin, Qiong Zhang, Erli Meng, Zhengnan Hu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10542 2024-12-17 cs.AI cs.CL cs.CV 62%

SAM4MLLM: Enhance Multi-Modal Large Language Model for Referring Expression Segmentation

Yi-Chia Chen, Wei-Hua Li, Cheng Sun, Yu-Chiang Frank Wang, Chu-Song Chen

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09240 2024-12-13 cs.CV cs.AI 62%

VLMs meet UDA: Boosting Transferability of Open Vocabulary Segmentation with Unsupervised Domain Adaptation

Roberto Alcover-Couso, Marcos Escudero-Viñolo, Juan C. SanMiguel, Jesus Bescos

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06195 2024-12-10 cs.LG cs.CV 62%

Adaptive Resolution Residual Networks -- Generalizing Across Resolutions Easily and Efficiently

Léa Demeule, Mahtab Sandhu, Glen Berseth

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04935 2024-12-09 eess.IV cs.AI cs.CV 62%

Uncertainty-aware retinal layer segmentation in OCT through probabilistic signed distance functions

Mohammad Mohaiminul Islam, Coen de Vente, Bart Liefers, Caroline Klaver, Erik J Bekkers, Clara I. Sánchez

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02177 2024-12-04 cs.CV cs.AI 62%

Anatomically-Grounded Fact Checking of Automated Chest X-ray Reports

R. Mahmood, K. C. L. Wong, D. M. Reyes, N. D'Souza, L. Shi, J. Wu, P. Kaviani, M. Kalra, G. Wang, P. Yan, T. Syeda-Mahmood

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19217 2024-12-02 cs.CV cs.AI cs.RO 62%

Think Step by Step: Chain-of-Gesture Prompting for Error Detection in Robotic Surgical Videos

Zhimin Shao, Jialang Xu, Danail Stoyanov, Evangelos B. Mazomenos, Yueming Jin

专题命中 视觉定位与Grounding :visual reasoning(abstract);分类 cs.CV、cs.AI

Comments 8 pages, 4 figures

Journal ref IEEE Robotics and Automation Letters, vol. 9, no. 12, pp. 11513-11520, Dec. 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18211 2024-11-28 cs.CV cs.AI 62%

TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability

Shimin Chen, Xiaohan Lan, Yitian Yuan, Zequn Jie, Lin Ma

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14402 2024-11-22 cs.CV cs.LG 62%

Multimodal Autoregressive Pre-training of Large Vision Encoders

Enrico Fini, Mustafa Shukor, Xiujun Li, Philipp Dufter, Michal Klein, David Haldimann, Sai Aitharaju, Victor Guilherme Turrisi da Costa, Louis Béthune, Zhe Gan, Alexander T Toshev, Marcin Eichner, Moin Nabi, Yinfei Yang, Joshua M. Susskind, Alaaeldin El-Nouby

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments https://github.com/apple/ml-aim

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14205 2024-11-22 cs.CV cs.AI 62%

Is this Generated Person Existed in Real-world? Fine-grained Detecting and Calibrating Abnormal Human-body

Zeqing Wang, Qingyang Ma, Wentao Wan, Haojie Li, Keze Wang, Yonghong Tian

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV、cs.AI

Comments 16 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15761 2024-11-20 cs.LG cs.AI 62%

TFG: Unified Training-Free Guidance for Diffusion Models

Haotian Ye, Haowei Lin, Jiaqi Han, Minkai Xu, Sheng Liu, Yitao Liang, Jianzhu Ma, James Zou, Stefano Ermon

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15778 2024-11-19 cs.CV cs.AI 62%

ObjectNLQ @ Ego4D Episodic Memory Challenge 2024

Yisen Feng, Haoyu Zhang, Yuquan Xie, Zaijing Li, Meng Liu, Liqiang Nie

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments The solution for the Natural Language Query track and Goal Step track at CVPR EgoVis Workshop 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05854 2024-11-12 cs.MM cs.AI cs.CV cs.CY 62%

Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators

Claire Wonjeong Jo, Miki Wesołowska, Magdalena Wojcieszak

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03225 2024-11-08 cs.AI cs.CV 62%

Knowledge Graphs of Driving Scenes to Empower the Emerging Capabilities of Neurosymbolic AI

Ruwan Wickramarachchi, Cory Henson, Amit Sheth

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23883 2024-11-01 cs.CL cs.AI cs.LG cs.MM 62%

'No' Matters: Out-of-Distribution Detection in Multimodality Long Dialogue

Rena Gao, Xuetong Wu, Siwen Luo, Caren Han, Feng Liu

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.AI、cs.LG

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01573 2024-10-31 cs.CV cs.AI 62%

Improving Apple Object Detection with Occlusion-Enhanced Distillation

Liang Geng

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17486 2024-10-30 cs.AI cs.CV 62%

Global-Local Medical SAM Adaptor Based on Full Adaption

Meng Wang, Yarong Feng, Yongwei Tang, Tian Zhang, Yuxin Liang, Chao Lv

专题命中 视觉定位与Grounding :visual language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20957 2024-10-29 cs.AI cs.LG 62%

Neuro-symbolic Learning Yielding Logical Constraints

Zenan Li, Yunpeng Huang, Zhaoyu Li, Yuan Yao, Jingwei Xu, Taolue Chen, Xiaoxing Ma, Jian Lu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at NeurIPS 2023, and code is available at [this url](https://github.com/Lizn-zn/Nesy-Programming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01522 2024-10-28 cs.CV cs.LG 62%

G2D: From Global to Dense Radiography Representation Learning via Vision-Language Pre-training

Che Liu, Cheng Ouyang, Sibo Cheng, Anand Shah, Wenjia Bai, Rossella Arcucci

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

Comments Accepted by NeurIPS2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15221 2024-10-22 cs.LG cs.AI cs.MA cs.SY eess.SY 62%

IntersectionZoo: Eco-driving for Benchmarking Multi-Agent Contextual Reinforcement Learning

Vindula Jayawardana, Baptiste Freydt, Ao Qu, Cameron Hickert, Zhongxia Yan, Cathy Wu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments In review

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05383 2024-10-21 cs.CL cs.CV cs.LG 62%

Including Facial Expressions in Contextual Embeddings for Sign Language Generation

Carla Viegas, Mert İnan, Lorna Quandt, Malihe Alikhani

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11623 2024-10-16 cs.CV cs.AI cs.CL 62%

VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI

Sijie Cheng, Kechen Fang, Yangyang Yu, Sicheng Zhou, Bohao Li, Ye Tian, Tingguang Li, Lei Han, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15759 2024-10-15 cs.CV cs.AI 62%

TV-SAM: Increasing Zero-Shot Segmentation Performance on Multimodal Medical Images Using GPT-4 Generated Descriptive Prompts Without Human Annotation

Zekun Jiang, Dongjie Cheng, Ziyuan Qin, Jun Gao, Qicheng Lao, Abdullaev Bakhrom Ismoilovich, Urazboev Gayrat, Yuldashov Elyorbek, Bekchanov Habibullo, Defu Tang, LinJing Wei, Kang Li, Le Zhang

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

Comments 13 pages, 5 figures, 4 tables, accepted by BDMA Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07876 2024-10-11 cs.LG cs.AI cs.CL 62%

Policy Improvement using Language Feedback Models

Victor Zhong, Dipendra Misra, Xingdi Yuan, Marc-Alexandre Côté

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14552 2024-10-10 cs.CV cs.AI 62%

Griffon: Spelling out All Object Locations at Any Granularity with Large Language Models

Yufei Zhan, Yousong Zhu, Zhiyang Chen, Fan Yang, Ming Tang, Jinqiao Wang

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

Comments ECCV2024, Github: https://github.com/jefferyZhan/Griffon

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13026 2024-10-08 cs.CV cs.AI 62%

PhysDreamer: Physics-Based Interaction with 3D Objects via Video Generation

Tianyuan Zhang, Hong-Xing Yu, Rundi Wu, Brandon Y. Feng, Changxi Zheng, Noah Snavely, Jiajun Wu, William T. Freeman

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

Comments Project website at: https://physdreamer.github.io/ Appear on ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04886 2024-10-03 cs.CV cs.AI cs.CL 62%

Unveiling the Invisible: Captioning Videos with Metaphors

Abisek Rajakumar Kalarani, Pushpak Bhattacharyya, Sumit Shekhar

专题命中 视觉定位与Grounding :LLaVA(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20353 2024-10-01 cs.CV cs.LG 62%

CableInspect-AD: An Expert-Annotated Anomaly Detection Dataset

Akshatha Arodi, Margaux Luck, Jean-Luc Bedwani, Aldo Zaimi, Ge Li, Nicolas Pouliot, Julien Beaudry, Gaétan Marceau Caron

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 35 pages, to appear at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏