arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7441 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7441 篇

2403.09307 2024-09-17 cs.CV 57%

Annotation Free Semantic Segmentation with Vision Foundation Models

Soroush Seifi, Daniel Olmeda Reino, Fabien Despinoy, Rahaf Aljundi

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08468 2024-09-16 cs.CV 57%

Generalization Boosted Adapter for Open-Vocabulary Segmentation

Wenhao Xu, Changwei Wang, Xuxiang Feng, Rongtao Xu, Longzhao Huang, Zherui Zhang, Li Guo, Shibiao Xu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08278 2024-09-13 cs.CV 57%

DreamHOI: Subject-Driven Generation of 3D Human-Object Interactions with Diffusion Priors

Thomas Hanwen Zhu, Ruining Li, Tomas Jakab

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Project page: https://DreamHOI.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08102 2024-09-13 cs.CV 57%

Bayesian Self-Training for Semi-Supervised 3D Segmentation

Ozan Unal, Christos Sakaridis, Luc Van Gool

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18197 2024-09-12 cs.CV 57%

Human-Free Automated Prompting for Vision-Language Anomaly Detection: Prompt Optimization with Meta-guiding Prompt Scheme

Pi-Wei Chen, Jerry Chun-Wei Lin, Jia Ji, Feng-Hao Yeh, Zih-Ching Chen, Chao-Chun Chen

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06535 2024-09-11 cs.CV 57%

PoseEmbroider: Towards a 3D, Visual, Semantic-aware Human Pose Representation

Ginger Delmas, Philippe Weinzaepfel, Francesc Moreno-Noguer, Grégory Rogez

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Published in ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06348 2024-09-11 cs.SD cs.AI cs.CR eess.AS 57%

VoiceWukong: Benchmarking Deepfake Voice Detection

Ziwei Yan, Yanjie Zhao, Haoyu Wang

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19605 2024-09-11 cs.CV 57%

Look Hear: Gaze Prediction for Speech-directed Human Attention

Sounak Mondal, Seoyoung Ahn, Zhibo Yang, Niranjan Balasubramanian, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted for ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15580 2024-09-06 cs.CV 57%

Open-Vocabulary SAM3D: Towards Training-free Open-Vocabulary 3D Scene Understanding

Hanchen Tai, Qingdong He, Jiangning Zhang, Yijie Qian, Zhenyu Zhang, Xiaobin Hu, Xiangtai Li, Yabiao Wang, Yong Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments Project page: https://hithqd.github.io/projects/OV-SAM3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02418 2024-09-05 cs.CV 57%

MOSMOS: Multi-organ segmentation facilitated by medical report supervision

Weiwei Tian, Xinyu Huang, Junlin Hou, Caiyue Ren, Longquan Jiang, Rui-Wei Zhao, Gang Jin, Yuejie Zhang, Daoying Geng

专题命中 视觉定位与Grounding :visual question answering(abstract);分类 cs.CV

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11421 2024-09-05 cs.CV 57%

Enhancing the vision-language foundation model with key semantic knowledge-emphasized report refinement

Weijian Huang, Cheng Li, Hao Yang, Jiarun Liu, Yong Liang, Hairong Zheng, Shanshan Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.05904 2024-09-05 cs.CV 57%

Enhancing Representation in Radiography-Reports Foundation Model: A Granular Alignment Algorithm Using Masked Contrastive Learning

Weijian Huang, Cheng Li, Hong-Yu Zhou, Hao Yang, Jiarun Liu, Yong Liang, Hairong Zheng, Shaoting Zhang, Shanshan Wang

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Journal ref Nature Communications 15, 7620 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10723 2024-09-04 cs.CV 57%

Anticipating Future Object Compositions without Forgetting

Youssef Zahran, Gertjan Burghouts, Yke Bauke Eisma

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.09826 2024-09-02 cs.CV 57%

3D Weakly Supervised Semantic Segmentation with 2D Vision-Language Guidance

Xiaoxu Xu, Yitian Yuan, Jinlong Li, Qiudan Zhang, Zequn Jie, Lin Ma, Hao Tang, Nicu Sebe, Xu Wang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14032 2024-08-27 cs.CV 57%

More Pictures Say More: Visual Intersection Network for Open Set Object Detection

Bingcheng Dong, Yuning Ding, Jinrong Zhang, Sifan Zhang, Shenglan Liu

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments 7pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11221 2024-08-22 cs.CV 57%

On the Potential of Open-Vocabulary Models for Object Detection in Unusual Street Scenes

Sadia Ilyas, Ido Freeman, Matthias Rottmann

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08751 2024-08-19 cs.CV eess.IV 57%

Comparative Analysis of Generative Models: Enhancing Image Synthesis with VAEs, GANs, and Stable Diffusion

Sanchayan Vivekananthan

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08575 2024-08-19 cs.CV 57%

Tell Codec What Worth Compressing: Semantically Disentangled Image Coding for Machine with LMMs

Jinming Liu, Yuntao Wei, Junyan Lin, Shengyang Zhao, Heming Sun, Zhibo Chen, Wenjun Zeng, Xin Jin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08412 2024-08-19 cs.CV 57%

Penny-Wise and Pound-Foolish in Deepfake Detection

Yabin Wang, Zhiwu Huang, Su Zhou, Adam Prugel-Bennett, Xiaopeng Hong

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08305 2024-08-16 cs.CV 57%

Towards Flexible Visual Relationship Segmentation

Fangrui Zhu, Jianwei Yang, Huaizu Jiang

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07773 2024-08-16 cs.LG 57%

MedTsLLM: Leveraging LLMs for Multimodal Medical Time Series Analysis

Nimeesha Chan, Felix Parker, William Bennett, Tianyi Wu, Mung Yao Jia, James Fackler, Kimia Ghobadi

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.LG

Comments published in Proceedings of Machine Learning Research, MLHC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07600 2024-08-15 cs.CV 57%

Disentangle and denoise: Tackling context misalignment for video moment retrieval

Kaijing Ma, Han Fang, Xianghao Zang, Chao Ban, Lanxiang Zhou, Zhongjiang He, Yongxiang Li, Hao Sun, Zerun Feng, Xingsong Hou

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05802 2024-08-13 cs.CV 57%

Egocentric Vision Language Planning

Zhirui Fang, Ming Yang, Weishuai Zeng, Boyu Li, Junpeng Yue, Ziluo Ding, Xiu Li, Zongqing Lu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05729 2024-08-13 cs.CV 57%

A Training-Free Framework for Video License Plate Tracking and Recognition with Only One-Shot

Haoxuan Ding, Qi Wang, Junyu Gao, Qiang Li

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16501 2024-08-13 cs.CV 57%

Context-Aware Indoor Point Cloud Object Generation through User Instructions

Yiyang Luo, Ke Lin, Chao Gu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

Comments Accepted by ACMMM'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.00616 2024-08-13 cs.CV 57%

OpenIns3D: Snap and Lookup for 3D Open-vocabulary Instance Segmentation

Zhening Huang, Xiaoyang Wu, Xi Chen, Hengshuang Zhao, Lei Zhu, Joan Lasenby

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments ECCV 2024. Project page: https://zheninghuang.github.io/OpenIns3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04568 2024-08-09 cs.CL cs.AI 57%

Learning Fine-Grained Grounded Citations for Attributed Large Language Models

Lei Huang, Xiaocheng Feng, Weitao Ma, Yuxuan Gu, Weihong Zhong, Xiachong Feng, Weijiang Yu, Weihua Peng, Duyu Tang, Dandan Tu, Bing Qin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments Accepted by ACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17374 2024-08-05 cs.HC cs.AI 57%

Co-designing an AI Impact Assessment Report Template with AI Practitioners and AI Compliance Experts

Edyta Bogucka, Marios Constantinides, Sanja Šćepanović, Daniele Quercia

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21721 2024-08-01 cs.MM cs.AI 57%

Open-Vocabulary Audio-Visual Semantic Segmentation

Ruohao Guo, Liao Qu, Dantong Niu, Yanyu Qi, Wenzhen Yue, Ji Shi, Bowei Xing, Xianghua Ying

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI

Comments Accepted by ACM MM 2024 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21654 2024-08-01 cs.CV 57%

MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment

Anurag Das, Xinting Hu, Li Jiang, Bernt Schiele

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

Comments accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏