arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7494 篇

2502.14604 2025-04-08 cs.LG 79%

Noisy Test-Time Adaptation in Vision-Language Models

Chentao Cao, Zhun Zhong, Zhanke Zhou, Tongliang Liu, Yang Liu, Kun Zhang, Bo Han

机构 * Hong Kong Baptist University(香港浸会大学) Hefei University of Technology(合肥工业大学) The University of Sydney(悉尼大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02286 2025-04-04 cs.CV 79%

Moment Quantization for Video Temporal Grounding

Xiaolong Sun, Le Wang, Sanping Zhou, Liushuai Shi, Kun Xia, Mengnan Liu, Yabing Wang, Gang Hua

机构 * Xi’an Jiaotong University(西安交通大学) Dolby Laboratories(杜比实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01952 2025-04-03 cs.CV 79%

Image Difference Grounding with Natural Language

Wenxuan Wang, Zijia Zhao, Yisi Zhang, Yepeng Tang, Erdong Hu, Xinlong Wang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) University of Science and Technology Beijing(北京科技大学) Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00019 2025-04-02 cs.CL cs.AI cs.SE 79%

ObscuraCoder: Powering Efficient Code LM Pre-Training Via Obfuscation Grounding

Indraneil Paul, Haoyi Yang, Goran Glavaš, Kristian Kersting, Iryna Gurevych

机构 * TU Darmstadt(达姆施塔特工业大学) JMU Würzburg(维尔茨堡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10437 2025-04-02 cs.CV 79%

4D LangSplat: 4D Language Gaussian Splatting via Multimodal Large Language Models

Wanhua Li, Renping Zhou, Jiawei Zhou, Yingwei Song, Johannes Herter, Minghan Qin, Gao Huang, Hanspeter Pfister

机构 * Harvard University(哈佛大学) Tsinghua University(清华大学) Stony Brook University(石溪大学) Brown University(布朗大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://4d-langsplat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23181 2025-04-01 cs.CV 79%

Enhancing Weakly Supervised Video Grounding via Diverse Inference Strategies for Boundary and Prediction Selection

Sunoh Kim, Daeho Um

机构 * Dankook University(檀国大学) Samsung Electronics(三星电子)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18290 2025-03-27 cs.CV 79%

Stealthy Backdoor Attack in Self-Supervised Learning Vision Encoders for Large Vision Language Models

Zhaoyi Liu, Huan Zhang

机构 * University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04923 2025-03-26 cs.CV 79%

VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos

Shehan Munasinghe, Hanan Gani, Wenqi Zhu, Jiale Cao, Eric Xing, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Tianjin University(天津大学) Carnegie Mellon University(卡内基梅隆大学) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Technical Report of VideoGLaMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15024 2025-03-25 cs.CV 79%

Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models

Jin Wang, Chenghui Lv, Xian Li, Shichao Dong, Huadong Li, kelu Yao, Chao Li, Wenqi Shao, Ping Luo

机构 * The University of Hong Kong(香港大学) HKU Shanghai Intelligent Computing Research Center(港大上海智能计算研究中心) Shanghai AI Laboratory(上海人工智能实验室) Zhejiang Laboratory(浙江实验室) Hangzhou Institute for Advanced Study(杭州高等研究院) Zhejiang University(浙江大学) Alibaba(阿里巴巴) MEGVII Technology(旷视科技)

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

Comments 31 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16776 2025-03-24 cs.CV 79%

OpenCity3D: What do Vision-Language Models know about Urban Environments?

Valentin Bieri, Marco Zamboni, Nicolas S. Blumer, Qingxuan Chen, Francis Engelmann

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Published at WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10332 2025-03-24 cs.CV 79%

Number it: Temporal Grounding Videos like Flipping Manga

Yongliang Wu, Xinting Hu, Yuyang Sun, Yizhou Zhou, Wenbo Zhu, Fengyun Rao, Bernt Schiele, Xu Yang

机构 * Southeast University(东南大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) WeChat Vision, Tencent Inc.(腾讯公司微信视觉部) University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17053 2025-03-18 cs.CV 79%

Contextual Self-paced Learning for Weakly Supervised Spatio-Temporal Video Grounding

Akash Kumar, Zsolt Kira, Yogesh Singh Rawat

机构 * University of Central Florida(中佛罗里达大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICLR'25 Main Conference. Project Page: https://akash2907.github.io/cospal_webpage

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08520 2025-03-18 cs.CV 79%

GroundingBooth: Grounding Text-to-Image Customization

Zhexiao Xiong, Wei Xiong, Jing Shi, He Zhang, Yizhi Song, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Adobe(奥多比公司) Purdue University(普渡大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Project page: https://groundingbooth.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03461 2025-03-17 cs.CL cs.LG 79%

Auto-GDA: Automatic Domain Adaptation for Efficient Grounding Verification in Retrieval-Augmented Generation

Tobias Leemann, Periklis Petridis, Giuseppe Vietri, Dionysis Manousakas, Aaron Roth, Sergul Aydore

机构 * University of Tübingen(蒂宾根大学) MIT(麻省理工学院) AWS AI Labs(亚马逊云科技人工智能实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10500 2025-03-14 cs.CV 79%

OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding

Jiali Yao, Xinran Deng, Xin Gu, Mengrui Dai, Bing Fan, Zhipeng Zhang, Yan Huang, Heng Fan, Libo Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) North China University of Technology(北方工业大学) University of North Texas(北得克萨斯大学) Shanghai Jiao Tong University(上海交通大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07244 2025-03-13 cs.CV cs.CL 79%

Can Vision-Language Models Evaluate Handwritten Math?

Oikantik Nath, Hanani Bathina, Mohammed Safi Ur Rahman Khan, Mitesh M. Khapra

机构 * Indian Institute of Technology, Madras(马德拉斯印度理工学院) AI4Bharat Chennai Mathematical Institute(金奈数学研究所)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08084 2025-03-12 cs.RO cs.AI 79%

Instruction-Augmented Long-Horizon Planning: Embedding Grounding Mechanisms in Embodied Mobile Manipulation

Fangyuan Wang, Shipeng Lyu, Peng Zhou, Anqing Duan, Guodong Guo, David Navarro-Alarcon

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

Comments 17 pages, 11 figures

Journal ref AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06142 2025-03-11 cs.CV 79%

VLForgery Face Triad: Detection, Localization and Attribution via Multimodal Large Language Models

Xinan He, Yue Zhou, Bing Fan, Bin Li, Guopu Zhu, Feng Ding

机构 * Nanchang University(南昌大学) Shenzhen University(深圳大学) University of North Texas(北得克萨斯大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04034 2025-03-11 cs.CV 79%

Task-oriented Sequential Grounding and Navigation in 3D Scenes

Zhuofan Zhang, Ziyu Zhu, Junhao Li, Pengxiang Li, Tianxu Wang, Tengyu Liu, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Siyuan Huang, Qing Li

机构 * BIGAI(北京智源人工智能研究院) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments website: https://sg-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05082 2025-03-10 cs.CV 79%

Taming Video Diffusion Prior with Scene-Grounding Guidance for 3D Gaussian Splatting from Sparse Inputs

Yingji Zhong, Zhihao Li, Dave Zhenyu Chen, Lanqing Hong, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Accepted by CVPR2025. The project page is available at https://zhongyingji.github.io/guidevd-3dgs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04250 2025-03-07 cs.CV cs.HC 79%

An Egocentric Vision-Language Model based Portable Real-time Smart Assistant

Yifei Huang, Jilan Xu, Baoqi Pei, Yuping He, Guo Chen, Mingfang Zhang, Lijin Yang, Zheng Nie, Jinyao Liu, Guoshun Fan, Dechen Lin, Fang Fang, Kunpeng Li, Chang Yuan, Xinyuan Chen, Yaohui Wang, Yali Wang, Yu Qiao, Limin Wang

机构 * The University of Tokyo(东京大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉定位与Grounding :vision-language model(title);grounding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05643 2025-03-04 cs.CV 79%

TRACE: Temporal Grounding Video LLM via Causal Event Modeling

Yongxin Guo, Jingyu Liu, Mingda Li, Qingbin Liu, Xi Chen, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Tencent PCG(腾讯平台与内容事业群) Shenzhen Institute of Artificial Intelligence and Robotics for Society (AIRS)(深圳市人工智能与机器人研究院) Guangdong Provincial Key Laboratory of Future Networks of Intelligence(广东省未来智能网络重点实验室)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20572 2025-03-03 cs.CV cs.CL 79%

HazardNet: A Small-Scale Vision Language Model for Real-Time Traffic Safety Detection at Edge Devices

Mohammad Abu Tami, Mohammed Elhenawy, Huthaifa I. Ashqar

专题命中 视觉定位与Grounding :vision language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16786 2025-03-03 cs.CV 79%

SwimVG: Step-wise Multimodal Fusion and Adaption for Visual Grounding

Liangtao Shi, Ting Liu, Xiantao Hu, Yue Hu, Quanjun Yin, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) National University of Defense Technology(国防科技大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19247 2025-02-28 cs.CV 79%

ProxyTransformation: Preshaping Point Cloud Manifold With Proxy Attention For 3D Visual Grounding

Qihang Peng, Henry Zheng, Gao Huang

机构 * Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 12 pages, 3 figures. Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.09599 2025-02-26 cs.CV cs.MM 79%

Language-Guided Diffusion Model for Visual Grounding

Sijia Chen, Baochun Li

机构 * University of Toronto(多伦多大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16842 2025-02-25 cs.CV 79%

Exploring Causes and Mitigation of Hallucinations in Large Vision Language Models

Yaqi Sun, Kyohei Atarashi, Koh Takeuchi, Hisashi Kashima

机构 * Kyoto University(京都大学)

专题命中 视觉定位与Grounding :vision language model(title);vision-language model(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16585 2025-02-25 cs.CV 79%

Anatomical grounding pre-training for medical phrase grounding

Wenjun Zhang, Shakes Chandra, Aaron Nicolson

机构 * University of Queensland(昆士兰大学) Australian e-Health Research Centre, CSIRO Health and Biosecurity(澳大利亚联邦科学与工业研究组织健康与生物安全部澳大利亚电子健康研究中心)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16539 2025-02-25 cs.CV 79%

Data-Efficient 3D Visual Grounding via Order-Aware Referring

Tung-Yu Wu, Sheng-Yu Huang, Yu-Chiang Frank Wang

机构 * National Taiwan University(台湾大学) NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments accepted to WACV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16223 2025-02-25 cs.CV 79%

Prompt as Knowledge Bank: Boost Vision-language model via Structural Representation for zero-shot medical detection

Yuguang Yang, Tongfei Chen, Haoyu Huang, Linlin Yang, Chunyu Xie, Dawei Leng, Xianbin Cao, Baochang Zhang

机构 * School of Electronic Information Engineering, Beihang University(北京航空航天大学电子信息工程学院) AI Research, Qihoo 360(奇虎360公司360人工智能研究院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) National Superior College for Engineers, Beihang University(北京航空航天大学国家优秀工程师学院) Artificial Intelligence Research Center, Lobachevsky State University(罗巴切夫斯基国立大学人工智能研究中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV

Comments Accepted as ICLR 2025 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏