arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-07-31 至 2025-07-31 共收录 27 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2503.07631 2025-07-31 cs.LG cs.CL 83%

OWLViz: An Open-World Benchmark for Visual Question Answering

Thuy Nguyen, Dang Nguyen, Hoang Nguyen, Thuan Luong, Long Hoang Dang, Viet Dac Lai

机构 * Posts and Telecommunications Institute of Technology, Viet Nam(越南电信技术研究所) Adobe Research, USA(Adobe研究) University of Maryland, USA(美国马里兰大学)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);分类 cs.LG

Comments 8 pages + appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22346 2025-07-31 cs.CV 77%

DeltaVLM: Interactive Remote Sensing Image Change Analysis via Instruction-guided Difference Perception

Pei Deng, Wenqian Zhou, Hanlin Wu

机构 * School of Information Science and Technology, Beijing Foreign Studies University(信息科学与技术学院,北京外国语大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

Comments 12 pages, 5 figures. Submitted to IEEE Transactions on Geoscience and Remote Sensing (TGRS). Code and dataset are available at https://github.com/hanlinwu/DeltaVLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04585 2025-07-31 cs.CL 50%

MuSciClaims: Multimodal Scientific Claim Verification

Yash Kumar Lal, Manikanta Bandham, Mohammad Saqib Hasan, Apoorva Kashi, Mahnaz Koupaee, Niranjan Balasubramanian

机构 * Stony Brook University(石溪大学)

专题命中 视觉问答 :vision-language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 2 篇

2506.12447 2025-07-31 cs.CV 79%

CLIP-HandID: Vision-Language Model for Hand-Based Person Identification

Nathanael L. Baisa, Babu Pallam, Amudhavel Jayavel

机构 * School of Computer Science(计算机科学学院) Informatics De Montfort University(信息学德蒙特福特大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22074 2025-07-31 cs.LG cs.CL 70%

CIMR: Contextualized Iterative Multimodal Reasoning for Robust Instruction Following in LVLMs

Yangshu Yuan, Heng Chen, Xinyi Jiang, Christian Ng, Kexin Qiu

机构 * Singapore Institute of Management(新加坡管理学院)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 7 篇

2501.06680 2025-07-31 cs.CV cs.AI cs.LG cs.RO 82%

Application of Vision-Language Model to Pedestrians Behavior and Scene Understanding in Autonomous Driving

Haoxiang Gao, Li Zhang, Yu Zhao, Zhou Yang, Jinghan Cao

机构 * ECE Department(电子工程系) Carnegie Mellon University(卡内基梅隆大学) Computer Science Department(计算机科学系) Columbia University(哥伦比亚大学) Rotman School of Management(罗特曼管理学院) University of Toronto(多伦多大学) Department of Statistics(统计学系) George Washington University(乔治华盛顿大学) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19947 2025-07-31 cs.RO cs.CL cs.IT cs.LG cs.SY eess.SY math.IT 79%

Spatial Language Likelihood Grounding Network for Bayesian Fusion of Human-Robot Observations

Supawich Sitdhipol, Waritwong Sukprasongdee, Ekapol Chuangsuwanich, Rina Tse

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.LG

Comments Accepted to the 2025 IEEE International Conference on Systems, Man, and Cybernetics (SMC); Supplementary video: https://cu-asl.github.io/fp-lgn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04047 2025-07-31 cs.CV 79%

Move to Understand a 3D Scene: Bridging Visual Grounding and Exploration for Efficient and Versatile Embodied Navigation

Ziyu Zhu, Xilin Wang, Yixuan Li, Zhuofan Zhang, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Wei Liang, Qian Yu, Zhidong Deng, Siyuan Huang, Qing Li

机构 * Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学) Beihang University(北航) State Key Laboratory of General Artificial Intelligence, BIGAI, China(国家一般人工智能重点实验室, BIGAI, 中国)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

Comments Embodied AI; 3D Vision Language Understanding; ICCV 2025 Highlight; https://mtu3d.github.io; Spatial intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22802 2025-07-31 cs.CV cs.AI 62%

Advancing Fetal Ultrasound Image Quality Assessment in Low-Resource Settings

Dongli He, Hu Wang, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

Comments Accepted to the MICCAI 2025 MIRASOL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04858 2025-07-31 cs.AI cs.LG 62%

Don't Lag, RAG: Training-Free Adversarial Detection Using RAG

Roie Kazoom, Raz Lapid, Moshe Sipper, Ofer Hadar

机构 * Electrical and Computer Engineering, Ben Gurion University, Beer Sheba 84105, Israel(电子与计算机工程系,本· Gurion 大学) Computer Science, Ben Gurion University, Beer Sheba 84105, Israel(计算机科学系,本· Gurion 大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.AI、cs.LG

Comments Accepted at VecDB @ ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22617 2025-07-31 cs.CR cs.CV 57%

Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions

Yiting Qu, Ziqing Yang, Yihan Ma, Michael Backes, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心) TU Delft(代尔夫特理工大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

Comments Accepted at ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22213 2025-07-31 cs.IR cs.LG 57%

Intent-Aware Neural Query Reformulation for Behavior-Aligned Product Search

Jayanth Yetukuri, Ishita Khan

机构 * eBay Inc(eBay公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

Comments Accepted at SIGIR eCom'25. https://sigir-ecom.github.io/eCom25Papers/paper_23.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏

4. GUI与屏幕智能体 1 篇

2504.11257 2025-07-31 cs.HC cs.CL cs.CV 83%

UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis

Xinyi Liu, Xiaoyi Zhang, Ziyun Zhang, Yan Lu

专题命中 GUI与屏幕智能体 :grounding(title,abstract);vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 2 篇

2506.16218 2025-07-31 cs.CV 79%

FOCoOp: Enhancing Out-of-Distribution Robustness in Federated Prompt Learning for Vision-Language Models

Xinting Liao, Weiming Liu, Jiaming Qian, Pengyang Zhou, Jiahe Xu, Wenjie Wang, Chaochao Chen, Xiaolin Zheng, Tat-Seng Chua

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

Comments Accepted by ICML25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22744 2025-07-31 cs.CL cs.AI 57%

Reducing Hallucinations in Summarization via Reinforcement Learning with Entity Hallucination Index

Praveenkumar Katwe, Rakesh Chandra, Balabantaray Kali, Prasad Vittala

机构 * International Institute of Information Technology(国际信息研究所) Informatica Business Solutions(Informatica商务解决方案)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

Comments 8

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 8 篇

2503.19386 2025-07-31 cs.CV eess.SP 85%

Exploring Textual Semantics Diversity for Image Transmission in Semantic Communication Systems using Visual Language Model

Peishan Huang, Dong Li

机构 * School of Computer Science and Engineering, Macau University of Science and Technology(计算机科学与工程学院,澳门科技大学)

专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22469 2025-07-31 cs.CV cs.AI cs.LG 85%

Visual Language Models as Zero-Shot Deepfake Detectors

Viacheslav Pirogov

专题命中 VLM训练与架构 :visual language model(title);vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted to the ICML 2025 Workshop on Reliable and Responsible Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22304 2025-07-31 cs.CR 85%

Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding

Chetan Pathade

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract)

Comments 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22431 2025-07-31 cs.CV 83%

HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models

Zhixiang Wei, Guangting Wang, Xiaoxiao Ma, Ke Mei, Huaian Chen, Yi Jin, Fengyun Rao

机构 * University of Science and Technology of China(中国科学技术大学) WeChat Vision, Tencent Inc.(腾讯公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21391 2025-07-31 cs.CV cs.AI cs.CL 80%

Multimodal LLMs as Customized Reward Models for Text-to-Image Generation

Shijie Zhou, Ruiyi Zhang, Huaisheng Zhu, Branislav Kveton, Yufan Zhou, Jiuxiang Gu, Jian Chen, Changyou Chen

机构 * University at Buffalo(布法罗大学) Adobe Research(Adobe研究) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 VLM训练与架构 :LLaVA(abstract,comments);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

Comments Accepted at ICCV 2025. Code available at https://github.com/sjz5202/LLaVA-Reward

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22076 2025-07-31 cs.LG 70%

Test-time Prompt Refinement for Text-to-Image Models

Mohammad Abdul Hafeez Khan, Yash Jain, Siddhartha Bhattacharyya, Vibhav Vineet

机构 * Florida Institute of Technology(佛罗里达理工学院) Microsoft Research(微软研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

Comments Accepted to ICCV 2025, MARS2 Workshop. Total 14 pages, 12 figures and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22003 2025-07-31 cs.CV 57%

See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs

Ziyun Dai, Xiaoqiang Li, Shaohua Zhang, Yuanchen Wu, Jide Li

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM25

Journal ref 33rd ACM International Conference on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22100 2025-07-31 cs.CV 57%

Trade-offs in Image Generation: How Do Different Dimensions Interact?

Sicheng Zhang, Binzhu Xie, Zhonghao Yan, Yuli Zhang, Donghao Zhou, Xiaofei Chen, Shi Qiu, Jiaqi Liu, Guoyang Xie, Zhichao Lu

机构 * Khalifa University(卡利法大学) The Chinese University of Hong Kong(香港中文大学) Queen Mary University of London(伦敦大学玛丽女王学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted in ICCV 2025, Codebase: https://github.com/fesvhtr/TRIG

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 4 篇

2507.12060 2025-07-31 cs.CV cs.AI cs.MM 81%

InstructFLIP: Exploring Unified Vision-Language Model for Face Anti-spoofing

Kun-Hsiang Lin, Yu-Wen Tseng, Kang-Yang Huang, Jhih-Ciang Wu, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Taiwan Normal University(国立台湾师范大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

Comments Accepted by MM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07076 2025-07-31 cs.CV cs.AI 73%

StoryTeller: Improving Long Video Description through Global Audio-Visual Character Identification

Yichen He, Yuan Lin, Jianchao Wu, Hanchong Zhang, Yuchen Zhang, Ruicheng Le

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14200 2025-07-31 cs.CV cs.AI 62%

Enhancing Multimodal In-Context Learning for Image Classification through Coreset Optimization

Huiyi Chen, Jiawei Peng, Kaihua Tang, Xin Geng, Xu Yang

机构 * Southeast University(东南大学) Huawei Singapore Research Center(华为新加坡研究中心)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22075 2025-07-31 cs.LG 57%

Prototype-Guided Pseudo-Labeling with Neighborhood-Aware Consistency for Unsupervised Adaptation

Eman Ali, Chetan Arora, Muhammad Haris Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Indian Institute of Technology Delhi(印度德里理工学院) Alexandria University(亚历山大大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏