arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2405.11629 2024-05-21 cs.CV cs.AI 62%

Searching Realistic-Looking Adversarial Objects For Autonomous Driving Systems

Shengxiang Sun, Shenzhe Zhu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11154 2024-05-21 cs.CV cs.AI 62%

Revisiting the Robust Generalization of Adversarial Prompt Tuning

Fan Yang, Mingxuan Xia, Sangzhou Xia, Chicheng Ma, Hui Hui

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09921 2024-04-16 cs.CV cs.AI 62%

Zero-shot Building Age Classification from Facade Image Using GPT-4

Zichao Zeng, June Moh Goo, Xinglei Wang, Bin Chi, Meihui Wang, Jan Boehm

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08958 2024-04-16 cs.CV cs.CL cs.LG 62%

AMU-Tuning: Effective Logit Bias for CLIP-based Few-shot Learning

Yuwei Tang, Zhenyi Lin, Qilong Wang, Pengfei Zhu, Qinghua Hu

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07888 2024-04-03 cs.CV cs.AI 62%

Cross-modality debiasing: using language to mitigate sub-population shifts in imaging

Yijiang Pang, Bao Hoang, Jiayu Zhou

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00312 2024-04-02 cs.CV cs.AI 62%

Bayesian Exploration of Pre-trained Models for Low-shot Image Classification

Yibo Miao, Yu Lei, Feng Zhou, Zhijie Deng

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.15230 2024-03-27 cs.CV cs.CL cs.LG 62%

Troika: Multi-Path Cross-Modal Traction for Compositional Zero-Shot Learning

Siteng Huang, Biao Gong, Yutong Feng, Min Zhang, Yiliang Lv, Donglin Wang

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16226 2024-03-22 cs.CV cs.CL cs.LG 62%

TiC-CLIP: Continual Training of CLIP Models

Saurabh Garg, Mehrdad Farajtabar, Hadi Pouransari, Raviteja Vemulapalli, Sachin Mehta, Oncel Tuzel, Vaishaal Shankar, Fartash Faghri

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16101 2023-11-28 cs.CV cs.CL cs.LG 62%

How Many Unicorns Are in This Image? A Safety Evaluation Benchmark for Vision LLMs

Haoqin Tu, Chenhang Cui, Zijun Wang, Yiyang Zhou, Bingchen Zhao, Junlin Han, Wangchunshu Zhou, Huaxiu Yao, Cihang Xie

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments H.T., C.C., and Z.W. contribute equally. Work done during H.T. and Z.W.'s internship at UCSC, and C.C. and Y.Z.'s internship at UNC

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14029 2023-11-27 cs.CV cs.LG 62%

Understanding the Vulnerability of CLIP to Image Compression

Cangxiong Chen, Vinay P. Namboodiri, Julian Padget

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments R0-FoMo: Workshop on Robustness of Few-shot and Zero-shot Learning in Foundation Models at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14356 2023-11-01 cs.LG cs.CL cs.CV 62%

COCO-Counterfactuals: Automatically Constructed Counterfactual Examples for Image-Text Pairs

Tiep Le, Vasudev Lal, Phillip Howard

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to NeurIPS 2023 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03182 2023-10-06 cs.CV cs.CL cs.LG 62%

Robust and Interpretable Medical Image Classifiers via Concept Bottleneck Models

An Yan, Yu Wang, Yiwu Zhong, Zexue He, Petros Karypis, Zihan Wang, Chengyu Dong, Amilcare Gentili, Chun-Nan Hsu, Jingbo Shang, Julian McAuley

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10490 2023-10-04 cs.CR cs.AI cs.CL cs.LG 62%

Abusing Images and Sounds for Indirect Instruction Injection in Multi-Modal LLMs

Eugene Bagdasaryan, Tsung-Yin Hsieh, Ben Nassi, Vitaly Shmatikov

专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15251 2023-09-28 cs.CV cs.AI 62%

VPA: Fully Test-Time Visual Prompt Adaptation

Jiachen Sun, Mark Ibrahim, Melissa Hall, Ivan Evtimov, Z. Morley Mao, Cristian Canton Ferrer, Caner Hazirbas

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16805 2023-09-04 cs.CV cs.CL cs.LG 62%

CLIPAG: Towards Generator-Free Text-to-Image Generation

Roy Ganz, Michael Elad

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.07464 2023-07-25 cs.CV cs.LG 62%

CLIPTER: Looking at the Bigger Picture in Scene Text Recognition

Aviad Aberdam, David Bensaïd, Alona Golts, Roy Ganz, Oren Nuriel, Royee Tichauer, Shai Mazor, Ron Litman

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted for publication by ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14610 2023-06-27 cs.CV cs.CL cs.LG 62%

SugarCrepe: Fixing Hackable Benchmarks for Vision-Language Compositionality

Cheng-Yu Hsieh, Jieyu Zhang, Zixian Ma, Aniruddha Kembhavi, Ranjay Krishna

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19329 2023-06-01 cs.CV cs.IR cs.LG 62%

Mitigating Test-Time Bias for Fair Image Retrieval

Fanjie Kong, Shuai Yuan, Weituo Hao, Ricardo Henao

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12252 2023-04-06 cs.CV cs.LG 62%

Boosting Adversarial Transferability using Dynamic Cues

Muzammal Naseer, Ahmad Mahmood, Salman Khan, Fahad Khan

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments International Conference on Learning Representations (ICLR'23), Code:https://bit.ly/3Xd9gRQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02814 2023-03-27 cs.CV cs.CR cs.HC cs.LG 62%

Visual Analytics of Neuron Vulnerability to Adversarial Attacks on Convolutional Neural Networks

Yiran Li, Junpeng Wang, Takanori Fujiwara, Kwan-Liu Ma

专题命中 幻觉与鲁棒性 :visual reasoning(abstract);分类 cs.CV、cs.LG

Comments Accepted by the Special Issue on Human-Centered Explainable AI, ACM Transactions on Interactive Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10572 2023-01-20 cs.LG cs.CV 62%

General Greedy De-bias Learning

Xinzhe Han, Shuhui Wang, Chi Su, Qingming Huang, Qi Tian

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments This work has been accepted by IEEE T-PAMI. Copyright is transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07183 2022-12-02 cs.CV cs.LG 62%

Visual Classification via Description from Large Language Models

Sachit Menon, Carl Vondrick

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05844 2022-02-15 cs.LG cs.AI cs.SY eess.SY 62%

Uncertainty Aware System Identification with Universal Policies

Buddhika Laknath Semage, Thommen George Karimpanal, Santu Rana, Svetha Venkatesh

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08313 2021-09-16 cs.AI cs.CL cs.CV 62%

Does language help generalization in vision models?

Benjamin Devillers, Bhavin Choksi, Romain Bielawski, Rufin VanRullen

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

Comments Paper accepted at the CoNLL 2021 conference. This version: section added on the performance of the visual and visio-linguistic models on linquistic tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.03856 2020-11-10 cs.LG cs.CL cs.CV 62%

Learning to Model and Ignore Dataset Bias with Mixed Capacity Ensembles

Christopher Clark, Mark Yatskar, Luke Zettlemoyer

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments In EMNLP Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06195 2020-10-26 cs.CV cs.CL cs.LG 62%

Large-Scale Adversarial Training for Vision-and-Language Representation Learning

Zhe Gan, Yen-Chun Chen, Linjie Li, Chen Zhu, Yu Cheng, Jingjing Liu

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2020 Spotlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.07613 2017-11-22 cs.CV cs.AI cs.CL 62%

Are You Talking to Me? Reasoned Visual Dialog Generation through Adversarial Learning

Qi Wu, Peng Wang, Chunhua Shen, Ian Reid, Anton van den Hengel

专题命中 幻觉与鲁棒性 :visual question answering(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06356 2026-07-08 eess.IV cs.CV 新提交 61%

TMF-RSE: Tri-Modal Fusion with Regional Semantics and Evidential Uncertainty for Lung Severity Scoring

TMF-RSE:用于肺部严重程度评分的具有区域语义和证据不确定性的三模态融合

Fadi Abdeladhim Zidi, Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Gaby Maroun, Fadi Dornaika, Cosimo Distante

机构 * Institute of Applied Sciences and Intelligent Systems (ISASI), CNR(应用科学与智能系统研究所(ISASI),CNR) Department of Computer Science and Artificial Intelligence, University of the Basque Country (UPV/EHU)(巴斯克国家大学计算机科学与人工智能系) University of Salento(萨莱nton大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV;VLM(comments)

AI总结 针对从胸部影像量化肺部疾病严重程度的问题,提出TMF-RSE框架,结合多模态特征,采用互补融合机制和证据回归,在相关数据集实验中性能优于基于Transformer的基线。

Comments 6 pages, 2 figures, 5 tables. IEEE conference format (IEEEtran). Submitted to AVSS 2026. Tri-modal fusion for lung severity scoring using appearance, segmentation, and VLM semantics with evidential uncertainty

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04655 2025-11-07 cs.CV 61%

Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts

Ellis Brown, Jihan Yang, Shusheng Yang, Rob Fergus, Saining Xie

机构 * New York University(纽约大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV;MLLM(comments)

Comments Project page: https://cambrian-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00171 2025-08-04 cs.CV cs.CL 61%

On the Risk of Misleading Reports: Diagnosing Textual Biases in Multimodal Clinical AI

David Restrepo, Ira Ktena, Maria Vakalopoulou, Stergios Christodoulidis, Enzo Ferrante

机构 * MICS, CentraleSupélec - Université Paris-Saclay, France(MICS,中央圣艾尔布兰大学-巴黎萨克雷大学,法国) Google DeepMind, London, UK(谷歌DeepMind,伦敦,英国) CONICET, Universidad de Buenos Aires, Argentina(CONICET,布宜诺斯艾利斯大学,阿根廷)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV;multimodal large language model(comments)

Comments Accepted to MICCAI 2025 1st Workshop on Multimodal Large Language Models (MLLMs) in Clinical Practice

详情

展开后加载摘要…

URL PDF HTML 收藏