arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-21 至 2026-01-21 共收录 8 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 8 篇

2601.12865 2026-01-21 cs.CV 83%

Proxy Robustness in Vision Language Models is Effortlessly Transferable

视觉语言模型中的代理鲁棒性可以轻易转移

Xiaowei Fu, Fuxiang Huang, Lei Zhang

机构 * Chongqing Key Laboratory of Bio-perception(重庆生物感知实验室) Multimodal Intelligent Information Processing, Chongqing University, Chongqing 401331, China(多模态智能信息处理,重庆大学,重庆401331,中国) School of Microelectronics(微电子学院) Communication Engineering, Chongqing University, Chongqing 401331, China(通信工程,重庆大学,重庆401331,中国) School of Data Science, Lingnan University, Hong Kong(数据科学学院,岭南大学,香港)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出HPT-GPD框架,通过异构代理转移提升视觉语言模型的对抗鲁棒性,同时缓解过拟合问题,增强零样本自然泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12672 2026-01-21 cs.CV 83%

VILTA: A VLM-in-the-Loop Adversary for Enhancing Driving Policy Robustness

VILTA:一种用于增强驾驶策略鲁棒性的视觉语言模型闭环对抗者

Qimao Chen, Fang Li, Shaoqing Xu, Zhiyi Lai, Zixun Xie, Yuechen Luo, Shengyin Jiang, Hanbing Li, Long Chen, Bing Wang, Yi Zhang, Zhi-Xin Yang

专题命中 幻觉与鲁棒性 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 VILTA通过整合视觉语言模型到闭环训练中,提升自动驾驶策略在长尾事件中的安全性和鲁棒性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13238 2026-01-21 cs.CV cs.AI 81%

A Semantic Decoupling-Based Two-Stage Rainy-Day Attack for Revealing Weather Robustness Deficiencies in Vision-Language Models

基于语义解耦的两阶段雨天攻击:揭示视觉-语言模型在天气鲁棒性方面的缺陷

Chengyin Hu, Xiang Chen, Zhe Jia, Weiwen Shi, Fengyu Zhang, Jiujiang Guo, Yiwei Wei

机构 * Chengyin Hu(独立研究者) Xiang Chen(独立研究者) Zhe Jia(独立研究者) Weiwen Shi(独立研究者) Fengyu Zhang(独立研究者) Jiujiang Guo(独立研究者) Yiwei Wei(独立研究者)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种基于语义解耦的两阶段雨天攻击框架,揭示了视觉-语言模型在天气鲁棒性方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12443 2026-01-21 cs.CV cs.AI 81%

Adversarial Defense in Vision-Language Models: An Overview

视觉-语言模型中的对抗防御:概述

Xiaowei Fu, Lei Zhang

机构 * School of Microelectronics and Communication Engineering(微电子与通信工程学院) Chongqing University(重庆大学) Chongqing, China(中国重庆)

专题命中 幻觉与鲁棒性 :vision-language model(title);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了视觉-语言模型对抗防御的最新进展,探讨了三种主要防御范式及其优缺点,旨在提升模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04459 2026-01-21 cs.CL cs.LG 70%

Uncertainty-Aware Collaborative System of Large and Small Models for Multimodal Sentiment Analysis

面向大规模和小规模模型的不确定性感知协作系统用于多模态情感分析

Shiqin Han, Manning Gao, Menghua Jiang, Yuncheng Jiang, Haifeng Hu, Sijie Mai

机构 * School of Computer Science, South China Normal University(计算机科学学院,华南师范大学) School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) School of Electronics and Information Technology, Sun Yat-sen University(电子与信息工程学院,中山大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 本文提出U-ACS系统,通过整合UBM与MLLMs,利用不确定性感知机制提升多模态情感分析的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13462 2026-01-21 cs.AI 57%

SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation

SpatialBench-UC: 文本到图像生成中空间提示遵循的不确定性感知评估

Amine Rostane

机构 * ESIEA

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 SpatialBench-UC通过评估文本到图像生成中空间提示遵循的不确定性,提出了一个可重复的基准测试,以提高模型在空间指令下的表现和置信度评估。

Comments 19 pages, includes figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20136 2026-01-21 cs.CL cs.AI cs.IR 57%

Multi-Stage Verification-Centric Framework for Mitigating Hallucination in Multi-Modal RAG

多阶段验证导向框架用于缓解多模态RAG中的幻觉

Baiyu Chen, Wilson Wongso, Xiaoqian Hu, Yue Tan, Flora Salim

机构 * The University of New South Wales(新南威尔士大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文提出了一种多阶段验证导向框架,通过优先考虑事实准确性和真实性来缓解多模态RAG中的幻觉问题,并在KDD Cup 2025中取得第三名。

Comments KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07601 2026-01-21 cs.CV 57%

Unified Source-Free Domain Adaptation

统一无源领域适应

Song Tang, Wenxin Su, Mao Ye, Boyu Wang, Xiatian Zhu

机构 * Institute of Machine Intelligence, University of Shanghai for Science and Technology(上海理工大学机器智能研究院) TAMS Group, Department of Informatics, Universität Hamburg(汉堡大学信息学院TAMS小组) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CausalDA,从因果性角度解决统一无源领域适应问题,通过预训练视觉-语言模型和信息瓶颈提升模型鲁棒性,在多种SFDA场景中取得新成果。

详情

展开后加载摘要…

URL PDF HTML 收藏