arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 17 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 17 篇

2602.00414 2026-02-03 cs.CV cs.LG 84%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00523 2026-02-03 cs.CV 83%

SAGE: Accelerating Vision-Language Models via Entropy-Guided Adaptive Speculative Decoding

SAGE:通过熵引导的自适应推测解码加速视觉-语言模型

Yujia Tong, Tian Zhang, Yunyang Wan, Kaiwei Lin, Jingling Yuan, Chuang Hu

机构 * School of Computer Science(计算机科学学院) Artificial Intelligence, Wuhan University of Technology, Hubei 430070, China(人工智能,武汉科技大学,湖北430070,中国) School of Computer Science, Wuhan University, Hubei 430072, China(计算机科学学院,武汉大学,湖北430072,中国)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 SAGE通过熵引导的自适应推测解码方法,动态调整树结构以提高视觉-语言模型的解码速度,实现高达3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01025 2026-02-03 cs.LG cs.AI cs.CV 82%

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

迈向通用且可迁移的视觉-语言模型劫持攻击

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) School of Information Technology, Deakin University, Australia(德肯大学信息科技系) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01037 2026-02-03 cs.CV cs.AI 81%

VEQ: Modality-Adaptive Quantization for MoE Vision-Language Models

VEQ: 适用于MoE视觉-语言模型的模态自适应量化

Guangshuo Qin, Zhiteng Li, Zheng Chen, Weihang Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 VEQ通过模态自适应量化方法提升MoE视觉-语言模型的压缩性能,实现更高的准确率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00559 2026-02-03 cs.CV cs.AI 81%

Learning to Decode Against Compositional Hallucination in Video Multimodal Large Language Models

在视频多模态大语言模型中学习对抗组合性幻觉

Wenbin Xing, Quanxing Zha, Lizheng Zu, Mengran Li, Ming Li, Junchi Yan

机构 * Sun Yat-sen University(中山大学) Huaqiao University(华侨大学) Shenzhen University(深圳大学) Guangming Laboratory(光明实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对视频多模态大语言模型中的组合性幻觉问题,提出TriCD框架,通过对比解码和三路径校准机制提升模型在对抗幻觉时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11325 2026-02-03 cs.CV cs.AI 81%

Robust MLLM Unlearning via Visual Knowledge Distillation

通过视觉知识蒸馏实现鲁棒的多模态大语言模型去学习

Yuhang Wang, Zhenxing Niu, Haoxuan Ji, Guangyu He, Haichang Gao, Gang Hua

机构 * Xidian University, China(西安电子科技大学) XJTU University, China(西安交通大学) Amazon.com, USA(亚马逊公司)

专题命中 幻觉与鲁棒性 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过视觉知识蒸馏实现多模态大语言模型的鲁棒去学习,有效保留文本知识并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12706 2026-02-03 cs.CV cs.AI 81%

NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models

NAP-Tuning: 用于对抗鲁棒视觉-语言模型的神经增强提示微调

Jiaming Zhang, Xin Wang, Xingjun Ma, Lingyu Qiu, Yu-Gang Jiang, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(复旦大学计算机学院智能信息处理重点实验室) Department of Mathematics and Applications, University of Naples Federico II(那不勒斯费德里克二世大学应用数学系) State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学先进轨道交通自主运行国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 NAP-Tuning通过神经增强框架提升视觉-语言模型的对抗鲁棒性,实现多模态提示微调和特征净化,显著提升模型在对抗攻击下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00420 2026-02-03 cs.CV cs.AI cs.CR 81%

Text is All You Need for Vision-Language Model Jailbreaking

文本就是视觉-语言模型劫持所需

Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00247 2026-02-03 cs.CV cs.LG 81%

CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models

CAPA:面向高效大视觉-语言模型的贡献感知剪枝与FFN近似

Samyak Jha, Junho Kim

机构 * Indian Institute of Technology (ISM) Dhanbad, India(印度理工学院(ISM)达翰巴德分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 CAPA通过贡献感知剪枝和FFN近似,提升大视觉-语言模型的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00993 2026-02-03 cs.RO cs.AI 79%

HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving

HERMES: 一种集成端到端风险感知多模态具身系统,用于长尾自动驾驶

Weizhe Tang, Junwei You, Jiaxi Liu, Zhaoyi Wang, Rui Gan, Zilin Huang, Feng Wei, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(土木与环境工程系,威斯康星大学麦迪逊分校)

专题命中 幻觉与鲁棒性 :vision-language model(title);VLM(abstract);分类 cs.AI

AI总结 HERMES通过整合视觉-语言模型和多模态感知,提升自动驾驶在长尾混合交通场景中的风险感知和轨迹规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01452 2026-02-03 cs.CV cs.AI 73%

Cross-Paradigm Evaluation of Gaze-Based Semantic Object Identification for Intelligent Vehicles

跨范式评估基于注视的语义物体识别用于智能车辆

Penghao Deng, Jidong J. Yang, Jiachen Bian

机构 * Smart Mobility & Infrastructure Laboratory(智能移动与基础设施实验室) College of Engineering, University of Georgia(工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文通过三种方法评估基于注视的语义物体识别,发现大型VLM在识别小型安全关键物体上表现优异,但传统检测器在实时性上更高效。

Comments 21 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25178 2026-02-03 cs.CV cs.AI cs.LG 67%

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST:诱导幻觉的多模态大语言模型图像生成

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) University of Maryland(马里兰大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02004 2026-02-03 cs.CV cs.AI 62%

ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning

ClueTracer: 问题到视觉线索追踪用于无训练 hallucination 抑制在多模态推理

Gongli Xi, Kun Wang, Zeming Gao, Huahui Yi, Haolang Lu, Ye Tian, Wendong Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) West China Biomedical Big Data Center(西京生物大数据中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 ClueTracer通过问题到视觉线索追踪,无训练抑制多模态推理中的幻觉,提升推理和非推理任务性能。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07114 2026-02-03 cs.CV 57%

Semantically Guided Dynamic Visual Prototype Refinement for Compositional Zero-Shot Learning

语义引导的动态视觉原型精炼用于组合零样本学习

Zhong Peng, Yishi Xu, Gerong Wang, Wenchao Chen, Bo Chen, Jing Zhang, Hongwei Liu

机构 * National Key Laboratory of Radar Signal Processing, Xidian University(雷达信号处理国家级重点实验室,西安电子科技大学) Research Institute of Systems Engineering, Academy of Military Science(系统工程研究所,军事科学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 Duplex通过动态视觉原型精炼和双原型学习,提升组合零样本学习中语义判别性和泛化能力。

Comments Accepted for publication in Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01031 2026-02-03 cs.AI cs.CL 57%

HalluHard: A Hard Multi-Turn Hallucination Benchmark

HalluHard: 一种具有挑战性的多轮 hallucination 评估基准

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

机构 * EPFL(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 HalluHard是一种具有挑战性的多轮hallucination评估基准,通过内联引用和网络搜索评估模型的事实性输出,发现即使使用网络搜索,幻觉仍然普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00621 2026-02-03 cs.CV 57%

Towards Interpretable Hallucination Analysis and Mitigation in LVLMs via Contrastive Neuron Steering

通过对比神经元引导实现大型视觉语言模型中幻觉分析与缓解

Guangtao Lyu, Xinyi Cheng, Qi Liu, Chenghao Xu, Jiexi Yan, Muli Yang, Fen Fang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi'an, China(西安电子科技大学电子工程学院) School of Computer Science and Technology, Xidian University, Xi'an, China(西安电子科技大学计算机科学与技术学院) College of Computer and Information, Hohai University, Nanjing, China(河海大学计算机与信息学院) Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 通过对比神经元引导方法,分析并缓解大型视觉语言模型中的幻觉问题,提升视觉表示的稳健性和语义基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14391 2026-02-03 cs.CL cs.AI 57%

Hallucination-Resistant Relation Extraction via Dependency-Aware Sentence Simplification and Two-tiered Hierarchical Refinement

通过依赖感知句子简化和双层级层次精炼实现抗幻觉的关系抽取

Yupei Yang, Fan Feng, Lin Yang, Wanxi Deng, Lin Qu, Biwei Huang, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Alibaba Group(阿里巴巴集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 DEPTH通过依赖感知句子简化和双层级层次精炼提升关系抽取的准确性,将幻觉率降低至7.9%,F1分数提升9.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏