arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2508.14391 2026-02-03 cs.CL cs.AI 57%

Hallucination-Resistant Relation Extraction via Dependency-Aware Sentence Simplification and Two-tiered Hierarchical Refinement

通过依赖感知句子简化和双层级层次精炼实现抗幻觉的关系抽取

Yupei Yang, Fan Feng, Lin Yang, Wanxi Deng, Lin Qu, Biwei Huang, Shikui Tu, Lei Xu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California San Diego(加州大学圣地亚哥分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Alibaba Group(阿里巴巴集团)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 DEPTH通过依赖感知句子简化和双层级层次精炼提升关系抽取的准确性,将幻觉率降低至7.9%,F1分数提升9.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23041 2026-02-02 cs.CV 57%

One-shot Optimized Steering Vector for Hallucination Mitigation for VLMs

单次优化的转向向量用于VLMs的幻觉缓解

Youxu Shi, Suorong Yang, Dong Liu

机构 * University of Science(科学大学) Nanjing University(南京大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV

AI总结 本文提出OSGA框架,通过单次优化生成通用转向向量,有效缓解VLMs的幻觉问题并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21220 2026-01-30 cs.CV 57%

LAMP: Learning Universal Adversarial Perturbations for Multi-Image Tasks via Pre-trained Models

LAMP: 通过预训练模型学习通用对抗扰动以实现多图像任务

Alvi Md Ishmam, Najibul Haque Sarker, Zaber Ibn Abdul Hakim, Chris Thomas

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 LAMP通过预训练模型学习通用对抗扰动,针对多图像多模态大语言模型实现高效的黑盒攻击,提升了多任务攻击成功率。

Comments Accepted in main technical track AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18874 2026-01-30 cs.HC cs.AI cs.CR cs.CY 57%

When Ads Become Profiles: Uncovering the Invisible Risk of Web Advertising at Scale with LLMs

当广告成为资料:利用LLMs揭示大规模网络广告中的隐形风险

Baiyu Chen, Benjamin Tag, Hao Xue, Daniel Angus, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Queensland University of Technology(昆士兰理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 利用LLMs揭示广告流中的隐私信息泄露风险,展示其在大规模数据中的高精度推断能力。

Comments The ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21789 2026-01-29 cs.MA cs.CV 57%

Visual Multi-Agent System: Mitigating Hallucination Snowballing via Visual Flow

视觉多智能体系统:通过视觉流缓解幻觉雪球效应

Xinlei Yu, Chengming Xu, Guibin Zhang, Yongbo He, Zhangquan Chen, Zhucun Xue, Jiangning Zhang, Yue Liao, Xiaobin Hu, Yu-Gang Jiang, Shuicheng Yan

机构 * National University of Singapore(国立新加坡大学) Tencent Youtu Lab(腾讯优图实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 幻觉与鲁棒性 :visual language model(abstract);分类 cs.CV

AI总结 本文提出ViF方法,通过视觉流和注意力重新分配缓解多智能体系统中的视觉幻觉雪球效应,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18698 2026-01-27 cs.CV 57%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21885 2026-01-27 cs.CV cs.MM cs.RO 57%

Integrating Multi-Modal Sensors: A Review of Fusion Techniques for Intelligent Vehicles

多模态传感器整合:智能车辆融合技术综述

Chuheng Wei, Ziye Qin, Ziyan Zhang, Guoyuan Wu, Matthew J. Barth

机构 * College of Engineering, Center for Environmental Research and Technology, University of California at Riverside(工程学院、环境研究与技术中心、加州大学河滨分校) School of Transportation and Logistics, Southwest Jiaotong University(交通运输与物流学院、西南交通大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文综述了多传感器融合技术在自动驾驶中的应用,分析了深度学习方法、多模态数据集及新兴趋势,强调了其提升系统适应性和鲁棒性的潜力。

Comments Accepted by IEEE IV 2025

Journal ref Proceedings of the 2025 IEEE Intelligent Vehicles Symposium (IV), pp. 1817-1824, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03473 2026-01-27 cs.CY cs.AI cs.CL 57%

Exploring LGBTQ+ Bias in Generative AI Answers across Different Country and Religious Contexts

探索不同国家和宗教背景下生成AI回答中的LGBTQ+偏见

Lilla Vicsek, Anna Vancsó, Mike Zajko, Judit Takacs

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本研究探讨生成AI在不同国家和宗教背景下对LGBTQ+偏见的回应,发现ChatGPT 3.5表现出文化相对主义,而Bard强调人权并提供更多支持。

Comments Replacement version -- includes link to BD&S journal publication (significantly revised) in abstract, but the manuscript here remains unchanged from the original arXiv version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15115 2026-01-22 cs.CV 57%

Training-Free and Interpretable Hateful Video Detection via Multi-stage Adversarial Reasoning

无需训练的多阶段对抗推理 hateful 视频检测

Shuonan Yang, Yuchen Zhang, Zeyu Fu

机构 * Multimodal Intelligence Lab, Department of Computer Science, University of Exeter, United Kingdom(埃克塞特大学计算机科学系多模态智能实验室) Institute for Analytics and Data Science, University of Essex, United Kingdom(埃塞克斯大学分析与数据科学研究所)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 MARS通过多阶段对抗推理框架实现无需训练的可解释仇恨视频检测,提升检测可靠性与透明度。

Comments Accepted at ICASSP 2026. \c{opyright} 2026 IEEE. This is the author accepted manuscript. The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14310 2026-01-22 cs.CR cs.AI 57%

CORVUS: Red-Teaming Hallucination Detectors via Internal Signal Camouflage in Large Language Models

CORVUS:通过内部信号伪装在大语言模型中实现红色团队幻觉检测

Nay Myat Min, Long H. Pham, Hongyu Zhang, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Chongqing University(重庆大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 CORVUS 通过内部信号伪装技术,有效检测大语言模型中的幻觉问题,并推动了对手意识的审计方法。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13462 2026-01-21 cs.AI 57%

SpatialBench-UC: Uncertainty-Aware Evaluation of Spatial Prompt Following in Text-to-Image Generation

SpatialBench-UC: 文本到图像生成中空间提示遵循的不确定性感知评估

Amine Rostane

机构 * ESIEA

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 SpatialBench-UC通过评估文本到图像生成中空间提示遵循的不确定性,提出了一个可重复的基准测试,以提高模型在空间指令下的表现和置信度评估。

Comments 19 pages, includes figures and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20136 2026-01-21 cs.CL cs.AI cs.IR 57%

Multi-Stage Verification-Centric Framework for Mitigating Hallucination in Multi-Modal RAG

多阶段验证导向框架用于缓解多模态RAG中的幻觉

Baiyu Chen, Wilson Wongso, Xiaoqian Hu, Yue Tan, Flora Salim

机构 * The University of New South Wales(新南威尔士大学)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文提出了一种多阶段验证导向框架,通过优先考虑事实准确性和真实性来缓解多模态RAG中的幻觉问题,并在KDD Cup 2025中取得第三名。

Comments KDD Cup 2025 Meta CRAG-MM Challenge: Third Prize in the Single-Source Augmentation Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07601 2026-01-21 cs.CV 57%

Unified Source-Free Domain Adaptation

统一无源领域适应

Song Tang, Wenxin Su, Mao Ye, Boyu Wang, Xiatian Zhu

机构 * Institute of Machine Intelligence, University of Shanghai for Science and Technology(上海理工大学机器智能研究院) TAMS Group, Department of Informatics, Universität Hamburg(汉堡大学信息学院TAMS小组) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CausalDA,从因果性角度解决统一无源领域适应问题,通过预训练视觉-语言模型和信息瓶颈提升模型鲁棒性,在多种SFDA场景中取得新成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09929 2026-01-16 cs.AI 57%

Hallucination Detection and Mitigation in Large Language Models

大语言模型中的幻觉检测与缓解

Ahmad Pesaranghader, Erin Li

机构 * CIBC(加拿大帝国商业银行)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种系统化的框架,通过分层架构和闭环反馈机制,提升大语言模型在金融等高风险领域的可靠性,减少幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09165 2026-01-15 cs.LG 57%

Multi-Teacher Ensemble Distillation: A Mathematical Framework for Probability-Domain Knowledge Aggregation

多教师集成蒸馏:概率域知识聚合的数学框架

Aaron R. Flouro, Shawn P. Chadwick

机构 * Sparse-Tech

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出了一种概率域知识聚合的数学框架,通过公理化方法定义了多教师集成蒸馏的核心原理,并提供了理论保障和多种实现策略。

Comments 7 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12992 2026-01-14 cs.RO cs.CL cs.CV cs.MA 57%

UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles

UNCAP:基于自然语言通信的不确定性引导神经符号规划

Neel P. Bhatt, Po-han Li, Kushagra Gupta, Rohan Siva, Daniel Milan, Alexander T. Hogue, Sandeep P. Chinchali, David Fridovich-Keil, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 UNCAP通过自然语言通信和不确定性引导方法,提升多车辆协同自动驾驶系统的可扩展性和安全性。

Journal ref AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14367 2026-01-12 cs.CV 57%

Hallucination Score: Towards Mitigating Hallucinations in Generative Image Super-Resolution

幻觉分数:朝着减轻生成图像超分辨率中的幻觉

Weiming Ren, Raghav Goyal, Zhiming Hu, Tristan Ty Aumentado-Armstrong, Iqbal Mohomed, Alex Levinshtein

机构 * University of Waterloo(多伦多大学) AI Center – Toronto, Samsung Electronics(三星电子人工智能中心)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出幻觉分数以衡量和减轻生成图像超分辨率中的幻觉问题,通过多模态大语言模型生成 HS 并用于模型微调。

Comments 31 pages, 21 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02917 2026-01-07 cs.CL cs.AI 57%

RAL2M: Retrieval Augmented Learning-To-Match Against Hallucination in Compliance-Guaranteed Service Systems

RAL2M:检索增强的学习-匹配以对抗幻觉在合规保障服务系统中

Mengze Hong, Di Jiang, Jiangtao Wen, Zhiyang Su, Yawen Li, Yanjie Sun, Guan Wang, Chen Jason Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) New York University Shanghai(纽约大学上海分校) Hong Kong University of Science and Technology(香港科技大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 RAL2M通过检索增强的学习-匹配框架,利用众智消除生成幻觉,提升合规保障服务系统的响应可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20034 2026-01-05 cs.CV cs.CL 57%

Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore

视觉编码器真的能解释物体幻觉吗?:通过简单细粒度CLIPScore缓解物体幻觉

Hongseok Oh, Wonseok Hwang

机构 * Department of Artificial intelligence University of Seoul(人工智能系首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出F-CLIPScore,通过细粒度文本嵌入缓解LVLM中的物体幻觉问题,显著提升评估准确性。

Comments Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20981 2025-12-30 cs.CV cs.CL cs.RO 57%

RefAV: Towards Planning-Centric Scenario Mining

RefAV:面向规划导向的场景挖掘

Cainan Davidson, Deva Ramanan, Neehar Peri

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 RefAV通过视觉-语言模型改进场景挖掘,解决自动驾驶中复杂多智能体交互的定位问题。

Comments Project Page: https://cainand.github.io/RefAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18623 2025-12-23 cs.CL cs.AI 57%

LLM-CAS: Dynamic Neuron Perturbation for Real-Time Hallucination Correction

LLM-CAS: 动态神经元扰动用于实时幻觉修正

Jensen Zhang, Ningyuan Liu, Yijia Fan, Zihao Huang, Qinglin Zeng, Kaitong Cai, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 LLM-CAS通过动态神经元扰动实现实时幻觉修正,提升大型语言模型的事实准确性。

Comments Accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11712 2025-12-23 cs.AI 57%

Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization

通过理论一致的对称多模态偏好优化缓解幻觉

Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie

机构 * Shandong University(山东大学) Southern University of Science and Technology(南方科技大学) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09814 2025-12-22 cs.CV 57%

On the dynamic evolution of CLIP texture-shape bias and its relationship to human alignment and model robustness

CLIP纹理-形状偏倚的动态演变及其与人类对齐和模型鲁棒性的关系

Pablo Hernández-Cámara, Jose Manuel Jaén-Lorites, Alexandra Gómez-Villa, Jorge Vila-Tomás, Valero Laparra, Jesus Malo

机构 * Image Processing Lab, Universitat de Valencia, Spain(瓦伦西亚大学图像处理实验室) Centro de Biomateriales e Ingenieria Tisular, Universitat Politecnica de Valencia, Spain(瓦伦西亚理工大学生物材料与组织工程中心) Computer Vision Center, Spain(西班牙计算机视觉中心) Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究CLIP模型在训练过程中纹理-形状偏倚的演变,揭示其与人类感知对齐及模型鲁棒性的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16723 2025-12-19 cs.LG 57%

KOSS: Kalman-Optimal Selective State Spaces for Long-Term Sequence Modeling

KOSS:基于卡尔曼最优选择状态空间的长期序列建模

Lei Wang, Xin Tan, Mingwei Wang, Ying Zhang

机构 * School of Electronic Information(电子信息学院) Artificial Intelligence, Shaanxi University of Science(人工智能,陕西科技大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 KOSS通过卡尔曼最优选择机制,在长期序列建模中实现高效且鲁棒的上下文感知选择,显著提升预测准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15776 2025-12-19 cs.AI cs.MA cs.RO 57%

Emergence: Overcoming Privileged Information Bias in Asymmetric Embodied Agents via Active Querying

涌现:通过主动查询克服不对称具身智能体中的特权信息偏差

Shaun Baek, Sam Liu, Joseph Ukpong

机构 * Emory University(埃默里大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文通过主动查询机制解决不对称具身智能体中的特权信息偏差问题,揭示了沟通接地错误对协作成功率的影响。

Comments 12 pages, 9 pages of content, 6 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12500 2025-12-16 cs.HC cs.AI 57%

Explainable AI as a Double-Edged Sword in Dermatology: The Impact on Clinicians versus The Public

可解释AI在皮肤科中的双刃剑作用:对医生与公众的影响

Xuhai Xu, Haoyu Hu, Haoran Zhang, Will Ke Wang, Reina Wang, Luis R. Soenksen, Omar Badri, Sheharbano Jafry, Elise Burger, Lotanna Nwandu, Apoorva Mehta, Erik P. Duhaime, Asif Qasim, Hause Lin, Janis Pereira, Jonathan Hershon, Paulius Mui, Alejandro A. Gru, Noémie Elhadad, Lena Mamykina, Matthew Groh, Philipp Tschandl, Roxana Daneshjou, Marzyeh Ghassemi

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究探讨了可解释AI在皮肤科诊断中的影响,发现不同专业背景的人对XAI的反应不同,LLM在医疗AI中具有双刃剑效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11330 2025-12-15 cs.CV 57%

Noise Matters: Optimizing Matching Noise for Diffusion Classifiers

噪声至关重要:优化扩散分类器的匹配噪声

Yanghao Wang, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出NoOp方法,通过频率匹配和空间匹配原则优化扩散分类器的噪声,以提升分类稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07497 2025-12-10 cs.AI cs.SE 57%

How Do LLMs Fail In Agentic Scenarios? A Qualitative Analysis of Success and Failure Scenarios of Various LLMs in Agentic Simulations

大型语言模型在代理场景中为何失败?对各种LLM在代理模拟中成功与失败场景的定性分析

JV Roig

机构 * Kamiwaza AI

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 研究分析了LLM在代理任务中的失败原因,发现模型规模不决定鲁棒性,强调训练和设计对可靠性的重要性。

Comments 48 pages, 3 tables, 2 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02324 2025-12-09 cs.CL cs.AI 57%

Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning

通过CASAL减少幻觉:对比激活引导用于近似学习

Wannan, Yang, Xinchi Qiu, Lei Yu, Yuchen Zhang, Aobo Yang, Narine Kokhlikyan, Nicola Cancedda, Diego Garcia-Olano

机构 * Meta Superintelligence Labs(Meta超级智能实验室) New York University(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 CASAL通过对比激活引导减少LLM幻觉,提升模型可解释性和实用性,适用于多种模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04895 2025-12-05 cs.AI cs.MA 57%

Chameleon: Adaptive Adversarial Agents for Scaling-Based Visual Prompt Injection in Multimodal AI Systems

Chameleon:基于尺度的视觉提示注入的自适应对抗代理

M Zeeshan, Saud Satti

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 Chameleon是一种自适应对抗框架,通过动态优化图像扰动来暴露和利用多模态AI系统中的缩放漏洞,显著提高攻击成功率并影响决策准确性。

Comments 5 pages, 2 figures, IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏