arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2272 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 2272 篇

2603.01625 2026-03-03 cs.CL cs.AI 57%

Measuring What VLMs Don't Say: Validation Metrics Hide Clinical Terminology Erasure in Radiology Report Generation

衡量VLMs不表达的内容:验证指标隐藏了放射学报告生成中的临床术语擦除

Aditya Parikh, Aasa Feragen, Sneha Das, Stella Frank

机构 * DTU Compute, Technical University of Denmark(丹麦技术大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出临床关联位移(CAD)和加权关联擦除(WAE)指标,用于评估放射学报告生成中临床术语的保留情况,揭示当前验证指标在临床术语擦除方面的不足。

Comments This is an extended version of a manuscript currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01603 2026-03-03 cs.CV 57%

Sparse View Distractor-Free Gaussian Splatting

稀疏视角无干扰高斯点云法

Yi Gu, Zhaorui Wang, Jiahang Cao, Jiaxu Wang, Mingle Zhao, Dongjun Ye, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Macau(澳门大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种基于先验信息的框架,用于提升稀疏视角下无干扰3DGS的性能,通过几何模型和视觉-语言模型增强训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23676 2026-03-02 cs.CV 57%

Suppressing Prior-Comparison Hallucinations in Radiology Report Generation via Semantically Decoupled Latent Steering

通过语义解耦潜在引导抑制放射科报告生成中的先验比较幻觉

Ao Li, Rui Liu, Mingjie Li, Sheng Liu, Lei Wang, Xiaodan Liang, Lina Yao, Xiaojun Chang, Lei Xing

机构 * University of New South Wales(新南威尔士大学) Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,技术悉尼大学) Stanford University(斯坦福大学) School of Computing and Information Technology of University of Wollongong Australia(沃林根澳大利亚大学计算与信息科技学院) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出语义解耦潜在引导方法,通过正交化技术减少放射科报告生成中的历史幻觉,提升临床准确性与报告忠实度。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00445 2026-03-02 cs.CV 57%

AutoDebias: Automated Framework for Debiasing Text-to-Image Models

AutoDebias:文本到图像模型的自动化去偏框架

Hongyi Cai, Mohammad Mahdinur Rahman, Mingkang Dong, Muxin Pu, Moqyad Alqaily, Jie Li, Xinfeng Li, Jialie Shen, Meikang Qiu, Qingsong Wen

机构 * Universiti Malaya(马来大学) Monash University(莫纳什大学) United Arab Emirates University(阿拉伯联合酋长国大学) University of Science and Technology Beijing(北京科技大学) Nanyang Technological University (NTU)(南洋理工大学) City St George’s, University of London(伦敦大学圣乔治学院) Augusta University(奥古斯塔大学) Squirrel Ai Learning

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 AutoDebias提出了一种自动化框架,用于检测和减轻文本到图像模型中的恶意偏见,通过视觉语言模型和CLIP引导的训练过程,有效应对隐秘注入的刻板印象和多重攻击。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07319 2026-03-02 cs.CL cs.AI 57%

Beyond Accuracy: Risk-Sensitive Evaluation of Hallucinated Medical Advice

超越准确性:对幻觉医疗建议的风险敏感评估

Savan Doshi

机构 * ASU(亚利桑那州立大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种风险敏感的评估框架,用于评估医疗建议中的幻觉风险,通过量化风险性语言来识别高风险、低支撑的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04403 2026-02-27 cs.CV cs.CL cs.CR 57%

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

自适应数据集构建用于现实世界多模态安全场景

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种图像导向的自适应数据集构建方法,用于构建现实世界多模态安全场景的数据集,通过生成35,000个图像-文本对及其指导响应,提升了安全评估的有效性。

Comments Accepted at EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20873 2026-02-25 cs.CV 57%

MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

MUSE: 通过精确和多样的语义提升少样本全滑片图像分类

Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu

机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18701 2026-02-25 cs.CV 57%

UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation

UniGenBench++: 一个统一的语义评估基准用于文本到图像生成

Yibin Wang, Zhimin Li, Yuhang Zang, Jiazi Bu, Yujie Zhou, Yi Xin, Junjun He, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

专题命中 幻觉与鲁棒性 :MLLM(abstract);分类 cs.CV

AI总结 UniGenBench++ 提出一个统一的语义评估基准,涵盖多样化的现实场景和多语言支持,用于评估文本到图像生成模型的语义一致性。

Comments Project page: codegoat24.github.io/UniGenBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19198 2026-02-24 cs.CV 57%

Prompt Tuning for CLIP on the Pretrained Manifold

在预训练流形上进行CLIP的提示调优

Xi Yang, Yuanrong Xu, Weigang Zhang, Guangming Lu, David Zhang, Jie Wen

机构 * Guizhou University, Guiyang, China(贵州大学) Harbin Institute of Technology, China(哈尔滨工业大学) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳))

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 ManiPT通过在预训练流形上进行提示调优,引入余弦一致性约束和结构偏差,以提高模型在有限监督下的泛化能力和转移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18711 2026-02-24 cs.CV 57%

HIME: Mitigating Object Hallucinations in LVLMs via Hallucination Insensitivity Model Editing

HIME: 通过幻觉不敏感模型编辑缓解LVLMs中的物体幻觉

Ahmed Akl, Abdelwahed Khamis, Ali Cheraghian, Zhe Wang, Sara Khalifa, Kewen Wang

机构 * School of Information and Communication Technology, Griffith University, Australia(信息与通信技术学院,格里菲斯大学) Data61, CSIRO, Australia(Data61,澳大利亚联邦科学与工业研究组织) School of Engineering, Macquarie University, Sydney, Australia(工程学院,麦觉大学) School of Information Systems, Queensland University of Technology, Australia(信息系统学院,昆士兰技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 HIME通过分层加权编辑方法有效抑制LVLMs中的物体幻觉,减少61.8%的幻觉问题,无需额外参数或计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18055 2026-02-23 cs.LG 57%

Continual-NExT: A Unified Comprehension And Generation Continual Learning Framework

Continual-NExT: 一种统一的理解和生成持续学习框架

Jingyang Qiao, Zhizhong Zhang, Xin Tan, Jingyu Gong, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xiamen University(厦门大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出Continual-NExT框架,通过MAGE方法提升双到双多模态大语言模型的持续学习能力,实现跨模态知识转移和减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17030 2026-02-20 cs.CV cs.RO 57%

Patch-Based Spatial Authorship Attribution in Human-Robot Collaborative Paintings

基于补丁的空间作者归属在人类-机器人协作绘画中

Eric Chen, Patricia Alves-Oliveira

机构 * Robotics, University of Michigan, Ann Arbor, Michigan, United States(机器人学,密歇根大学,安娜堡,密歇根,美国)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 本文提出了一种基于补丁的空间作者归属方法,用于人类-机器人协作绘画,通过实验验证在数据稀缺情况下有效区分混合作者身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12907 2026-02-19 cs.LG cs.CL 57%

SNAP-UQ: Self-supervised Next-Activation Prediction for Single-Pass Uncertainty in TinyML

SNAP-UQ:单次传递的不确定性估计用于TinyML中的自监督下一次激活预测

Ismail Lamaakal, Chaymae Yahyati, Khalid El Makkaoui, Ibrahim Ouahbi, Yassine Maleh

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 SNAP-UQ通过单次传递的自监督下一次激活预测,为TinyML提供了一种高效且无需额外状态的不确定性估计方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15516 2026-02-18 cs.CV 57%

Semantic-Guided 3D Gaussian Splatting for Transient Object Removal

语义引导的3D高斯点云对瞬态物体去除

Aditi Prabakaran, Priyesh Shukla

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于语义分类的3D高斯点云瞬态去除方法,通过CLIP相似度分数和阈值校准提升重建质量,减少内存开销并保持实时渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06082 2026-02-17 cs.CV 57%

Are foundation models for computer vision good conformal predictors?

计算机视觉基础模型是否是良好的符合预测器?

Leo Fillioux, Julio Silva-Rodríguez, Ismail Ben Ayed, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis, Jose Dolz

机构 * MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央理工巴黎高等学院、巴黎-萨克雷大学) LIVIA, ILLS, ETS Montréal(LIVIA、ILLs、蒙特利尔工程师学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了计算机视觉基础模型在符合预测中的表现,发现其适合符合化过程,但校准置信度预测会降低效率,且视觉-语言模型在少样本适应中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14430 2026-02-17 cs.LG 57%

A unified framework for evaluating the robustness of machine-learning interpretability for prospect risking

评估机器学习可解释性在勘探风险中的鲁棒性统一框架

Prithwijit Chowdhury, Ahmad Mustafa, Mohit Prabhushankar, Ghassan AlRegib

机构 * Center for Energy and Geo Processing (CeGP)(能源与地球处理中心) Omni Lab for Intelligent Visual Engineering and Science (OLIVES)(智能视觉工程与科学实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.LG

AI总结 本文提出统一框架,通过量化必要性和充分性来评估LIME和SHAP在高维结构化勘探风险数据中的鲁棒性。

Journal ref Geophysics 90, no. 3 (2025): IM103-IM118

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23519 2026-02-17 cs.CR cs.AI 57%

ReliabilityRAG: Effective and Provably Robust Defense for RAG-based Web-Search

ReliabilityRAG: 有效且可证明的防御方法用于基于检索的Web搜索

Zeyu Shen, Basileal Imana, Tong Wu, Chong Xiang, Prateek Mittal, Aleksandra Korolova

机构 * Department of Computer Science(计算机科学系) Princeton University(普林斯顿大学) Center for Information Technology Policy(信息政策中心) Department of Electrical and Computer Engineering(电气与计算机工程系) NVIDIA(英伟达)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 ReliabilityRAG通过利用文档可靠性信息,提供更有效且可证明鲁棒的防御方法,以增强基于检索的Web搜索系统对对抗攻击的抵御能力。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14182 2026-02-13 cs.CL cs.LG 57%

LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs

LabSafety Bench: 对科学实验室中AI安全问题的LLM基准测试

Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh, Amita Bedar, Sujay Shekar, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.LG

AI总结 LabSafety Bench通过评估LLMs和VLMs在实验室安全问题上的表现,揭示了当前模型在危险识别和风险评估方面的不足,强调了对AI安全评估框架的迫切需求。

Comments Published at Nature Machine Intelligence

Journal ref Nat Mach Intell 8, 20-31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11743 2026-02-13 cs.CV 57%

Adaptive Debiasing Tsallis Entropy for Test-Time Adaptation

自适应去偏Tsallis熵用于测试时适应

Xiangyu Wu, Dongming Jiang, Feng Yu, Yueying Tian, Jiaqi Tang, Qing-Guo Chen, Yang Yang, Jianfeng Lu

机构 * Nanjing University of Science and Technology(南京理工大学) Alibaba Cloud(阿里云) University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Sussex(Sussex 大学) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出自适应去偏Tsallis熵用于测试时适应,通过引入非广延参数q来缓解预训练数据偏差,提升模型适应性能。

Comments Accepted for publication at ICLR 2026; 24 pages; 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10771 2026-02-12 cs.CV cs.RO 57%

From Steering to Pedalling: Do Autonomous Driving VLMs Generalize to Cyclist-Assistive Spatial Perception and Planning?

从转向到踩踏:自动驾驶VLMs是否能泛化到骑行辅助的空间感知与规划?

Krishna Kanth Nakka, Vedasri Nakka

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CyclingVQA基准,评估自动驾驶VLMs在骑行辅助场景中的感知与推理能力,发现现有模型在骑行特定交通提示理解上存在不足,需进一步改进。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 57%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19844 2026-02-12 cs.CV 57%

ProAPO: Progressively Automatic Prompt Optimization for Visual Classification

ProAPO:逐步自动提示优化用于视觉分类

Xiangyan Qu, Gaopeng Gou, Jiamin Zhuang, Jing Yu, Kun Song, Qihao Wang, Yili Li, Gang Xiong

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Information Engineering, Minzu University of China(民族大学信息工程学院) University of Science and Technology Beijing(北京科技大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 ProAPO通过逐步自动优化提示,提升视觉分类性能,优于现有方法并在多个数据集上取得显著改进。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09541 2026-02-11 cs.CV 57%

Scalpel: Fine-Grained Alignment of Attention Activation Manifolds via Mixture Gaussian Bridges to Mitigate Multimodal Hallucination

Scalpel: 通过混合高斯桥梁实现细粒度注意力激活流形对齐以缓解多模态幻觉

Ziqiang Shi, Rujie Liu, Shanshan Yu, Satoshi Munakata, Koichi Shirahata

机构 * Fujitsu Research & Development Center Co.,LTD.(Fujitsu 研究与开发中心有限公司) Fujitsu Limited(Fujitsu 有限公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 Scalpel通过高斯混合模型和熵最优传输减少多模态幻觉,实现注意力激活流形的细粒度对齐,提升视觉-语言模型的输出一致性。

Comments WACV 2026 (It was accepted in the first round, with an acceptance rate of 6%.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06822 2026-02-09 cs.AI 57%

POP: Online Structural Pruning Enables Efficient Inference of Large Foundation Models

POP:在线结构剪枝实现大基础模型的高效推理

Yi Chen, Wonjin Shin, Shuhong Liu, Tho Mai, Jeongmo Lee, Chuanbo Hua, Kun Wang, Jun Liu, Joo-Young Kim

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) University of Tokyo, Tokyo, Japan(东京大学) Tokyo Institute of Technology, Tokyo, Japan(东京技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 POP通过在线结构剪枝提升大基础模型推理效率,实现动态剪枝与低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06195 2026-02-09 cs.CV 57%

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

DeDPO:用于扩散模型的去偏直接偏好优化

Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

机构 * Cornell University(康奈尔大学) Rutgers University(罗格斯大学) NYU(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 DeDPO通过整合因果推理的去偏技术,提升扩散模型在低成本合成监督下的对齐性能,实现与人类标注数据相当的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05105 2026-02-06 cs.AI cs.RO cs.SE 57%

GAMMS: Graph based Adversarial Multiagent Modeling Simulator

基于图的对抗多智能体建模模拟器

Rohan Patil, Jai Malegaonkar, Xiao Jiang, Andre Dion, Gaurav S. Sukhatme, Henrik I. Christensen

机构 * University of Southern California(美国南加州大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI 57%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07114 2026-02-03 cs.CV 57%

Semantically Guided Dynamic Visual Prototype Refinement for Compositional Zero-Shot Learning

语义引导的动态视觉原型精炼用于组合零样本学习

Zhong Peng, Yishi Xu, Gerong Wang, Wenchao Chen, Bo Chen, Jing Zhang, Hongwei Liu

机构 * National Key Laboratory of Radar Signal Processing, Xidian University(雷达信号处理国家级重点实验室,西安电子科技大学) Research Institute of Systems Engineering, Academy of Military Science(系统工程研究所,军事科学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 Duplex通过动态视觉原型精炼和双原型学习,提升组合零样本学习中语义判别性和泛化能力。

Comments Accepted for publication in Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01031 2026-02-03 cs.AI cs.CL 57%

HalluHard: A Hard Multi-Turn Hallucination Benchmark

HalluHard: 一种具有挑战性的多轮 hallucination 评估基准

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko

机构 * EPFL(苏黎世联邦理工学院) ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 HalluHard是一种具有挑战性的多轮hallucination评估基准,通过内联引用和网络搜索评估模型的事实性输出,发现即使使用网络搜索,幻觉仍然普遍存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00621 2026-02-03 cs.CV 57%

Towards Interpretable Hallucination Analysis and Mitigation in LVLMs via Contrastive Neuron Steering

通过对比神经元引导实现大型视觉语言模型中幻觉分析与缓解

Guangtao Lyu, Xinyi Cheng, Qi Liu, Chenghao Xu, Jiexi Yan, Muli Yang, Fen Fang, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi'an, China(西安电子科技大学电子工程学院) School of Computer Science and Technology, Xidian University, Xi'an, China(西安电子科技大学计算机科学与技术学院) College of Computer and Information, Hohai University, Nanjing, China(河海大学计算机与信息学院) Institute for Infocomm Research, A*STAR, Singapore(新加坡资讯研究院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.CV

AI总结 通过对比神经元引导方法,分析并缓解大型视觉语言模型中的幻觉问题,提升视觉表示的稳健性和语义基础性。

详情

展开后加载摘要…

URL PDF HTML 收藏