arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-04 至 2026-02-04 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 7 篇

2501.18533 2026-02-04 cs.CV cs.CL cs.CR 83%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02419 2026-02-04 cs.AI cs.SE 79%

SafeGround: Know When to Trust GUI Grounding Models via Uncertainty Calibration

SafeGround: 通过不确定性校准了解何时信任GUI接地模型

Qingni Wang, Yue Fan, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 幻觉与鲁棒性 :grounding(title,abstract);分类 cs.AI

AI总结 SafeGround通过不确定性校准提升GUI接地模型的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21984 2026-02-04 cs.CV cs.CL 79%

Beyond the Vision Encoder: Identifying and Mitigating Spatial Bias in Large Vision-Language Models

超越视觉编码器:识别和缓解大视觉-语言模型中的空间偏差

Yingjie Zhu, Xuefeng Bai, Kehai Chen, Yang Xiang, Youcheng Pan, Yongshuai Hou, Weili Guan, Jun Yu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出AGCI机制,通过动态注入全局视觉上下文缓解大视觉-语言模型中的空间偏差问题,提升模型的空间鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01769 2026-02-04 cs.LG cs.AI 73%

IRIS: Implicit Reward-Guided Internal Sifting for Mitigating Multimodal Hallucination

IRIS: 隐式奖励引导的内部筛选以缓解多模态幻觉

Yuanshuai Li, Yuping Yan, Jirui Han, Fei Ming, Lingjuan Lv, Yaochu Jin

机构 * Department of Artificial Intelligence, Westlake University, Hangzhou, China(人工智能系,西湖大学,杭州,中国) Sony Research, Sony(索尼研究,索尼)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG

AI总结 IRIS通过隐式奖励引导内部筛选,有效缓解多模态大语言模型的幻觉问题,无需外部反馈且性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04136 2026-02-04 cs.CV cs.AI 73%

UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval

UniFGVC: 一种通用无训练少样本细粒度视觉分类方法通过属性感知多模态检索

Hongyu Guo, Xiangzhao Hao, Jiarui Guo, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua

机构 * School of Traffic and Transportation, Beijing Jiaotong University(交通与运输学院,北京交通大学) Foundation Modal Research Center, Institute of Automation, Chinese Academy of Sciences(基础模态研究中心,自动化研究所) Queen Mary School Hainan, Beijing University of Posts and Telecommunications(海南女王学院,北京邮电大学) Department of Computer Science, NUS School of Computing(计算机科学系,国立大学计算机学院)

专题命中 幻觉与鲁棒性 :visual language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 UniFGVC通过属性感知多模态检索方法,实现无训练少样本细粒度视觉分类,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02589 2026-02-04 cs.AI cs.LG 62%

PeerRank: Autonomous LLM Evaluation Through Web-Grounded, Bias-Controlled Peer Review

PeerRank: 通过基于网络的、受偏见控制的同行评审实现自主LLM评估

Yanki Margalit, Erni Avram, Ran Taig, Oded Margalit, Nurit Cohen-Inger

机构 * Computer Science and Information, Ben-Gurion University of the Negev(本·加里翁大学(内盖夫)计算机科学与信息学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PeerRank通过基于网络的、受偏见控制的同行评审实现自主LLM评估,产生稳定且具有区分性的排名,并揭示可测量的身份和呈现偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI 57%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏