arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-26 至 2025-11-26 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 7 篇

2506.04704 2025-11-26 cs.CV cs.AI 84%

HoliSafe: Holistic Safety Benchmarking and Modeling for Vision-Language Model

HoliSafe: 视觉-语言模型的综合安全性评估与建模

Youngwan Lee, Kangsan Kim, Kwanyong Park, Ilcahe Jung, Soojin Jang, Seanie Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * ETRI KAIST AI(韩国科学技术院人工智能研究所) University of Seoul(首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 HoliSafe提出了一种模块化框架和视觉守护模块,通过综合安全性数据集提升视觉-语言模型的安全性,展现其在多个基准中的优越表现。

Comments Project page: https://youngwanlee.github.io/holisafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12897 2025-11-26 cs.CV cs.AI 81%

Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models

跨层视觉平滑:通过持续聚焦关键对象增强大视觉-语言模型的视觉理解

Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出CLVS方法,通过跨层视觉记忆平滑注意力分布,提升大视觉-语言模型对关键对象的持续聚焦能力,从而增强视觉理解性能。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19834 2025-11-26 cs.CV 70%

Large Language Model Aided Birt-Hogg-Dube Syndrome Diagnosis with Multimodal Retrieval-Augmented Generation

基于多模态检索增强生成的大型语言模型辅助Birt-Hogg-Dube综合征诊断

Haoqing Li, Jun Shi, Xianmeng Chen, Qiwei Jia, Rui Wang, Wei Wei, Hong An, Xiaowen Hu

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Pulmonary and Critical Care Medicine(呼吸与危重症医学科) Center for Diagnosis and Management of Rare Diseases(罕见病诊断与管理中心) the First Affiliated Hospital of USTC(USTC第一附属医院) Division of Life Sciences and Medicine(生命科学与医学系) USTC WanNan Medical College(皖南医学院)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本研究提出BHD-RAG框架,通过整合多模态检索增强生成与领域专业知识,提升Birt-Hogg-Dube综合征的CT影像诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08701 2025-11-26 cs.CV cs.AI cs.LG 67%

SafeFix: Targeted Model Repair via Controlled Image Generation

SafeFix: 通过受控图像生成实现目标模型修复

Ouyang Xu, Baoming Zhang, Ruiyu Mao, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SafeFix通过生成语义忠实的图像来修复模型,提升模型对罕见案例的鲁棒性,减少系统性错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20570 2025-11-26 cs.RO cs.AI cs.HC cs.LG 62%

Gated Uncertainty-Aware Runtime Dual Invariants for Neural Signal-Controlled Robotics

门控不确定性感知的实时双不变量框架用于神经信号控制的机器人

Tasha Kim, Oiwi Parker Jones

机构 * Oxford Robotics Institute (ORI)(牛津机器人研究所) Department of Engineering Science(工程科学系) University of Oxford(牛津大学)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 GUARDIAN通过结合校准置信度的脑信号解码与符号目标接地和双层运行时监控,实现神经信号控制机器人系统的高安全性和可靠性。

Comments Embodied and Safe-Assured Robotic Systems workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20627 2025-11-26 cs.AI 57%

Fighting AI with AI: Leveraging Foundation Models for Assuring AI-Enabled Safety-Critical Systems

用AI对抗AI:利用基础模型确保AI赋能的安全关键系统

Anastasia Mavridou, Divya Gopinath, Corina S. Păsăreanu

机构 * KBR Inc.(KBR公司) NASA Ames(美国国家航空航天局阿姆斯研究中心)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.AI

AI总结 本文提出利用AI技术解决安全关键系统中AI保证问题,通过REACT和SemaLens两个组件实现需求工程与感知系统验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19914 2025-11-26 cs.RO 50%

CoC-VLA: Delving into Adversarial Domain Transfer for Explainable Autonomous Driving via Chain-of-Causality Visual-Language-Action Model

CoC-VLA: 深入研究对抗域转移以实现可解释的自动驾驶 via 链式因果视觉语言动作模型

Dapeng Zhang, Fei Shen, Rui Zhao, Yinda Chen, Peng Zhi, Chenyang Li, Rui Zhou, Qingguo Zhou

机构 * Lanzhou University(兰州大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 幻觉与鲁棒性 :VLM(abstract)

AI总结 CoC-VLA通过链式因果视觉语言动作模型实现对抗域转移,提升自动驾驶的可解释性和长尾场景处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏