arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-28 至 2026-08-28 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 5 篇

2608.26645 2026-08-28 cs.RO 新提交 80%

FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation

FLARE:一种面向视觉-语言机器人操纵中自主修正与恢复的故障感知框架

Ganlong Zhao, Zijia Tang, Xingping Chen, Zhanghui Kuang, Ye Tian, Guanbin Li

机构 * The Chinese University of Hong Kong(香港中文大学) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心) Duke University(杜克大学) Sun Yat-sen University(中山大学) TengenX(天工科技) Tencent Robotics X(腾讯Robotics X实验室) Shenzhen Loop Area Institute(深圳河套学院) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室)

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract)

AI总结 针对视觉-语言机器人操纵中VLAs无法从执行错误恢复的问题,提出含“重试”“重置”范式的FLARE框架,结合MLLM实现故障恢复,显著提升接触密集型操纵任务的成功率与鲁棒性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27004 2026-08-28 cs.CV 新提交 79%

MVC-Bench: Benchmarking Calibration of Medical Vision-Language Models

MVC-Bench:医学视觉-语言模型的校准基准测试

Ashshak Sharifdeen, Shihab Aaqil Ahamed, Ufaq Khan, Muhammad Akhtar Munir Sujair Ibrahim, Mohamed Rafeek Mareer Ahamed, Yutong Xie, Imran Razzak, Muhammad Haris Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) Sabaragamuwa University of Sri Lanka(斯里兰卡萨巴拉加穆瓦大学) Digital Platform Development, SLT PLC(SLT公共有限公司数字平台开发部)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 该研究针对医学视觉-语言模型校准不足的问题,提出以校准为核心的基准MVC-Bench,通过多维度评估并提出MCM正则化方法,为医疗工作流提供校准改进指导。

Comments Accepted in EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26382 2026-08-28 cs.CV 新提交 79%

VIPER: An Expert-Curated Benchmark for Vision-Language Models in Veterinary Pathology

VIPER:用于兽医病理学视觉语言模型的专家策划基准

Luca L. Weishaupt, Simone de Brot, Javier Asin, Llorenç Grau-Roma, Nic G. Reitsam, Andrew H. Song, Dongmin Bang, Stefan T. Kaluziak, Long Phi Le, Jakob Nikolas Kather, Faisal Mahmood, Guillaume Jaume

机构 * Harvard-MIT HST(哈佛-麻省理工卫生科学与技术部) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) COMPATH, University of Bern(伯尔尼大学COMPATH) UC Davis(加州大学戴维斯分校) University of Augsburg(奥格斯堡大学) UT MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) TU Dresden(德累斯顿工业大学) University of Lausanne(洛桑大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究针对现有病理视觉语言模型基准聚焦人体组织的问题,推出首个兽医病理学视觉语言模型评估基准VIPER,测试16类模型发现领域差距,验证领域特定训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10358 2026-08-28 cs.CV cs.AI 版本更新 62%

Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift

在域转移下对用于乳腺钼靶成像的基础模型的稳健性进行基准测试

Giang Nguyen, Raghav Mehta, Emma A.M. Stanley, Tian Xia, Thi Hao Nguyen, Hieu Pham, Ben Glocker

机构 * College of Engineering and Computer Science, VinUniversity(工程与计算机科学学院,文大大学) Imperial College London(伦敦帝国理工学院) Radiology Department, Vietnam National Cancer Hospital(越南国家癌症医院放射科) VinUni-Illinois Smart Health Center, VinUniversity(文大大学 - 伊利诺伊智能健康中心,文大大学) The Computer Vision and Medical AI Lab, VinUniversity(计算机视觉与医学人工智能实验室,文大大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究在域转移下乳腺钼靶成像基础模型的稳健性,用统一协议在多数据集上训练评估15种模型主干,发现特定视觉语言模型性能强,DINOv3是有竞争力基线,适应预训练未持续提升泛化,强调数据集级OOD评估是核心标准。

Comments Accepted at Deep-Brea3th 2026 workshop in conjunction with MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26157 2026-08-28 cs.AI 新提交 57%

GROUND: Reducing Hallucinations in LLM-Based Enterprise Analytics Through Governed Semantic Definitions

GROUND:通过受监管的语义定义减少基于大语言模型的企业分析中的幻觉现象

Aravind Sasidharan Pillai

机构 * Cox Automotive Inc(考克斯汽车公司)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 该研究提出GROUND框架,通过受监管语义层约束大语言模型生成的企业分析内容,在多模型多数据集测试中消除了所有评估类别的幻觉,保障了数据安全。

详情

展开后加载摘要…

URL PDF HTML 收藏