arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-05 至 2026-01-05 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 6 篇

2412.15206 2026-01-05 cs.CV cs.LG cs.RO 86%

AutoTrust: Benchmarking Trustworthiness in Large Vision Language Models for Autonomous Driving

AutoTrust: 评估自动驾驶大视觉语言模型的可信度

Shuo Xing, Hongyuan Hua, Xiangbo Gao, Shenzhe Zhu, Renjie Li, Kexin Tian, Xiaopeng Li, Heng Huang, Tianbao Yang, Zhangyang Wang, Yang Zhou, Huaxiu Yao, Zhengzhong Tu

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 AutoTrust研究自动驾驶大视觉语言模型的可信度问题,发现通用模型在可信度上优于专用模型,同时揭示DriveVLMs在隐私、安全和公平性方面的漏洞。

Comments Published at TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00659 2026-01-05 cs.CV 79%

CRoPS: A Training-Free Hallucination Mitigation Framework for Vision-Language Models

CRoPS:一种用于视觉-语言模型的无训练幻觉缓解框架

Neeraj Anand, Samyak Jha, Udbhav Bamba, Rahul Rahaman

机构 * Indian Institute of Technology (ISM)(印度理工学院(ISM)) Transmute AI National University of Singapore(新加坡国立大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 CRoPS通过选择性移除关键文本标记和广义对比解码,有效缓解视觉-语言模型的幻觉问题,提升CHAIR分数20%并优于现有无训练方法。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00623 2026-01-05 cs.AI 79%

DA-DPO: Cost-efficient Difficulty-aware Preference Optimization for Reducing MLLM Hallucinations

DA-DPO:面向减少多模态大语言模型幻觉的高效难度感知偏好优化

Longtian Qiu, Shan Ning, Chuyu Zhang, Jiaxuan Sun, Xuming He

机构 * ShanghaiTech University(上海科技大学) Lingang Laboratory(灵冈实验室) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心)

专题命中 幻觉与鲁棒性 :MLLM(title);multimodal large language model(abstract);分类 cs.AI

AI总结 DA-DPO通过难度感知机制优化多模态大语言模型的偏好学习,有效减少幻觉并提升模型鲁棒性与泛化能力。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24513 2026-01-05 cs.CY 78%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 幻觉与鲁棒性 :MLLM(title,abstract)

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23090 2026-01-05 cs.AI cs.LG 62%

Benchmark Success, Clinical Failure: When Reinforcement Learning Optimizes for Benchmarks, Not Patients

基准成功,临床失败:当强化学习优化于基准,而非患者

Armin Berger, Manuela Bergau, Helen Schneider, Saad Ahmad, Tom Anglim Lagones, Gianluca Brugnara, Martha Foltyn-Dumitru, Kai Schlamp, Philipp Vollmuth, Rafet Sifa

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所) Department of Health Queensland(昆士兰健康部) Griffith University(格里菲斯大学) University Hospital Bonn(波恩大学医院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 ChexReason通过低资源强化学习在医学影像基准上表现优异,但其跨数据集迁移性下降,揭示了RL范式在临床应用中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20034 2026-01-05 cs.CV cs.CL 57%

Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore

视觉编码器真的能解释物体幻觉吗?:通过简单细粒度CLIPScore缓解物体幻觉

Hongseok Oh, Wonseok Hwang

机构 * Department of Artificial intelligence University of Seoul(人工智能系首尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出F-CLIPScore,通过细粒度文本嵌入缓解LVLM中的物体幻觉问题,显著提升评估准确性。

Comments Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏