arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-03 至 2026-03-03 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 9 篇

2509.23465 2026-03-03 cs.AI 79%

ViTSP: A Vision Language Models Guided Framework for Solving Large-Scale Traveling Salesman Problems

ViTSP:一种由视觉语言模型引导的解决大规模旅行商问题的框架

Zhuoli Yin, Yi Ding, Reem Khir, Hua Cai

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.AI

AI总结 ViTSP利用预训练视觉语言模型指导大规模TSP求解,通过识别子问题提升全局解的质量,实验表明其在大规模实例上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01694 2026-03-03 cs.CV cs.AI cs.LG 75%

MVR: Multi-view Video Reward Shaping for Reinforcement Learning

MVR:多视图视频奖励塑造用于强化学习

Lirui Luo, Guoxi Zhang, Hongming Xu, Yaodong Yang, Cong Fang, Qing Li

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 MVR通过多视角视频和视觉语言模型提升强化学习中的奖励塑造,有效解决复杂动态任务中的状态相关性和视角偏见问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01950 2026-03-03 cs.LG cs.CL cs.CV 73%

Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment

语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训

Christopher Driggers-Ellis, Nachiketh Tibrewal, Rohit Bogulla, Harsh Khanna, Sangpil Youm, Christan Grant, Bonnie Dorr

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。

Comments 8 pages, 2 figures, 3 tables. Includes link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20095 2026-03-03 cs.CV cs.CL cs.LG 62%

BioCAP: Exploiting Synthetic Captions Beyond Labels in Biological Foundation Models

BioCAP: 利用合成描述性注释超越标签在生物基础模型中的应用

Ziheng Zhang, Xinyue Ma, Arpita Chowdhury, Elizabeth G. Campolongo, Matthew J. Thompson, Net Zhang, Samuel Stevens, Hilmar Lapp, Tanya Berger-Wolf, Yu Su, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) Duke University(杜克大学) Boston University(波士顿大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 BioCAP通过生成合成描述性注释提升生物基础模型的性能,实现物种分类和文本-图像检索的高准确率。

Comments ICLR 2026; Project page: https://imageomics.github.io/biocap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00529 2026-03-03 cs.CV cs.AI 62%

CaptionFool: Universal Image Captioning Model Attacks

CaptionFool: 针对最新Transformer图像描述模型的通用图像描述模型攻击

Swapnil Parekh

机构 * Intuit

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 CaptionFool通过修改少量图像块,成功生成任意目标描述,揭示了视觉-语言模型的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01625 2026-03-03 cs.CL cs.AI 57%

Measuring What VLMs Don't Say: Validation Metrics Hide Clinical Terminology Erasure in Radiology Report Generation

衡量VLMs不表达的内容:验证指标隐藏了放射学报告生成中的临床术语擦除

Aditya Parikh, Aasa Feragen, Sneha Das, Stella Frank

机构 * DTU Compute, Technical University of Denmark(丹麦技术大学计算机学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出临床关联位移(CAD)和加权关联擦除(WAE)指标,用于评估放射学报告生成中临床术语的保留情况,揭示当前验证指标在临床术语擦除方面的不足。

Comments This is an extended version of a manuscript currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01603 2026-03-03 cs.CV 57%

Sparse View Distractor-Free Gaussian Splatting

稀疏视角无干扰高斯点云法

Yi Gu, Zhaorui Wang, Jiahang Cao, Jiaxu Wang, Mingle Zhao, Dongjun Ye, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Macau(澳门大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种基于先验信息的框架,用于提升稀疏视角下无干扰3DGS的性能,通过几何模型和视觉-语言模型增强训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-03-03 cs.SI 50%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00913 2026-03-03 cs.RO 50%

Minimalist Compliance Control

极简合规控制

Haochen Shi, Songbo Hu, Yifan Hou, Weizhuo Wang, Karen Liu, Shuran Song

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。

Comments Project website: https://minimalist-compliance-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏