arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 7 篇

2605.31351 2026-08-26 cs.CL cs.CV 版本更新 90%

VIABLE: A Visually Impaired Assistance Benchmark for VLM-as-a-Judge Evaluation

面向VLM-as-a-Judge评估的视障辅助基准

Yi Zhao, Siqi Wang, Zhe Hu, Yushi Li, Jing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

专题命中 幻觉与鲁棒性 :VLM(title,title_cn);分类 cs.CV

AI总结 针对视障辅助任务中VLM-as-a-Judge评估的可靠性问题,提出VIABLE基准(含30万+样本、有效性-公正性-稳定性框架及12种失败模式分类),发现现有模型不可靠,并开发VIA-Judge-Agent方法提升诊断准确性和用户偏好。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24730 2026-08-26 cs.MM cs.HC 新提交 83%

Learning to Prefer Reliably: Error-Augmented Emotion Preference Optimization with Calibrated Fusion

学习可靠偏好:带校准融合的错误增强情感偏好优化

Zilong Huang, Junyi Peng, Junjie Li, Kai Li, Wenze Ren, Kong Aik Lee, Man-Wai Mak, Tatsuya Kawahara

专题命中 幻觉与鲁棒性 :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 针对情感偏好学习的稀疏监督与单一MLLM评判者的偏差问题,提出EAPO框架,构建错误增强数据集并通过边际校准软融合聚合多MLLM评判结果,提升情感偏好预测与鲁棒性。

Comments Accepted at ACM MM 2026 Workshop (MRAC '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23634 2026-08-26 cs.CV cs.LG 新提交 81%

The Blending Ratio Is Not Where the Performance Is: Diagnosing Prototype Blending for Few-Shot Adaptation of Vision-Language Models

混合比例并非性能所在:诊断视觉-语言模型少样本适配中的原型混合

Liangzhi Li, Bowen Wang, Yiming Qian, Thorsten Neumann, Xia Xie, Guangshun Li

机构 * Qufu Normal University(曲阜师范大学) Climind The University of Osaka(大阪大学) Institute of Scientific and Industrial Research (SANKEN)(产业科学研究所(SANKEN)) Institute of High Performance Computing (IHPC), A*STAR(新加坡科技研究局高性能计算研究所(IHPC)) Standard Chartered Bank(渣打银行) Hainan University(海南大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文针对视觉-语言模型少样本适配的原型混合方法,发现其最优混合比例可仅通过支持集估计,且无验证的线性探针性能优于最优调参混合,性能上限由模型本身而非超参数决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07737 2026-08-26 cs.CV cs.AI 版本更新 62%

Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes

看见 vs. 相信:评估开源多模态大模型在反直觉场景中的语言偏见

Chen Ling, Tongwei Zhang, Hanqian Li, Nai Ding

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 为评估多模态大模型处理反直觉动作场景的能力,提出CAIT基准(400个高保真合成场景),发现开源模型因语言先验而忽视视觉证据,性能接近随机水平,而链式思维推理虽提升准确率但导致过度思考拒绝视觉内容,通过微调和结构化提示可缓解此偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23635 2026-08-26 cs.SE cs.AI 新提交 57%

ToolRobustBench: Stage-Wise Perturbation Evaluation and Failure Diagnosis for Tool-Calling Agents

ToolRobustBench:工具调用智能体的分阶段扰动评估与故障诊断

YiShan Zheng, Yuan Wu, Yi Chang

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本研究推出ToolRobustBench,这一工具调用智能体的分阶段诊断基准,通过四类扰动族评估7个模型等的15456个实例,发现工具输出/观测扰动是主要瓶颈,可诊断工具调用故障来源与传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24094 2026-08-26 cs.RO 新提交 50%

SIREN-Bench: Behavior-Driven Generation and Evaluation of Emergency-Vehicle Interactions

SIREN-Bench:行为驱动的应急车辆交互生成与评估

Yicheng Zhu, Tianmu Zhao, Haoxin Leng, Fan Zuo, Tao Li, Zilin Bian

机构 * Rochester Institute of Technology(罗切斯特理工学院) CVS Health(CVS健康公司) City University of Hong Kong(香港城市大学) New York University(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 该研究提出行为驱动的SIREN协同仿真平台,构建SIREN-Bench-v1基准,经3类任务评估揭示不同行为模式下的失效特性,为自动驾驶与交通安全研究提供可扩展平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23570 2026-08-26 cs.CL 新提交 50%

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

驯服视觉忽视:用于多模态上下文学习中自适应注意力的变分信息瓶颈框架

Kaito Tanaka, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(山王大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 针对多模态上下文学习中视觉上下文时而被利用时而被忽视的问题,提出VIB-ICL框架,通过CMIG量化跨模态信息,推导理论界并经五组基准实验验证,实现准确率提升与演示样本减少。

详情

展开后加载摘要…

URL PDF HTML 收藏