arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-01 至 2025-12-01 共收录 4 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2511.22664 2025-12-01 cs.CV 79%

VaMP: Variational Multi-Modal Prompt Learning for Vision-Language Models

VaMP:用于视觉-语言模型的变分多模态提示学习

Silin Cheng, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV

AI总结 VaMP提出了一种变分多模态提示学习框架,通过实例条件提示和不确定性建模提升视觉-语言模型在少样本和领域泛化任务中的性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22777 2025-12-01 cs.RO cs.AI 70%

Improving Robotic Manipulation Robustness via NICE Scene Surgery

通过NICE场景手术提升机器人操作的鲁棒性

Sajjad Pakdamansavoji, Mozhgan Pourkeshavarz, Adam Sigal, Zhiyuan Li, Rui Heng Yang, Amir Rasouli

机构 * Huawei Technologies Canada(华为技术加拿大公司)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 NICE通过增强场景上下文减少分布外差距,提升机器人操作在复杂环境中的鲁棒性和安全性。

Comments 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19079 2025-12-01 cs.CV cs.AI cs.HC 62%

Reading Smiles: Proxy Bias in Foundation Models for Facial Emotion Recognition

读微笑:面部情绪识别基础模型中的代理偏差

Iosif Tsangko, Andreas Triantafyllopoulos, Adem Abdelmoula, Adria Mallol-Ragolta, Bjoern W. Schuller

机构 * CHI – Chair of Health Informatics, MRI, Technical University of Munich(慕尼黑技术大学健康信息学系) MCML – Munich Center for Machine Learning(慕尼黑机器学习中心) GLAM – Group on Language, Audio, & Music(语言、音频与音乐小组) MDSI – Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了面部情绪识别基础模型中视觉线索的依赖性及潜在偏差,揭示了模型在情绪推理中的内在一致性及公平性风险。

Journal ref IEEE Access, Early Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22253 2025-12-01 cs.IR cs.CV 57%

UNION: A Lightweight Target Representation for Efficient Zero-Shot Image-Guided Retrieval with Optional Textual Queries

UNION: 一种轻量级的目标表示用于高效零样本图像引导检索与可选文本查询

Hoang-Bao Le, Allie Tran, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 UNION通过融合图像嵌入与空文本提示,实现高效零样本图像引导检索,仅需5,000训练样本即在多个基准测试中超越传统基线。

Comments Accepted at ICDM - MMSR Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏