VIBE: Can a VLM Read the Room?
VIBE:视觉语言模型能否读懂房间?
机构 * Purdue University(普渡大学)
专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。
Comments Findings of EMNLP, 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
VIBE:视觉语言模型能否读懂房间?
机构 * Purdue University(普渡大学)
专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。
Comments Findings of EMNLP, 2025
通过概率图增强视觉编程用于视觉推理
机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
AI总结 通过构建概率图解决视觉编程非可微问题,提升视觉推理任务的性能。
Comments 13 Pages, 12 figures
HyperVL: 一种高效的多模态大语言模型用于边缘设备
机构 * HyperAI Team(HyperAI团队) ; Xiaomi Corporation(小米公司)
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
AI总结 HyperVL是一种为边缘设备优化的高效多模态大语言模型,通过图像分块、视觉分辨率压缩和双一致性学习技术,实现低延迟、低功耗的多模态推理。
Comments Technical report of Xiaomi HyperAI Team
MM-PoE:通过多模态模型的排除过程进行多选推理
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MM-PoE通过多模态模型的排除过程提升视觉语言模型在多选推理任务中的性能。
A4-Agent: 一种用于零样本 affordance 推理的代理框架
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; SJTU(上海交通大学) ; Knowin
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。
STAR:用于统一多模态学习的堆叠自回归方案
机构 * Meituan Inc(美团公司)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。
Comments 18 pages, 7 figures
为何文本占上风:视觉可能损害多模态医疗决策制定
机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) ; University of Pittsburgh(匹兹堡大学) ; NC State University(北卡罗来纳州立大学) ; University of Washington(华盛顿大学) ; University of Maryland(马里兰大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。
Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining
利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。
通过上下文神经错误本增强的检索反馈
机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。
Comments Accepted at EMNLP 2025 main
COMMA:一种基于通信的多模态多智能体基准
机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) ; Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) ; Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) ; Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)
专题命中 视觉推理 :LLaVA(abstract);分类 cs.AI
AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。
Journal ref Transactions on Machine Learning Research, 2025