VIBE: Can a VLM Read the Room?
VIBE:视觉语言模型能否读懂房间?
机构 * Purdue University(普渡大学)
专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。
Comments Findings of EMNLP, 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
VIBE:视觉语言模型能否读懂房间?
机构 * Purdue University(普渡大学)
专题命中 视觉推理 :VLM(title,abstract);vision language model(abstract);分类 cs.CV、cs.LG
AI总结 本文提出视觉社交-语用推理任务,揭示VLM在社交推理中的局限性,并通过高质量数据集评估多种VLM的性能。
Comments Findings of EMNLP, 2025
VisChainBench: 一个多轮多图视觉推理基准,超越语言先验
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 VisChainBench是一个多轮多图视觉推理基准,通过多代理生成流水线构建,旨在评估LVLM在连续、相互依赖任务中进行多步骤视觉推理的能力。
Comments 12 pages,13figures
SpaceMind: 基于摄像头引导的模态融合用于视觉-语言模型中的空间推理
机构 * Huawei(华为) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; The University of Hong Kong(香港大学)
专题命中 视觉推理 :vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 SpaceMind通过摄像头引导的模态融合方法,提升视觉-语言模型在空间推理任务中的性能。
VLMs有隧道视野:评估领先VLMs的非局部视觉推理能力
机构 * Princeton University(普林斯顿大学)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文评估了领先VLMs的非局部视觉推理能力,发现其在复杂视觉任务上表现不佳,缺乏人类核心视觉推理能力。
ROVER:基于视觉语言模型的视频递归推理用于具身任务
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; RAI Institute(RAI研究院)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 ROVER通过递归分解视频轨迹提升具身任务中的视频推理能力,有效减少幻觉并提高准确性。
机构 * Department of Physics, University of Cambridge, Cambridge, United Kingdom(剑桥大学物理系) ; Kavli Institute for Cosmology, University of Cambridge, Cambridge, United Kingdom(剑桥大学卡弗利天文研究所) ; Department of Physics and Astronomy, Haverford College, 370 Lancaster Avenue, Haverford, PA 19041, USA(哈弗福德学院物理与天文学系) ; Division of Physics, Mathematics and Astronomy, California Institute of Technology, Pasadena, CA 91125, USA(加州理工学院物理、数学与天文学系) ; Institute of Astronomy, University of Cambridge, Cambridge, United Kingdom(剑桥大学天文研究所)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * College of Engineering University of Georgia(工程学院 乔治亚大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 23 pages, 4 figures, 3 tables
机构 * Department of Classics, University Sapienza of Rome(罗马大学萨皮恩扎文学院) ; Department of Language and Communication Sciences, University of Lausanne(洛桑大学语言与沟通科学系) ; Campus Fryslân, University of Groningen(格罗宁根大学弗里斯兰校区)
专题命中 视觉推理 :vision-language model(title);VLM(abstract);visual language model(abstract);分类 cs.AI、cs.LG
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments AAAI 2026 (oral)
机构 * Zhejiang University(浙江大学) ; Microsoft Research(微软研究院) ; Tsinghua University(清华大学)
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to NDSI 2026, 19pages, 12 figures, complementary evaluations and appendix
机构 * The Chinese University of Hong Kong(香港中文大学) ; Show Lab, National University of Singapore(新加坡国立大学Show实验室)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments camera ready revision
机构 * Zhejiang University(浙江大学) ; Sun Yat-sen University(中山大学) ; NUS(国立大学)
专题命中 视觉推理 :vision-language model(title);visual language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science, Purdue University, USA(计算机科学系,普渡大学)
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.LG
Comments Published at NeurIPS 2025, 27 pages
机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) ; Shenzhen Research Institute of Big Data, China(大数据研究 institute) ; Sun Yat-sen University, China(中山大学) ; City University of Hong Kong, China(香港城市大学) ; Communication University of China, China(通信大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute for AI(人工智能矢量研究所)
专题命中 视觉推理 :vision-language model(title);vision language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Preprint. Project page: https://davidhalladay.github.io/diysink_demo
机构 * Guilin University of Electronic Technology(桂林电子科技大学) ; The Ohio State University(俄亥俄州立大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * Centre for Responsible Autonomous Systems in Healthcare (CRASH) Lab, Koita Centre for Digital Health(负责任的自主医疗系统中心(CRASH)实验室、Koita数字健康中心) ; Ashoka University(阿什oka大学) ; Independent Researcher(独立研究者) ; Koita Centre for Digital Health(Koita数字健康中心)
专题命中 视觉推理 :visual reasoning(title,abstract);vision language model(abstract);分类 cs.AI、cs.LG
Comments 29 pages, 7 figures, 7 tables, includes Annexure (1). Part of the work accepted at RSNA 2025 (Cutting Edge Oral Presentation)
机构 * Institute of Cognitive Science, Osnabrück University(认知科学研究所,奥斯纳布吕克大学)
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * HKUST(GZ)(香港科技大学(广州)) ; KU Leuven(比利时鲁文大学) ; EPFL(苏黎世联邦理工学院) ; SZU(深圳大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Li Auto Inc.(Li汽车公司) ; the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.LG
机构 * IIIT Bangalore(班加罗尔印度理工学院) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Monjoy Narayan Choudhury and Junling Wang contributed equally to this work. Accepted at EMNLP2025 main. Code and datasets are open-sourced with links in the paper
Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing
机构 * Brown University(布朗大学) ; Tel Aviv University(特拉维夫大学) ; IIT Kharagpur(印度理工学院卡里帕尔分校) ; New York University(纽约大学) ; University of Tübingen(图宾根大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV、cs.AI
机构 * Old Dominion University(旧 Dominion 大学) ; AnaletIQ ; McDonald Army Health Center(麦克唐纳陆军医疗中心) ; University of Sri Jayewardenepura(Sri Jayewardenepura 大学) ; University of Gdańsk(盖尔范大学) ; University of Colombo(科伦坡大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Science and Technology of China(中国科学技术大学)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * Courant New York University New York, United States(Courant 新 York 大学 新 York,美国)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 10 pages, 5 figures, submitted to a conference (IEEE formate). Authored by students from the Courant Institute, NYU
专题命中 视觉推理 :vision language model(title,abstract);VLM(abstract);分类 cs.AI、cs.LG
Comments Project Website: https://vlmgineer.github.io/release
机构 * Peking University(北京大学) ; Shenzhen Graduate School(深圳研究生院) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG