机构
*
The Hong Kong University of Science & Technology (Guangzhou)(香港科技大学(广州))
;
The Hong Kong University of Science & Technology(香港科技大学)
;
Zhejiang University(浙江大学)
;
Lappeenranta-Lahti University of Technology(拉佩兰塔-拉赫蒂技术大学)
专题命中
视觉推理
:multimodal large language model(title,abstract);分类 cs.CV
机构
*
Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德·本·扎耶德人工智能大学)
;
ByteDance(字节跳动)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
The Australia National University(澳大利亚国立大学)
;
Renmin University of China(中国人民大学)
;
Wuhan University(武汉大学)
Human-in-the-loop Reasoning For Traffic Sign Detection: Collaborative Approach Yolo With Video-llava
Mehdi Azarafza, Fatima Idrees, Ali Ehteshami Bejnordi, Charles Steinmetz, Stefan Henkler, Achim Rettberg
机构
*
Department of Computer Science Univ. of Applied Science Hamm-Lippstadt(计算机科学系应用科学大学哈姆-利普施塔特)
;
Carl von Ossietzky University of Oldenburg(卡尔·冯·奥西埃茨基旧恩堡大学)
IQBench: How "Smart'' Are Vision-Language Models? A Study with Human IQ Tests
Tan-Hanh Pham, Phu-Vinh Nguyen, Dang The Hung, Bui Trong Duong, Vu Nguyen Thanh, Chris Ngo, Tri Quang Truong, Truong-Son Hy
机构
*
Harvard Medical School(哈佛医学院)
;
Uppsala University(乌普萨拉大学)
;
University of London(伦敦大学)
;
Vietnam Military Medical University(越南军医大学)
;
University of Technical Education Ho Chi Minh City(胡志明市技术大学)
;
Knovel Engineering Lab(Knovel工程实验室)
;
University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games
Davide Paglieri, Bartłomiej Cupiał, Samuel Coward, Ulyana Piterbarg, Maciej Wolczyk, Akbir Khan, Eduardo Pignatelli, Łukasz Kuciński, Lerrel Pinto, Rob Fergus, Jakob Nicolaus Foerster, Jack Parker-Holder, Tim Rocktäschel
专题命中
视觉推理
:VLM(title);vision language model(abstract);分类 cs.AI
CommentsPublished as a conference paper at ICLR 2025