A Multi-To-One Interview Paradigm for Efficient MLLM Evaluation
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 视觉问答 :MLLM(title,abstract);分类 cs.AI
Comments 5 pages, 2 figures
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学)
专题命中 视觉问答 :MLLM(title,abstract);分类 cs.AI
Comments 5 pages, 2 figures
机构 * Microsoft(微软)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
机构 * Amsterdam UMC, Department of Medical Informatics(阿姆斯特丹大学医学中心,医学信息学系) ; Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学) ; Munich Center for Machine Learning (MCML), Munich(慕尼黑机器学习中心(MCML)) ; Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学)
专题命中 视觉问答 :grounding(abstract)
Comments Accepted to EMNLP 2025 (Main Conference)
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Li Auto Inc.(Li汽车公司) ; the School of Aeronautics and Astronautics, Xiamen University(厦门大学航空航天学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Baosight(博思特) ; NUS(新加坡国立大学) ; SIAT(深圳先进技术研究院) ; CUC(中国科学技术大学) ; Microsoft(微软) ; ANU(澳大利亚国立大学)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Tech report
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * University of Illinois Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) ; Shanghai Jiao Tong University(上海交通大学) ; Rutgers University(罗格斯大学) ; NVIDIA
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Qualcomm Technologies Inc.(高通技术公司)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
Comments 5 pages, 2 figures, 3 tables
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学)
专题命中 视觉推理 :grounding(abstract)
Comments Updated GR00T result to N1.5
专题命中 视觉定位与Grounding :grounding(title,abstract);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)
Journal ref NeurIPS2025
机构 * Syracuse University(苏塞克斯大学) ; Amazon(亚马逊)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
Comments This is the pre-peer-review version of a journal paper; the repo is available at: https://github.com/pnnl/prompt2control
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; University of California, Merced(加州大学默塞德分校) ; Adobe Research(Adobe研究)
专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments ACL2025 Main
机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)
专题命中 GUI与屏幕智能体 :VLM(abstract);grounding(abstract)
Comments 8 pages, 5 figures, 3 tables
机构 * Centre for Advanced Robotics Technology Innovation (CARTIN), School of Electrical and Electronic Engineering, Nanyang Technological University(先进机器人技术创新中心(CARTIN)、电子与电气工程学院、南洋理工大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Laboratory, China(中关村实验室)
专题命中 幻觉与鲁棒性 :vision language model(title,abstract);VLM(abstract);分类 cs.LG
机构 * Department of Computer Vision, Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(计算机视觉系,Mohamed bin Zayed人工智能大学) ; Department of Computer Science and Engineering, Michigan State University (MSU)(计算机科学与工程系,密歇根州立大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted in BMVC 2025
机构 * Southern University of Science and Technology(南方科技大学) ; City University of Hong Kong(香港城市大学) ; George Mason University(乔治·马歇尔大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.AI、cs.LG
Comments 11 pages, 7 figures, 1 table, accepted to IEEE VIS 2025 (IEEE Transactions on Visualization and Computer Graphics)
专题命中 幻觉与鲁棒性 :grounding(abstract)
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Google DeepMind(谷歌DeepMind)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments Project website: https://ical-learning.github.io/
机构 * Georgia State University(佐治亚州立大学) ; Savannah College of Art and Design(萨凡纳艺术与设计学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments Published at ICCVW 2025
机构 * School of Electrical and Computer Engineering, Cornell University(电气与计算机工程学院,康奈尔大学) ; School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) ; Cornell Tech(康奈尔科技) ; Weill Cornell Medicine(韦尔·康奈尔医学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 11 pages, 3 figures
机构 * Fudan University(复旦大学)
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract)
Comments Accepted by Findings of EMNLP2025
机构 * S-Lab, NTU, Singapore(新加坡国立大学S实验室) ; LMMs-Lab Team(多模态模型实验室团队) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
机构 * Aristotle University of Thessaloniki(亚里士多德大学)
专题命中 其他VLM :vision-language model(abstract)
机构 * Sun Yat-sen University(中山大学) ; Guangdong University of Technology(广东工业大学) ; Northwestern University(西北大学)
专题命中 其他VLM :multimodal large language model(abstract)
Comments Accepted by EMNLP 2025 main track