JRDB-Reasoning: A Difficulty-Graded Benchmark for Visual Reasoning in Robotics
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系) ; Visual Intelligence Lab., ETRI(ETRI视觉智能实验室) ; University of Science and Technology (UST)(科技大学(UST)) ; School of Electronics Engineering, Kyungpook National University(Kyungpook国立大学电子工程学院)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
Comments 6 pages, 3 figures. Accepted at IEEE International Conference on Advanced Visual and Signal-Based Systems 2025
专题命中 视觉推理 :MLLM(abstract);分类 cs.AI
Comments Project page: https://github.com/xaCheng1996/Social_Debiasing_For_Fair_MLLMs
机构 * Electronics and Telecommunications Research Institute(电子通信研究院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.LG
Comments Accepted to the 2nd ICCV 2025 Workshop on the Challenge of Out-of-Label Hazards in Autonomous Driving (13 pages, 6 figures)
机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) ; Sony AI(索尼人工智能)
专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract)
Comments 8 pages for the main paper
机构 * Ontariotechu(安大略理工学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
Comments 6 pages, 2 figures, 1 table
机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
专题命中 视觉定位与Grounding :grounding(abstract)
机构 * Singapore Management University(新加坡国立管理学院) ; Fudan University(复旦大学)
专题命中 文档图表理解 :MLLM(title);multimodal large language model(abstract);分类 cs.AI
Comments Accepted by ACM MM 2025
机构 * The Chinese University of Hong Kong(香港中文大学) ; Technical University of Munich(慕尼黑技术大学)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI
机构 * Beihang University(北航大学) ; Nanyang Technological University(南洋理工大学) ; Henan University of Science and Technology(河南科技大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Noah’s Ark Lab(诺亚 Ark 实验室) ; The University of Hong Kong(香港大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 VLM训练与架构 :LLaVA(title,abstract);multimodal large language model(abstract)
Comments 10 pages
机构 * University of Auckland(奥克兰大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG
Comments 7 pages, 6 figures
机构 * University of Texas at Arlington(德克萨斯理工大学) ; Texas A&M University(德克萨斯A&M大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * School of Electronic and Electrical Engineering(电子与电气工程学院)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI
机构 * Leibniz University Hannover(汉诺威莱布尼茨大学) ; L3S Research Center(L3S研究中心)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
机构 * Nanyang Technological University(南洋理工大学) ; The University of Tokyo(东京大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract)
Comments 22 pages, 4 figures