A Multi-Agent System for Complex Reasoning in Radiology Visual Question Answering
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 视觉问答 :visual question answering(title,abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
机构 * Brown University(布朗大学) ; Samsung Electronics(三星电子)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG
机构 * Fujian University of Technology(福建工程大学) ; Delta University for Science and Technology(科技大学)
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract)
机构 * Shenyang institute of computing technology, Chinese academy of sciences(沈阳计算技术研究所,中国科学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
机构 * SPARKS Solutions GmbH(SPARKS解决方案有限公司)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(title);分类 cs.CV、cs.AI
机构 * Heilongjiang University of Science and Technology(黑龙江科技大学) ; University of Padua(帕多瓦大学)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);LLaVA(abstract);grounding(abstract);分类 cs.CV
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 视觉定位与Grounding :vision-language model(title);visual language model(abstract);分类 cs.CV
Comments Accepted by CIKM 2025
机构 * University of Washington(华盛顿大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Seoul National University(首尔国立大学)
专题命中 视觉定位与Grounding :LLaVA(abstract);grounding(abstract);分类 cs.AI
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; Princeton University(普林斯顿大学) ; Cisco Research(思科研究) ; Cornell University(康奈尔大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG
Comments Cameral-ready version: added experiments using the HPSv2 reward, improved notation consistency for the diffusion model, and added related works
机构 * Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系) ; Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) ; Sony AI(索尼人工智能)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
Comments 7 pages, IROS 2025
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
专题命中 视觉定位与Grounding :grounding(abstract)
机构 * Amazon AGI(亚马逊人工智能研究院)
专题命中 文档图表理解 :vision language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract)
Comments KDD 2025 v2
机构 * South China University of Technology(华南理工大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Maryland(马里兰大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV
Comments In submission. Project website: https://double-bench.github.io/
机构 * University of Oslo(奥斯陆大学) ; Norwegian Computing Center(挪威计算中心)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments This paper has been accepted to ICNSLP 2025
机构 * Seoul National University(首尔国立大学)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract)
Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. 8 pages, 7 figures
专题命中 GUI与屏幕智能体 :MLLM(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(abstract)
Comments 9 pages, 5 figures
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
机构 * Seoul National University(首尔国立大学)
专题命中 幻觉与鲁棒性 :vision language model(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025 (Highlight)
机构 * Nanyang Technological University, Singapore(南洋理工大学) ; National University of Singapore, Singapore(国立新加坡大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Tokyo Institute of Technology(东京技术大学) ; McGill University(麦吉尔大学) ; EleutherAI ; University College London(伦敦大学学院)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * School of Architecture, Tsinghua University(清华大学建筑学院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; BNRist, Tsinghua University(清华大学BNRist)
专题命中 VLM训练与架构 :visual language model(title,abstract);VLM(abstract);分类 cs.CV
Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics. Volume 1: Long Papers (2025) 11571-11590
机构 * Spotify, UK(英国Spotify)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
机构 * ByteDance Intelligent Creation(字节跳动智能创作)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments 18 pages, 12 figures