Understanding Knowledge Gaps in Visual Question Answering: Implications for Gap Identification and Testing
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments NeurIPS 2019 http://papers.nips.cc/paper/8371-rubi-reducing-unimodal-biases-for-visual-question-answering
Journal ref Advances in Neural Information Processing Systems 2019 (pp. 839-850)
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments Accepted at IEEE Transactions on Medical Imaging
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments This work is an extension of our ICCV-2019 work. arXiv admin note: text overlap with arXiv:1908.06306
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments To appear in ICCV 2019
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 14 pages, 9 figures
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments In Proceedings of the 2nd Workshop on Shortcomings in Vision and Language (SiVL) at NAACL-HLT 2019
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments CVPR 2019
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 5 figures
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments Accepted to ECCV 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 17 pages, 4 figures, accepted in ECCV 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 5 pages, 2 figures, accepted to ICIP 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.LG
Comments 8 pages, 3 figures. To appear in CRV, 2018, 15th Canadian Conference on Computer and Robot Vision
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments ICLR 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments To appear in AAAI 2018
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments To appear in ICCV 2017. Visit http://kushalkafle.com/projects/tdiuc to download the dataset
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 10 pages, 3 figures, 3 tables Added references, corrected typos, made references less wordy
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments 8 pages, 3 figures
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV、cs.AI
Comments include test-standard result on VQA full release (V1.0) dataset
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments Accepted by TIP2023, The Arxiv version of "Weakly-Supervised 3D Spatial Reasoning for Text-based Visual Question Answering"
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments CVPR 2018 full oral, winner of the 2017 Visual Question Answering challenge
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
Comments Winner of the 2017 Visual Question Answering (VQA) Challenge at CVPR
CardioLens: 通过多序列心脏MRI评估揭示MLLMs的临床现实差距
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Beijing Anzhen Hospital(北京安贞医院) ; Beihang University(北航) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 提出CardioLens测试平台,通过多序列心脏磁共振成像评估24个多模态大语言模型,发现其在临床工作流中表现不佳,存在类别崩溃失败模式,且输入选择和推理提示改进效果有限。
NeuroQA: 一种大规模的3D脑部MRI理解图像 grounded 评估基准
机构 * Stanford University(斯坦福大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出NeuroQA,一个大规模的3D脑部MRI视觉问答基准,包含来自12977名受试者的56953个问答对,涵盖5-104岁及五个临床领域,通过3D体积评估11种临床推理技能,并提供可复现的生成脚本和在线排行榜。
Comments 30 pages, dataset and benchmark release
OpenLifelogQA:一个开放式多模态生活日志问答数据集
专题命中 视觉问答 :LLaVA(summary_cn,abstract)
AI总结 OpenLifelogQA数据集包含14187对问答对,用于支持真实场景下的鲁棒评估,相比现有资源更适用于实际应用,通过评估LLaVA-NeXT-Interleave 7B模型展示了其在生活日志问答中的性能。
Comments In the proceedings of the 14th International Symposium on Information and Communication Technology