Certainly Uncertain: A Benchmark and Metric for Multimodal Epistemic and Aleatoric Awareness
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 26 pages
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 26 pages
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments IPCAI 2024, Int J CARS (2024)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments ICANN, 2024
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments There was a little error in the method section of the paper
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to KDD 2024 (ADS Track)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
Comments AAAI 2024 (Association for the Advancement of Artificial Intelligence) Scientific Document Understanding Workshop
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 21 pages, 2 figures, 4 tables
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments NAACL 2024
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 20 pages, 5 figures, 5 tables
Journal ref Vis Comput (2024)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Project Page: https://funqa-benchmark.github.io/ Codebase: https://github.com/Jingkang50/FunQA
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
Comments 19 pages; Project page: https://snap-research.github.io/locomo/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICASSP 2024 (5 pages)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments 8 pages
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 20 pages
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments accepted as Findings in EACL 2023
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments 110 Pages; 61 Figures
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at NeurIPS 2023 Datasets and Benchmarks Track (10 pages for main text, 4 pages for references, 39 pages for supplementary materials)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments accepted by The 4th International Conference on Artificial Intelligence and Computer Engineering
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Published in GCPR 2023
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Published on NeurIPS 2023
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments EMNLP 2023 (long paper, main conference)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG
Comments Accepted in EMNLP Findings 2023
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments EMNLP 2023 (main conference); Our dataset and evaluation is available at https://open-vision-language.github.io/infoseek/
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.LG
Comments 37 pages, 9 tables, 2 figures (plus appendix 14 pages)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments accepted at MICCAI 2023
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV、cs.AI
Comments Final version for 5th Workshop on Closing the Loop Between Vision and Language (CLVL) @ ICCV 2023. 4 pages, 5 figures