MoColl: Agent-Based Specific and General Model Collaboration for Image Captioning
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Accepted by AAAI 2025
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments EMNLP 2024 Main conference
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Paper published at AAAI 2024 Spring Symposium Series
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments ICML 2024
专题命中 视觉问答 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 26 pages, 9 figures
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Code available https://github.com/alanaai/EVUD
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments ICLR 2024 Camera-ready
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments Accepted to CVPR'24. (Compared with preprint version, we mainly improve the presentation, discuss more related works, and extend experiments in Appendix.)
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted at WACV 2024
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Preprint
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Published on CVPR 2023
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Jiasen Lu and Vedanuj Goswami contributed equally to this work
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments Accepted at NeurIPS 2019 workshop: ViGIL
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI
Comments ECCV 2018 + results on VisDial v1.0 dataset
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments CVPR 2016
通过结构化内联引文生成实现显式证据基础
机构 * University of the Basque Country (UPV/EHU)(巴斯克大学) ; IT University of Copenhagen(哥本哈根IT大学)
专题命中 视觉问答 :grounding(title)
AI总结 提出FullCite框架,通过提示生成、约束解码和后处理跨度对齐三种策略生成结构化内联引文,在三个QA基准上评估引文质量和忠实性,发现LLMs虽能识别相关文档但难以精确定位支持性证据跨度。