SocialGesture: Delving into Multi-person Gesture Understanding
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments CVPR 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments CVPR 2025
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG
Comments ICLR 2025
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 7 pages
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
Comments 20 pages, 6 figures
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.LG
Comments International Conference on Learning Representations (ICLR 2025)
专题命中 视觉问答 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Project link: https://zeyofu.github.io/ReFocus/
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to 3DV 2025. Update 12/09/24: Change the benchmark name to UniQA-3D, add link to code
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 2 pages, 1 figure
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments GitHub: https://github.com/uni-medical/GMAI-MMBench Hugging face: https://huggingface.co/datasets/OpenGVLab/GMAI-MMBench
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV
Comments Demo page: https://om-cat.github.io
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.AI
Comments EMNLP 2024 Findings
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
Comments Project Page: https://jaywonkoo17.github.io/PropTest/
专题命中 视觉问答 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted at the 16th IAPR International Workshop On Document Analysis Systems (DAS)