CoMemo: LVLMs Need Image Context with Image Memory
机构 * Shi Liu ; Weijie Su ; Xizhou Zhu ; Wenhai Wang ; Jifeng Dai
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments ICML 2025
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Shi Liu ; Weijie Su ; Xizhou Zhu ; Wenhai Wang ; Jifeng Dai
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments ICML 2025
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
Journal ref International Journal of Web Research, vol.8, no.2,pp.11-24, 2025,
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Kuaishou Technology(快手科技) ; Xi’an Jiaotong University(西安交通大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * Department of Electrical and Computer Engineering, University of Southern California(电气与计算机工程系,南加州大学) ; Department of Radiology and Imaging Sciences, University of Utah(放射学与影像科学系,犹他大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 24 Pages, 9 figures, The Thirteenth International Conference on Learning Representations (ICLR) 2025
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
机构 * Institute of Science and Engineering, Kanazawa University(金泽大学科学与工程研究所) ; Department of Electrical and Electronic Engineering, University of Hong Kong(香港大学电子与电气工程系) ; College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.AI
机构 * Vanderbilt University(范德比大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; University of Utah(犹他大学)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 10 pages, 3 figures
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments CVPR 2025
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.LG
Comments ICLR 2025
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by CVPR 2025
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 7 pages
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.AI
Comments 20 pages, 6 figures
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Our dataset can be found at \url{https://huggingface.co/datasets/fazliimam/temporal-vqa}
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.LG
Comments International Conference on Learning Representations (ICLR 2025)
专题命中 视觉问答 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Project link: https://zeyofu.github.io/ReFocus/
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments Accepted to 3DV 2025. Update 12/09/24: Change the benchmark name to UniQA-3D, add link to code
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV
Comments 2 pages, 1 figure