Bangla-Bayanno: A 52K-Pair Bengali Visual Question Answering Dataset with LLM-Assisted Translation Refinement
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV
机构 * University of Southern California(南加州大学)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV
Comments To be published in Explainable Computer Vision: Quo Vadis? workshop at ICCV'25
机构 * Kunming Medical University(昆明医科大学)
专题命中 视觉问答 :grounding(abstract)
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments Accepted to AAAI Fall Symposium 2025 on AI Trustworthiness and Risk Assessment for Challenging Contexts (ATRACC)
机构 * Shandong University, School of Control Science ; Rutgers University, Department of Computer Science 110 Frelinghuysen Road Piscataway New Brunswick NJ USA 08854 ; University of California, Santa Barbara 1210 Cheadle Hall Santa Barbara California USA 93106 ; University of Michigan, School of Information 500 S State St Ann Arbor Michigan USA 48109 ; The Chinese University of Hong Kong, Department of Computer Science ; The College of William \& Mary, School of Computing, Data Sciences \& Physics 200 Stadium Dr Williamsburg Virginia USA 23185 ; The Chinese University of Hong Kong, Department of Psychiatry 9 Chuen On Rd Tai Po New Territories Hong Kong SAR, China 999077 ; Rutgers University, Department of Computer Science ; University of California, Santa Barbara ; University of Michigan, School of Information ; The College of William \& Mary, School of Computing, Data Sciences \& Physics ; The Chinese University of Hong Kong, Department of Psychiatry
专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV
Comments 25 pages, 9 figures, 2 tables
机构 * Microsoft Research(微软研究院) ; Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) ; Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) ; Department of Oncology, University of Cambridge(癌症部门,剑桥大学) ; Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能中心,剑桥大学) ; VRAIN, Universitat Politècnica de València(VRAIN,巴塞罗那理工大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments 9 pages, 4 figures (22 pages, 7 figures, 7 tables including references and appendices)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments 26 Pages, 10 Figures, Technical report, Fix Typo
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉推理 :InternVL(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
专题命中 视觉推理 :grounding(abstract)
Comments 7 pages, 3 figures, 3 tables,
专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV
Comments Accepted at BMVC 2025
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
Comments 12 pages, 7 figures, 5 tables
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
机构 * Waseda University(早稻田大学)
专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 6 pages
机构 * The University of Hong Kong(香港大学) ; Hong Kong Baptist University(香港 Baptist 大学) ; TCL Corporate Research (Hong Kong) Co., Ltd(TCL 香港研究院)
专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.CV、cs.AI
Comments 28 pages, 12 figures
机构 * University of Science and Technology of China(中国科学技术大学) ; NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG
Comments CVPR 2025 (Corrected the results on the Aircraft dataset)
机构 * University of Notre Dame(诺丁汉大学)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊文斯顿分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract)
Comments EMNLP2025 Findings
机构 * Eluvio AI Labs(Eluvio AI实验室)
专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.LG
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; CPII under InnoHK(创新香港科技促进会) ; MThreads AI
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG
Comments code: https://github.com/SunzeY/X-Prompt
机构 * CNR-ISASI(意大利那不勒斯) ; Visva-Bharati(维斯瓦-巴哈蒂)
专题命中 VLM训练与架构 :vision language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI
Comments 6 pages, 4 figures, 13th International Workshop on Biometrics and Forensics (IWBF)
机构 * SNU(首尔国立大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 6 pages, 4 figures, NeurIPS Creative AI Track 2025
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV
Comments 11 pages, 5 figures
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV
Comments 9 pages, 6figures
机构 * BIGAI ; BUAA(北京航空航天大学) ; THU(清华大学) ; BIT(北京理工大学) ; RUC(中国人民大学)
专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract,comments);分类 cs.CV、cs.LG
Comments EMNLP 2025 Findings, Project Page: https://huggingface.co/AdaptLLM/Adapt-MLLM-to-Domains