HW-MLVQA: Elucidating Multilingual Handwritten Document Understanding with a Comprehensive VQA Benchmark
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments This is a minor revision of the original paper submitted to IJDAR
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments This is a minor revision of the original paper submitted to IJDAR
机构 * Michigan State University(密歇根州立大学) ; Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世美国研究部及博世人工智能中心(BCAI)) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments The project is available: https://jackyfl.github.io/vitsplit.github.io/
机构 * School of Integrated Technology, Yonsei University(延世大学集成技术学院) ; LG Electronics(LG电子) ; Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) ; Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
机构 * Salesforce Research(Salesforce研究机构) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; University of Waterloo(滑铁卢大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
Comments Technical Report
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
机构 * Nanyang Technological University(南洋理工大学) ; ByteDance Inc.(字节跳动公司) ; Nanjing University(南京大学) ; Tsinghua University(清华大学) ; University of Oxford(牛津大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
机构 * North Carolina State University(北卡罗来纳州立大学) ; Oak Ridge National Laboratory(奥本海默国家实验室)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦尔)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted in CODS-COMAD December 2024
机构 * Alan Mitkiy, Michael Johnson, Sofia García, Hana Satou(未知机构)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted at ICML 2025
机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Arizona State University(亚利桑那州立大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.LG
Comments preprint
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Peking university(北京大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Sydney(悉尼大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.LG
Comments 32 pages, 28 figures
机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) ; Tongyi Lab, Alibaba Group(阿里云实验室)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments 10 pages, 6 figures, CVPR 2025
机构 * Politecnico di Milano(米兰理工大学) ; EssilorLuxottica(Essilor Luxottica)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
Comments Technical report for the HD-EPIC VQA Challenge 2025 (1st place)
机构 * Intel Labs(英特尔实验室) ; Amazon(亚马逊)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments ICML 2025 Spotlight Oral
机构 * Microsoft(微软公司) ; Stony Brook University(史蒂文尼森布鲁克大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted to ICLR 2025. Project page with code release: https://roar-ai.github.io/hummingbird
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab Project Page Code Benchmark(虎跑实验室项目页面代码基准)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
Comments 32pages
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI
Comments Accepted to ACL 2025 Main
机构 * FAMAF, Universidad Nacional de Córdoba(科迪贝拉大学法玛大学分校) ; CONICET(阿根廷国家科研 council) ; Fundación Vía Libre(自由之路基金会) ; Mercado Libre Inc.(Mercado Libre公司)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Dartmouth College(达特茅斯学院) ; Yale University(耶鲁大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted to the main conference of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)
机构 * University of Waterloo(滑铁卢大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI
Comments CVPR 2025 Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Tencent(腾讯) ; Renmin University of China(中国人民大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted by ACL 2025 main
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * University of Science and Technology Beijing(北京科技大学) ; Tencent(腾讯) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments submitting
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 10 pages (main text), 18 pages (appendix)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 24 pages, 15 figures, 15 tables
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学) ; The University of Hong Kong(香港大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * National University of Defense Technology(国防科技大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :visual reasoning(abstract);分类 cs.AI