A Survey on Vietnamese Document Analysis and Recognition: Challenges and Future Directions
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Purdue University(普渡大学) ; AWS AI Labs(AWS人工智能实验室)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
机构 * LLM-Core ; Xiaomi(小米)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
Comments 32 pages
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
Comments ACL 2025 main
机构 * Graduate School of Information, Production and Systems, Waseda University(信息、生产与系统研究生院,早稻田大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
机构 * Hohai University(河海大学) ; HKUST(香港科技大学) ; Southeast University(东南大学)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
机构 * University of Maryland College Park(马里兰大学学院公园分校) ; Microsoft(微软) ; University of Michigan(密歇根大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 27 pages, 5 figures
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments CVPR 2025. Project Page: https://yunzeman.github.io/argus/
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments Accepted in ISBI2025
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted by CVPR2025
机构 * TU Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted to CVPR 2025, Project page: https://dominik-schnaus.github.io/itsamatch/
机构 * Sveučilište u Zagrebu(扎格雷布大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
机构 * Interdisciplinary Program in Bioengineering, Seoul National University Graduate School(生物工程跨学科项目,首尔国立大学研究生院) ; Integrated Major in Innovative Medical Science, Seoul National University Graduate School(创新医学联合专业,首尔国立大学研究生院) ; Department of Radiology, Seoul National University Hospital(放射科,首尔国立大学医院)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 16 pages (8 main, 2 references, 6 appendix), 13 figures. Accepted to CVPR 2025. This author-accepted manuscript includes an expanded ethics/data user agreement section. The final version will appear in the Proceedings of CVPR 2025
机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
Comments Preprint
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Fraunhofer Institute for Open Communication Systems(弗劳恩霍夫开放通信系统研究所) ; Technical University of Munich(慕尼黑技术大学) ; Alibaba International Digital Commerce(阿里巴巴国际数字商务)
专题命中 图文多模态 :image-text(abstract);分类 cs.AI
机构 * Southern University of Science and Technology(南方科技大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Hong Kong Baptist University(香港 Baptist 大学)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Clemson University(克莱姆森大学)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
Comments Accepted at the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2025)
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
机构 * Nanyang Technological University(南洋理工大学) ; Beijing University of Technology(北京理工大学) ; Hengxin Tech(恒心科技) ; Alibaba Group(阿里巴巴集团) ; Squirrel Ai Learning(squirrel AI 学习)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.AI
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments 9 pages, 6 figures
机构 * Apple(苹果公司)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 10 pages
机构 * Auburn University(阿伯拉罕大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
机构 * Peking University(北京大学) ; UCAS(中国科学院大学) ; Moonshot AI
专题命中 图文多模态 :multimodal(abstract);分类 cs.CV
Comments 21 pages, 14 figures, code released at https://github.com/chenllliang/G1
机构 * Department of Electrical and Computer Engineering, Western University(电气与计算机工程系,西方大学)
专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV
机构 * Sungkyunkwan University(顺天妇女大学) ; Ewha Womans University & LLM Experimental Lab, MODULABS(成均馆大学及LLM实验实验室,MODULABS)
专题命中 图文多模态 :multimodal(abstract);分类 cs.CL
Comments 11 pages, 4 figures, 7 tables
机构 * TU Berlin(柏林技术大学) ; BIFOLD(BIFOLD机构) ; EPFL(苏黎世联邦理工学院)
专题命中 图文多模态 :image-text(abstract);分类 cs.CV
Comments Accepted at IEEE International Geoscience and Remote Sensing Symposium (IGARSS) 2025. Our code is available at https://git.tu-berlin.de/rsim/redundacy-aware-rs-vlm