A-SEA3L-QA: A Fully Automated Self-Evolving, Adversarial Workflow for Arabic Long-Context Question-Answer Generation
机构 * Humain
专题命中 视觉问答 :vision language model(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Humain
专题命中 视觉问答 :vision language model(abstract);分类 cs.AI
机构 * IIT Kharagpur(印度理工学院Kharagpur分校) ; Ashoka University(阿什oka大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI
机构 * Florida International University(佛罗里达国际大学) ; University of Florida(佛罗里达大学)
专题命中 视觉问答 :LLaVA(abstract);分类 cs.LG
机构 * Kwangwoon University(韩国成均馆大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments MM 2025
机构 * MedVisAI Lab Department of ECE Northwestern University(MedVisAI实验室 电子工程系 西北大学) ; Institute for Infocomm Research (I 2 R) A*STAR, Singapore(信息与通信研究所(I 2 R)A*STAR,新加坡) ; MedVisAI Lab Lee Kong Chian School of Medicine, Nanyang Technological University(MedVisAI实验室 李科田医学院,南洋理工大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Southern University of Science and Technology(南方科技大学) ; Wangxuan Institute of Computer Technology, Peking University(北京大学王瑄计算机技术研究所)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 13 pages, 16 figures, accepted by ACM MM 2025
机构 * School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) ; DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments This work has been accepted by IEEE Transactions on Multimedia
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
Comments 21 pages, 6 figures, 17 tables
机构 * Department of Radiation Oncology, Winship Cancer Institute, Emory University School of Medicine(放射肿瘤科、Winship癌症研究所、埃默里大学医学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
Comments Corrected some typos
机构 * Fudan University(复旦大学) ; Westlake University, Tencent PCG(西湖大学、腾讯PCG)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments Accepted by ACMM'MM 2025
机构 * Peking University(北京大学) ; LinkSure ; University of Glasgow(格拉斯哥大学) ; Boston University(波士顿大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments 17 pages,8 figures
机构 * LIPADE, Université Paris Cité(巴黎Cité大学LIPADE研究所) ; GENCI-IDRIS ; French Aerospace Lab, ONERA(法国航空航天实验室ONERA)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted at IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing 13 pages, 6 figures
Journal ref 10.1109/JSTARS.2025.3596678
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * University of Sydney(悉尼大学) ; University of Wollongong(沃林戈大学) ; University of Adelaide(阿德莱德大学) ; First Clinical Medical College, Guangzhou University of Chinese Medicine(广州中医药大学第一临床学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Ericsson R&D Bangalore Karnataka India(爱立信研发部班加罗尔卡纳塔克邦印度)
专题命中 视觉问答 :VLM(abstract);分类 cs.AI
Comments Accepted for publication at the KDD 2025 Workshop on Structured Knowledge for Large Language Models
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Johannes Kepler University Linz(约翰·凯撒大学林茨)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; Search Application Department, Tencent CSIG(腾讯CSIG搜索应用部门) ; Tencent Hunyuan(腾讯文生视频) ; Big Data Platform Department, Tencent PCG(腾讯PCG大数据平台部门)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
Comments Project Page: https://tencentarc.github.io/posts/arc-video-announcement/
机构 * The University of New South Wales(新南威尔士大学) ; The University of Adelaide(阿德莱德大学) ; The University of Melbourne(墨尔本大学) ; CSIRO’s Data 61(CSIRO数据61)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
机构 * Bredesen Center for Interdisciplinary Research, University of Tennessee, Knoxville, USA(跨学科研究中心,田纳西大学,肯塔基州 Knoxville) ; National Center for Computational Sciences, Oak Ridge National Laboratory, Oak Ridge, USA(计算科学国家中心,橡树岭国家实验室,橡树岭) ; University of Tennessee-Oak Ridge Innovation Institute, University of Tennessee, Knoxville, USA(田纳西大学橡树岭创新研究所,田纳西大学,肯塔基州 Knoxville)
专题命中 视觉问答 :grounding(abstract);分类 cs.LG
Comments 33 pages, 2 figures
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 视觉问答 :vision language model(abstract);分类 cs.CV
Comments COLM 2024 Oral Spotlight
机构 * Computer Science and Engineering University of California San Diego(计算机科学与工程大学加州大学圣地亚哥分校) ; InfoTech Labs Toyota Motor North America(信息科技实验室丰田北美)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
机构 * Rochester Institute of Technology(罗切斯特技术学院) ; Islamic University of Technology(伊斯兰技术大学) ; United International University(联合国际大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
Comments 22 pages, 11 figures, 5 tables
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments This is a minor revision of the original paper submitted to IJDAR
机构 * Michigan State University(密歇根州立大学) ; Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世美国研究部及博世人工智能中心(BCAI)) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments The project is available: https://jackyfl.github.io/vitsplit.github.io/
机构 * School of Integrated Technology, Yonsei University(延世大学集成技术学院) ; LG Electronics(LG电子) ; Department of Electrical and Computer Engineering, University of Michigan(密歇根大学电气与计算机工程系) ; Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
机构 * Salesforce Research(Salesforce研究机构) ; UC Santa Barbara(加州大学圣巴巴拉分校) ; University of Waterloo(滑铁卢大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
Comments Technical Report