Specialized Foundation Models for Intelligent Operating Rooms
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
机构 * Nanyang Technological University(南洋理工大学) ; ByteDance Inc.(字节跳动公司) ; Nanjing University(南京大学) ; Tsinghua University(清华大学) ; University of Oxford(牛津大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
机构 * North Carolina State University(北卡罗来纳州立大学) ; Oak Ridge National Laboratory(奥本海默国家实验室)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
机构 * Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦尔)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted in CODS-COMAD December 2024
机构 * Alan Mitkiy, Michael Johnson, Sofia García, Hana Satou(未知机构)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted at ICML 2025
机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Arizona State University(亚利桑那州立大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.LG
Comments preprint
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Peking university(北京大学) ; Georgia Institute of Technology(佐治亚理工学院) ; The University of Sydney(悉尼大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.LG
Comments 32 pages, 28 figures
机构 * State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室) ; Tongyi Lab, Alibaba Group(阿里云实验室)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments 10 pages, 6 figures, CVPR 2025
机构 * Politecnico di Milano(米兰理工大学) ; EssilorLuxottica(Essilor Luxottica)
专题命中 视觉问答 :MLLM(abstract);分类 cs.CV
Comments Technical report for the HD-EPIC VQA Challenge 2025 (1st place)
机构 * Intel Labs(英特尔实验室) ; Amazon(亚马逊)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments ICML 2025 Spotlight Oral
机构 * Microsoft(微软公司) ; Stony Brook University(史蒂文尼森布鲁克大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted to ICLR 2025. Project page with code release: https://roar-ai.github.io/hummingbird
机构 * Zhejiang University(浙江大学) ; DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab Project Page Code Benchmark(虎跑实验室项目页面代码基准)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
Comments 32pages
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI
Comments Accepted to ACL 2025 Main
机构 * FAMAF, Universidad Nacional de Córdoba(科迪贝拉大学法玛大学分校) ; CONICET(阿根廷国家科研 council) ; Fundación Vía Libre(自由之路基金会) ; Mercado Libre Inc.(Mercado Libre公司)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * Dartmouth College(达特茅斯学院) ; Yale University(耶鲁大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments Accepted to the main conference of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)
机构 * University of Waterloo(滑铁卢大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.AI
Comments CVPR 2025 Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Tencent(腾讯) ; Renmin University of China(中国人民大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
Comments Accepted by ACL 2025 main
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * University of Science and Technology Beijing(北京科技大学) ; Tencent(腾讯) ; Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
Comments submitting
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 10 pages (main text), 18 pages (appendix)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 24 pages, 15 figures, 15 tables
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学) ; The University of Hong Kong(香港大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * National University of Defense Technology(国防科技大学) ; Tsinghua University(清华大学)
专题命中 视觉问答 :visual reasoning(abstract);分类 cs.AI
机构 * Faculty of Information Science and Engineering, Ocean University of China(信息科学与工程学院,中国海洋大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(杭州高等研究院,中国科学院大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
Comments 11 figs, 7 tables
机构 * University of Cambridge(剑桥大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
Comments Project: https://weihaox.github.io/VINDEX
机构 * York University(约克大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Guizhou Provincial Laboratory of Big Data, College of Computer Science and Technology, Guizhou University(贵州大数据省实验室,贵州大学计算机科学与技术学院)
专题命中 视觉问答 :LLaVA(abstract);分类 cs.CV