When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA
机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) ; Alibaba Cloud Computing(阿里巴巴云计算)
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025
机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
Comments ACM Conference on Fairness, Accountability, and Transparency (FAccT 2025)
机构 * Boston University(波士顿大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025 Findings
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Neya Systems(Neya系统) ; Agility Robotics(敏捷机器人) ; Hello Robot ; Bosch Center for AI(博世人工智能中心)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG
Comments Project website: https://saumyasaxena.github.io/grapheqa
机构 * Lehigh University(莱维大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to EMNLP 2025 Findings
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Upon further review, we identified that our dataset requires optimization to ensure research reliability and accuracy. Additionally, considering the target journal's latest submission policies, we believe comprehensive manuscript revisions are necessary
机构 * The Ohio State University(俄亥俄州立大学) ; The Ohio State University Wexner Medical Center(俄亥俄州立大学韦克斯纳医学中心) ; Northeastern University(东北大学)
专题命中 视觉问答 :visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * Purdue University(普渡大学) ; University of Central Florida(中央佛罗里达大学)
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments IROS 2025 Oral
机构 * Department of General Psychology and Department of Mathematics University of Padova(帕多瓦大学心理学系和数学系) ; Department of General Psychology University of Padova(帕多瓦大学心理学系) ; Department of General Psychology and Padova Neuroscience Center University of Padova(帕多瓦大学心理学系和帕多瓦神经科学中心) ; IRCSS San Camillo Hospital, Venice-Lido(威尼斯利多医院IRCSS桑卡莫医院)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(中国香港中文大学计算机科学与工程系) ; School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与工程学院) ; School of Integrated Circuits, Peking University(北京大学集成电路学院) ; School of Intergrated Circuits, Southeast University(东南大学集成电路学院) ; School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Department of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术系) ; National Center of Technology Innovation for EDA(EDA技术创新国家中心)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI、cs.LG
Comments 10 pages, 1 figure, 5 tables. To appear in ICCAD 2025
机构 * AITRICS Seoul(AITRICS首尔) ; Chung-Ang University(Chung-ang 大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025 Workshop on Curated Data for Efficient Learning (CDEL)
机构 * University of Maryland(马里兰大学) ; Apple(苹果公司)
专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments Website: see https://vatsalag99.github.io/mustafar/
机构 * The University of Hong Kong(香港大学) ; Beijing University of Technology(北京工业大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments 27 pages, 9 figures. arXiv admin note: text overlap with arXiv:2410.14200 by other authors
机构 * SRI ; Johns Hopkins University(约翰霍普金斯大学) ; United States Military Academy(美国军事学院) ; University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * ByteDance Inc.(字节跳动公司) ; East China Normal University(东华大学) ; Huazhong University of Science and Technology(华中科技大学) ; University of Minnesota(明尼苏达大学) ; Cornell University(康奈尔大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
机构 * Monash University(蒙纳士大学) ; MBZUAI ; XJTLU(西安交通大学) ; Shanghai Jiaotong University(上海交通大学) ; Fudan University(复旦大学) ; University of Minnesota(明尼苏达大学) ; Cornell University(康奈尔大学)
专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments Clarification note for the CVPR 2025 paper (FarSight). Prepared by a subset of the original authors; remaining co-authors are acknowledged in the text
机构 * R&D Center, Talan(Talan 研发中心)
专题命中 视觉问答 :VLM(abstract);visual language model(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
机构 * National University of Singapore(新加坡国立大学)
专题命中 视觉问答 :grounding(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted to SIGIR'25
机构 * College of Computing and Informatics, Drexel University(计算与信息学院,德雷塞尔大学)
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments 4 pages, accepted by ToM@AAAI25
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2025; project page: https://vdocrag.github.io
专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG
专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments This project is available at https://www.med-vqa.com/GEMeX
专题命中 视觉问答 :visual language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI
Comments A pre-print. 26 pages. Link to Code + Data: https://huggingface.co/datasets/Artificio/robusto-1
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments NAACL 2025 Main Conference