APEX: Empowering LLMs with Physics-Based Task Planning for Real-time Insight
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI
机构 * IIIS, Tsinghua University(清华大学智能技术学部)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV
机构 * IBM Research(IBM研究院) ; INSAIT ; ETH Zürich(苏黎世联邦理工学院) ; MBZUAI(穆斯林人工智能研究所) ; Linköping University(林雪平大学) ; ANU Australia(澳大利亚国立大学)
专题命中 视觉推理 :vision language model(abstract);grounding(abstract);分类 cs.CV
Comments Tables 6 and Figures 8. https://mustansarfiaz.github.io/GeoVLM-R1/
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Institute of Science Tokyo(东京科学研究所) ; Nanjing University(南京大学)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Data & Code: https://github.com/OpenGVLab/ExpVid
机构 * Northwestern University(西北大学) ; Boston University(波士顿大学)
专题命中 视觉推理 :visual reasoning(abstract);MLLM(abstract);分类 cs.CV
Comments ICCV2025
机构 * Sun Yat-sen University(中山大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; CUHK MMLab(香港中文大学多模态实验室) ; Peking University(北京大学)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted to 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Track on Datasets and Benchmarks
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Project Page: https://yunfeixie233.github.io/ViGaL/
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州先进研究所) ; Tsinghua University(清华大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG
Comments 13 pages
机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology (BUET)(电气与电子工程系,孟加拉国工程与技术大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG
Comments Will be submitted at IEEE JBHI
机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) ; Wenzhou Medical University(温州医科大学) ; School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Strong accept by NeurIPS2025 Reviewers and AC
机构 * CISPA Helmholtz Center for Information Security(CISPA赫尔姆霍茨信息安全中心) ; Nokia Bell Labs(诺基亚贝尔实验室)
专题命中 视觉推理 :vision language model(abstract);multimodal large language model(abstract);分类 cs.LG
机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen Key Laboratory of Media Security, and SZU-AFS Joint Innovation Center for AI Technology(广东省智能信息处理重点实验室、深圳媒体安全重点实验室及深圳大学-AFS联合人工智能技术创新中心) ; Tencent Youtu Lab(腾讯优图实验室) ; Peking University(北京大学) ; Sun Yat-Sen University(中山大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peng Cheng Lab(鹏城实验室)
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
Comments 16 pages, 6 figures
机构 * Peking University(北京大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Nankai University(南开大学) ; Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Tsinghua University(清华大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Youtu Lab, Tencent(腾讯优图实验室) ; Western University(西部大学) ; Nanyang Technological University(南洋理工大学) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University(南京大学) ; Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI
机构 * ByteDance(字节跳动) ; CASIA(中国科学院自动化研究所) ; NJU(南京大学) ; PKU(北京大学) ; THU(清华大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Columbia University(哥伦比亚大学) ; University of Washington(华盛顿大学)
专题命中 视觉推理 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI
机构 * Baosight(博思特) ; NUS(新加坡国立大学) ; SIAT(深圳先进技术研究院) ; CUC(中国科学技术大学) ; Microsoft(微软) ; ANU(澳大利亚国立大学)
专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Tech report
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * Department of Civil and Environmental Engineering, University of Michigan(土木与环境工程系,密歇根大学) ; University of Michigan Transportation Research Institute(密歇根大学交通研究所)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI
专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.CV
专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV
机构 * Zhejiang University(浙江大学) ; Om AI Research(Om AI 研究所) ; Binjiang Institute of Zhejiang University(浙江大学滨江研究院)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments Accepted by EMNLP-2025 Main. Project page: https://szhanz.github.io/zoomeye/
机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
Comments Accepted to ICCV Workshop 2025
机构 * Vanderbilt University(范德比尔特大学) ; Weill Cornell Medicine(韦尔·科恩医学中心) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; UT MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)
专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
机构 * UC San Diego(UC圣地亚哥大学) ; Carnegie Mellon University(卡内基梅隆大学) ; MBZUAI(马斯克人工智能研究所)
专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV
机构 * School of Automation Science and Engineering, Xi’an Jiaotong University(自动化科学与工程学院,西安交通大学) ; Interdisciplinary Graduate Programme, Nanyang Technological University(跨学科研究生项目,南洋理工大学) ; Lenovo Research, Lenovo(联想研究院,联想) ; School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 21 pages, 361 references