Efficient Whole Slide Pathology VQA via Token Compression
机构 * Stony Brook University(石溪大学)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Stony Brook University(石溪大学)
专题命中 视觉问答 :LLaVA(abstract);visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract)
机构 * Argonne National Laboratory(阿贡国家实验室)
专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV、cs.LG
Comments Preprint
机构 * McGill University(麦吉尔大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Florida(佛罗里达大学) ; The University of Hong Kong(香港大学)
专题命中 视觉推理 :vision language model(title,abstract);分类 cs.CV
机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) ; Amazon.com, Inc.(亚马逊公司)
专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG
Journal ref COLM 2025
专题命中 视觉推理 :grounding(title);分类 cs.AI
机构 * CASIA(中国科学院自动化研究所) ; UCAS(中国科学技术大学) ; ZGCA(北京智感科技有限公司) ; HKU(香港大学) ; HKUST(香港科技大学) ; NTU(国立台湾大学) ; PKU(北京大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments Preprint, Under review
机构 * Department of Electrical and Electronic Engineering, Bangladesh University of Engineering and Technology (BUET)(电气与电子工程系,孟加拉国工程与技术大学)
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG
Comments Will be submitted at IEEE JBHI
机构 * School of Computer Science & Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波校区计算机科学学院) ; Wenzhou Medical University(温州医科大学) ; School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Strong accept by NeurIPS2025 Reviewers and AC
机构 * Australian National University(澳大利亚国立大学) ; Maincode ; GE Research(通用电气研究)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
Comments 14 pages, video anomaly detection
机构 * South China University of Technology(华南理工大学) ; Institute for Infocomm Research (I 2 R), A*STAR(信息通信研究所(I 2 R),A*STAR) ; WeChat Vision, Tencent Inc.(微信视觉,腾讯公司) ; Foshan University(佛山大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments 24 pages, 12 figures and 9 tables
机构 * Niantic Spatial ; KAUST(科威特科学与技术研究中心) ; UCL(伦敦大学学院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
Comments ICCV 2025. Project page: https://nianticlabs.github.io/placeit3d/
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
Comments 52 pages
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
机构 * Meta ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 视觉定位与Grounding :grounding(abstract)
机构 * The Chinese University of Hong Kong(香港中文大学) ; Monash University(墨尔本大学) ; Amazon(亚马逊) ; South China University of Technology(华南理工大学)
专题命中 文档图表理解 :VLM(abstract);分类 cs.CV
机构 * Shanghai Jiao Tong University(上海交通大学) ; Beijing Institute of Technology(北京理工大学)
专题命中 GUI与屏幕智能体 :VLM(title);vision-language model(abstract)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV
Comments 9 pages, 6 figures, 3 tables
机构 * College of Computer Science and Technology, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(计算机科学与技术学院、教育部符号计算与知识工程重点实验室、吉林大学) ; College of Software, Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(软件学院、教育部符号计算与知识工程重点实验室、吉林大学)
专题命中 幻觉与鲁棒性 :vision-language model(title);分类 cs.CV
专题命中 幻觉与鲁棒性 :multimodal large language model(title)
Comments This paper is accepted for presentation in TRB annual meeting 2026. The version presented here is the preprint version before peer review process
机构 * STEM, University of South Australia(南澳大利亚大学STEM学院) ; Faculty of Electrical and Computer Engineering, University of Ljubljana(卢布尔雅那大学电气与计算机工程学院)
专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG
机构 * Sapienza University of Rome(罗马萨皮恩扎大学) ; OmnAI Lab(OmnAI实验室)
专题命中 幻觉与鲁棒性 :grounding(abstract)
专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(title,abstract);分类 cs.CV
Comments EMNLP 2025 System Demonstration | Code: https://github.com/compling-wat/vlm-lens
机构 * Department of Computer Science, University of California Los Angeles(加州大学洛杉矶分校计算机科学系) ; Google Research(谷歌研究)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG
Comments 30 pages, 10 figures, 5 tables, link: https://bigml-cs-ucla.github.io/XMAS-project-page/
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; CUHK MMLab(香港大学MMLab) ; ByteDance(字节跳动)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG
Comments Project page: https://hywang66.github.io/bridge/
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.AI
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学) ; Alexandria University(亚历山大大学) ; IIT Delhi(德里理工学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV
Comments 15 pages
机构 * MAIS, CASIA(中国科学院自动化研究所MAIS实验室) ; Kuaishou Technology(快手科技) ; School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
Comments NeurIPS 2025
专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments 7 pages, 2 figure, 2 tables, CV4A11y Workshop at ICCV 2025
机构 * ByteDance Inc.(字节跳动公司)
专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI