Discovering Pathology Rationale and Token Allocation for Efficient Multimodal Pathology Reasoning
机构 * Department of Computer Science Engineering(计算机科学与工程系) ; HKUST(香港科技大学)
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * Department of Computer Science Engineering(计算机科学与工程系) ; HKUST(香港科技大学)
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI
机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院) ; Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) ; Australian National University(澳大利亚国立大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments 18 pages
机构 * Microsoft Research(微软研究院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
Comments 24 pages, 10 figures, in submission. Project page: https://andrewliao11.github.io/LongPerceptualThoughts
机构 * Shanghai Jiao Tong University(上海交通大学) ; OPPO AI Center(OPPO人工智能中心)
专题命中 视觉推理 :LLaVA(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Saskatchewan(萨斯喀彻温大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Submitted to arXiv. Code repository: https://github.com/arashsajjadi/TGraphX ||| https://git.cs.usask.ca/arash/tgraphx
机构 * Johns Hopkins University(约翰斯·霍普金斯大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
Comments 9 pages, preprint
机构 * Rutgers University(罗格斯大学) ; SRI International(SRI国际)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICLR 2025
机构 * Reality Labs ; FAIR
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * ShanghaiTech University(上海科技大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Monash University(莫纳什大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
Comments Accepted by CVPR25
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * University of Edinburgh(爱丁堡大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted at the ICLR 2025 Workshop on Reasoning and Planning for Large Language Models
机构 * Harvard Medical School(哈佛医学院) ; MIT Lincoln Laboratory(麻省理工学院林肯实验室) ; Harvard University(哈佛大学) ; Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所) ; Harvard Data Science Initiative(哈佛数据科学倡议)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
Comments Project page: https://zitniklab.hms.harvard.edu/TxAgent TxAgent code: https://github.com/mims-harvard/TxAgent ToolUniverse code: https://github.com/mims-harvard/ToolUniverse
机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) ; Pengcheng Laboratory(鹏城实验室) ; School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院)
专题命中 视觉推理 :visual question answering(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :visual language model(abstract);分类 cs.AI、cs.LG
Comments 8 pages, 3 figures
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted to ICASSP 2025
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
Comments Project page: https://mizhenxing.github.io/ThinkDiff, 19 pages, 14 figures
机构 * Texas A&M University(得克萨斯农工大学) ; University of Michigan(密歇根大学) ; University of Toronto(多伦多大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments The 3rd WACV Workshop on Large Language and Vision Models for Autonomous Driving (LLVM-AD) 2025
机构 * Boston University(波士顿大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Microsoft Research(微软研究院) ; University of Cambridge(剑桥大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.LG
Comments 11 pages, 6 figures, 4 tables (27 pages, 10 figures, 16 tables including references and appendices)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments A technical report. Project: https://github.com/xin-ran-w/CapAgent
机构 * Michigan State University(密歇根州立大学) ; Cornell University(康奈尔大学) ; Arizona State University(亚利桑那州立大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Yale University(耶鲁大学)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Working in progress
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Github Repo: https://github.com/InternLM/InternLM-XComposer/tree/main/InternLM-XComposer-2.5-OmniLive
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by The European Conference on Computer Vision (ECCV) 2024
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
Comments Presented at the Third Learning on Graphs Conference (LoG 2024). 10 pages, 1 figure