Semantic World Models
机构 * University of Washington(华盛顿大学) ; Sony AI(索尼人工智能)
专题命中 视觉问答 :vision-language model(abstract);vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * University of Washington(华盛顿大学) ; Sony AI(索尼人工智能)
专题命中 视觉问答 :vision-language model(abstract);vision language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG
专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * 1 School of Biomedical Engineering, Division of Life Sciences ; Medicine, University of Science ; Technology of China, Hefei, Anhui, 230026, P.R. China 2 Center for Medical Imaging, Robotics ; Analytic Computing \& LEarning (MIRACLE), Suzhou Institute for Advanced Research, USTC, Suzhou 215123, P.R. China 3 Jiangsu Provincial Key Laboratory of Multimodal Digital Twin Technology, Suzhou Jiangsu, 215123 4 State Key Laboratory of Precision
专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments The code, checkpoints, and dataset are available at: https://github.com/Leevan001/MedReason-R1
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual question answering(abstract);MLLM(abstract);分类 cs.CV、cs.AI
机构 * St. Pölten University of Applied Sciences(施普伦特应用科学大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
Comments Submitted to LREC 2026. 11 pages, 5 figures
机构 * The University of Melbourne(墨尔本大学) ; China University of Petroleum (East China)(中国石油大学(华东))
专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV
Comments Accepted by ACM Multimedia 2025
机构 * The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted by NeurIPS 2025
机构 * University of Trento(特伦托大学) ; Amazon(亚马逊公司) ; SISLab(SIS实验室) ; Department of Information Engineering and Computer Science(信息工程与计算机科学系)
专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV
Comments This work has been submitted to the IEEE for possible publication
机构 * Tulane University(路易斯安那州立大学)
专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV
Comments NeurIPS 2025
机构 * Apple(苹果公司)
专题命中 视觉推理 :MLLM(abstract);分类 cs.CV、cs.LG
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
Comments 5 pages, 2 figures, 2 tables
机构 * CUHK MMLab(香港中文大学多模态实验室) ; CUHK (SZ)(香港中文大学(深圳)) ; Tsinghua University(清华大学) ; UCAS(中国科学院大学) ; CUHK HCCL(香港中文大学高性能计算实验室)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
Comments NeurIPS 2025, Project page: https://github.com/tulerfeng/Video-R1
机构 * University of Virginia(弗吉尼亚大学) ; Adobe(Adobe公司)
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);分类 cs.CV
Journal ref CVPR 2025
机构 * School of Computer Science and Information Engineering, Hefei University of Technology, China(计算机科学与信息工程学院,合肥工业大学,中国) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, China(人工智能研究所,合肥综合性国家科学中心,中国)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV
Comments 12 pages, 6 figures
机构 * ARTORG Center for Biomedical Engineering Research, University of Bern, Switzerland(ARTORG生物医学工程研究中心,伯尔尼大学,瑞士) ; Shanghai Jiao Tong University, China(上海交通大学,中国) ; Kaiko.AI, Switzerland(Kaiko.AI,瑞士) ; Dept. of Radiation Oncology, Inselspital, Bern University Hospital(放射肿瘤科,因斯普尔茨医院,伯尔尼大学医院)
专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI
机构 * Mission San Jose High School(Mission San Jose 高中) ; Missouri University of Science and Technology(密苏里科学与技术大学) ; Michigan State University(密歇根州立大学)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
机构 * Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学) ; Department of Design and Innovation, Case Western Reserve University(设计与创新系,凯斯西储大学)
专题命中 视觉定位与Grounding :grounding(abstract)
Comments Accepted at Findings of ACL 2025
机构 * Allen Institute for AI(艾伦人工智能研究所)
专题命中 文档图表理解 :vision language model(abstract);VLM(abstract);分类 cs.CV
Comments https://olmocr.allen.ai/
机构 * Michigan State University(密歇根州立大学) ; Amazon(亚马逊) ; Northeastern University(东北大学) ; Northwestern University(西北大学) ; University of Central Florida(佛罗里达中央大学)
专题命中 GUI与屏幕智能体 :VLM(title);grounding(abstract);分类 cs.AI、cs.LG
机构 * OPPO AI Center(OPPO人工智能中心)
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
机构 * The University of Hong Kong(香港大学) ; Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.AI、cs.LG
Comments 8 pages, 6 figures
机构 * UC Berkeley(伯克利大学) ; Physical Intelligence(物理智能)
专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.AI
Comments 7 pages and appendix
机构 * NVIDIA ; KAIST(韩国科学技术院) ; National Taiwan University(国立台湾大学)
专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV
Comments NeurIPS 2025, Project page: https://byungkwanlee.github.io/RIL-page
机构 * Human-Robot Interfaces and Interaction Lab, Istituto Italiano di Tecnologia, Genoa, Italy(人机交互实验室,意大利理工学院,热那亚) ; Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院,美国亚特兰大)
专题命中 幻觉与鲁棒性 :vision language model(abstract);VLM(abstract)
Comments Code, video and RAG dataset are available at \url{https://sites.google.com/view/omni-vic}
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.LG
机构 * NVIDIA ; KAIST(韩国科学技术院) ; National Taiwan University(国立台湾大学)
专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV
Comments CVPR 2025, Project page: https://byungkwanlee.github.io/VLsI-page/
机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom, P. R. China(人工智能研究所(TeleAI),中国电信,中华人民共和国) ; College of Computer Science, Wuhan University(计算机科学学院,武汉大学) ; School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院,光学与电子学(iOPEN),西北工业大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
机构 * Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心、剑桥大学) ; Department of Engineering, University of Cambridge(工程系、剑桥大学) ; Department of Psychology, University of Cambridge(心理学系、剑桥大学) ; Department of Computer Science, University of Cambridge(计算机科学系、剑桥大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Preprint