Perceiving Beyond Language Priors: Enhancing Visual Comprehension and Attention in Multimodal Models
机构 * AppliedML, Cerebras(应用机器学习,Cerebras)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
机构 * AppliedML, Cerebras(应用机器学习,Cerebras)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * School of Computer Science University of New South Wales(计算机科学学院新南威尔士大学) ; School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院新南威尔士大学) ; DEVCOM Army Research Laboratory(陆军研究实验室)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments 23 pages, 12 figures, 10 tables
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI
Comments An unified model for multimodal understanding, text-to-image generation, and image editing. GitHub: https://github.com/AIDC-AI/Ovis-U1
机构 * Hefei University of Technology(合肥工业大学) ; Tsinghua University(清华大学) ; Academy of Cyber(网络学院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * School of Computing and Information, University of Pittsburgh(计算与信息学院,匹兹堡大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2025. 7 pages, 3 figures
机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Trento(特伦特大学) ; Renmin University of China(中国人民大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI
Comments 12 pages, 5 Figure, 3 Table
机构 * University of Oxford(牛津大学) ; McGill University(麦吉尔大学) ; Meta
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
机构 * Institute for AI, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) ; State Key Laboratory of General Artificial Intelligence, Institute for AI, Peking University, Beijing, China(通用人工智能国家重点实验室,人工智能研究院,北京大学,北京,中国)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments 17 pages, 13 figures
机构 * University of Maryland, College Park(马里兰大学 College Park 分校)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments ICLR 2025. Project page: https://hywang66.github.io/larp/
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments Preprint
机构 * University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学) ; Dexmal
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Department of Computer Science, Princeton University, Princeton, NJ, United States(普林斯顿大学计算机科学系) ; Salesforce Research, Palo Alto, CA, United States(Salesforce研究)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG
Comments Accepted to ICML 2025 as a Poster. Project page: https://tylerzhu.com/merv/
机构 * The Pennsylvania State University(宾夕法尼亚州立大学) ; National Institute of Technology, Tiruchirappalli(特里奇里帕利理工学院)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI
Comments Accepted in the NAACL Fourth Workshop on Intelligent and Interactive Writing Assistants (In2Writing), Albuquerque, New Mexico, May 2025, https://in2writing.glitch.me
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; IBM Research(IBM研究院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
机构 * Nankai University(南开大学) ; Shanghai Innovation Institute(上海创新研究院) ; University of Science and Technology of China(中国科学技术大学) ; Wuhan University(武汉大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
Comments 8 pages, 9 figures
机构 * School of Computer, Central China Normal University(中央财经大学计算机学院) ; Amazon(亚马逊)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
Comments 14 pages, 3 figures
机构 * ShanghaiTech University(上海科技大学) ; Henan University(河南大学) ; Liaoning University of Traditional Chinese Medicine(辽宁中医药大学)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
机构 * Australian Artificial Intelligence Institute(澳大利亚人工智能研究所)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG
Comments Accepted at ICML 2025
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院) ; School of Software Engineering of Zhejiang University(浙江大学软件工程学院) ; Polytechnic Institute of Zhejiang University(浙江大学 polytechnic 院)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI
Comments Accepted by IEEE Geoscience and Remote Sensing Magazine
机构 * School of Software, Tsinghua University(清华大学软件学院) ; BNRist, Tsinghua University(清华大学BNRist) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI
机构 * Technische Universität Berlin(柏林技术大学) ; IIIT Hyderabad(海得拉巴国家理工学院) ; Univ of Maryland(马里兰大学) ; Rice Univ(Rice 大学) ; Univ of Wisconsin - Madison(威斯康星大学麦迪逊分校) ; Spector Inc(Spector 公司) ; Microsoft(微软公司)
专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.AI、cs.LG
Comments 30 pages, 22 figures, The Thirteenth International Conference on Learning Representations, ICLR-2025, Singapore. https://openreview.net/pdf?id=xkgfLXZ4e0
Journal ref ICLR-2025, Singapore
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Changdae Oh ; Zhen Fang ; Shawn Im ; Xuefeng Du ; Yixuan Li
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG
Comments ICML 2025 camera-ready
机构 * University of Southern California(南加州大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments 15 pages, 3 figures
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王宣计算机技术研究所) ; University of Science and Technology of China(中国科学技术大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG
机构 * George Mason University(乔治·马歇尔大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
机构 * Shanghai Jiaotong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学) ; Wuhan University(武汉大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI
Comments project url: https://github.com/Liuziyu77/Visual-RFT/tree/main/Visual-ARFT
机构 * University of Notre Dame(诺丁汉大学) ; Lehigh University(莱斯大学) ; Imperial College London(伦敦帝国理工学院) ; Rutgers University(罗格斯大学) ; International Business Machines Corporation (IBM)(国际商业机器公司(IBM)) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Microsoft Research(微软研究院)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG