Look Again, Think Slowly: Enhancing Visual Reflection in Vision-Language Models
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments EMNLP2025 Main
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments EMNLP2025 Main
机构 * KU Leuven(库勒韦恩大学) ; Leiden University(莱顿大学)
专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) ; Guangdong Provincial Key Laboratory of Space-Aerial Networking and Intelligent Sensing(广东省空间-航空网络与智能感知重点实验室) ; Information Systems Technology and Design, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计) ; School of System Design and Intelligent Manufacturing, Southern University of Science and Technology(南方科技大学系统设计与智能制造学院)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG
Comments The paper has been submitted to IEEE Internet of Things Magazine
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * Department of Civil & Environmental Engineering University of Utah(土木与环境工程系 犹他大学) ; Zachry Department of Civil and Environmental Engineering Texas A&M University(扎克里系 土木与环境工程系 德克萨斯农工大学) ; Department of Computer Science & Engineering Texas A&M University(计算机科学与工程系 德克萨斯农工大学)
专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments 24 pages, 6 tables, 7 figures
机构 * Peking University(北京大学)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
机构 * School of Information Science and Engineering, East China University of Science and Technology, Shanghai, China(信息科学与工程学院,东华大学,上海,中国) ; School of Computer Science, Fudan University, Shanghai, China(计算机科学学院,复旦大学,上海,中国)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments 13 pages, 7 figures, published to ACL 2025
Journal ref In Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 620-632, 2025, Vienna, Austria
机构 * Beijing Electronic Science & Technology Institute(北京电子科学技术研究所)
专题命中 视觉推理 :visual language model(title,abstract);VLM(abstract);分类 cs.AI
机构 * University of Science and Technology of China(科学技术大学) ; University of Adelaide(阿德莱德大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)
专题命中 视觉推理 :visual language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI
Comments 8 pages, 3 figures, this paper has been accepted by ACM MM 2025
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(华中科技大学光电研究院) ; Meta Reality Lab(Meta现实实验室) ; Xi’an Jiao Tong University(西安交通大学) ; National University of Singapore(新加坡国立大学) ; The Department of Systems Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学系统枢纽部门(广州))
专题命中 视觉推理 :MLLM(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments ICCV 2025
机构 * TikTok(字节跳动)
专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.LG
Comments Camera Ready for ACL 2025
机构 * Yangtze Delta Region Academy(扬子江地区学院) ; Beijing Institute of Technology(北京理工大学) ; School of Automation(自动化学院) ; Beihang University(北航大学) ; Advanced Research Institute of Multidisciplinary Sciences(多学科科学高级研究机构)
专题命中 视觉推理 :vision-language model(title,abstract);vision language model(abstract);分类 cs.AI
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments ICCV 2025
专题命中 视觉推理 :vision language model(title);VLM(abstract);visual language model(abstract);分类 cs.AI
机构 * Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, University of Hamburg(汉堡大学信息学院多模态系统技术部门) ; Hon Hai Research Institute (HHRI)(鸿海研究机构) ; Department of Electrical Engineering, National Taiwan University(台湾大学电子工程系) ; Department of Computer Science and Technology, National Tsinghua University(清华大学计算机科学与技术系)
专题命中 视觉推理 :vision-language model(title,abstract);visual language model(abstract);分类 cs.CV
机构 * ETH Zurich(苏黎世联邦理工学院) ; TU Munich(慕尼黑技术大学)
专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
机构 * Rikkyo University(立命馆大学) ; University of Tokyo(东京大学) ; ATR(ATR研究所) ; Institute of Science Tokyo(东京科学研究院) ; National Institute of Informatics(国家信息研究所) ; NII LLMC(日本信息处理学会LLMC) ; Sony Semiconductor Solutions(索尼半导体解决方案)
专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);grounding(abstract);分类 cs.CV
Comments Accepted by ICCV 2025
机构 * ByteDance(字节跳动) ; Peking University(北京大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :multimodal large language model(title);grounding(abstract);MLLM(abstract);分类 cs.CV
机构 * Harvard Medical School(哈佛医学院) ; Knovel Engineering Lab(Knovel工程实验室)
专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV
Comments Under review
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; The Chinese University of Hong Kong(香港中文大学) ; The University of Hong Kong(香港大学)
专题命中 视觉推理 :vision language model(title,abstract);multimodal large language model(abstract);分类 cs.AI
Comments Code: https://github.com/TencentARC/MindOmni
机构 * School of Computer Science and Engineering, Sun Yat-Sen University(中山大学计算机科学与工程学院) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) ; Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV
Comments Accepted by ACL 2025 main
机构 * HKUST(香港科技大学) ; Peking University(北京大学) ; Shanghai AI Lab(上海人工智能实验室) ; Imperial College London(伦敦帝国理工学院)
专题命中 视觉推理 :visual reasoning(title,abstract);visual question answering(abstract);分类 cs.CV
机构 * Department of Computer Science(计算机科学系) ; Iowa State University(爱荷华州立大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
机构 * University of Notre Dame(诺丁汉大学) ; Tencent AI Seattle Lab(腾讯AI西雅图实验室) ; UIUC(伊利诺伊大学香槟分校)
专题命中 视觉推理 :vision language model(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
Comments Our code is available at https://github.com/tencent-ailab/Leopard
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Honda Research Institute USA(本田研究院美国)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments Paper is accepted by IJCV
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Xiamen University(厦门大学) ; SenseTime Research(商汤科技研究院) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
机构 * Tsinghua University(清华大学)
专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV
机构 * Huazhong University of Science and Technology(华中科技大学) ; Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Waytous ; University of Technology Sydney(悉尼大学) ; Microsoft Research(微软研究院) ; IAIR, Xi’an Jiaotong University(西安交通大学IAIR) ; TikTok ; AIR, Tsinghua University(清华大学AIR)
专题命中 视觉推理 :vision language model(title,abstract);MLLM(abstract);分类 cs.CV