Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency
通过几何逻辑一致性实现视觉语言模型中的自演化空间推理
Junming Liu, Yuqi Li, Yifei Sun, Maonan Wang, Piotr Koniusz, Yirong Chen, Ding Wang
机构
*
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
The City University of New York(纽约城市大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Data61 CSIRO(Data61澳大利亚国家科学研究院)
;
University of New South Wales(新南威尔士大学)
;
Australian National University(澳大利亚国立大学)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理
Zejun Li, Yingxiu Zhao, Jiwen Zhang, Siyuan Wang, Yang Yao, Runzhou Zhao, Jun Song, Bo Zheng, Zhongyu Wei
机构
*
Fudan University(复旦大学)
;
Alibaba Group Holding Limited(阿里巴巴集团控股有限公司)
;
Future Living Lab of Alibaba(阿里巴巴未来生活实验室)
;
University of Southern California(南加州大学)
;
Shanghai Innovation Institute(上海创新研究院)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
迈向统一的手术场景理解:通过多模态大语言模型弥合推理与 grounding
Jincai Huang, Shihao Zou, Yuchen Guo, Jingjing Li, Wei Ji, Kai Wang, Shanshan Wang, Weixin Si
机构
*
Southern University of Science and Technology(南方科技大学)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)
;
Northwestern University(西北大学)
;
University of Alberta(阿尔伯塔大学)
;
Yale University(耶鲁大学)
;
Nanfang Hospital(南华医院)
;
Shenzhen University of Advanced Technology(深圳大学先进技术研究院)
Retrieve, Integrate, and Synthesize: Spatial-Semantic Grounded Latent Visual Reasoning
检索、整合与综合:空间-语义 grounded 的潜在视觉推理
Jin Cui, Xinyue Long, Xunyong Zhang, Yadong Zhang, Chuanchang Su, Jingye Gan, Boran Zhao, Pengju Ren
机构
*
State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)
机构
*
National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学)
;
Meituan Inc.(美团公司)
;
National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)
Does RLVR Extend Reasoning Boundaries? Investigating Capability Expansion in Vision-Language Models
RLVR能否扩展推理边界?探究视觉-语言模型中的能力扩展
Minghe Shen, Zhuo Zhi, Chonghan Liu, Shuo Xing, Zhengzhong Tu, Che Liu
机构
*
University College London(伦敦大学学院)
;
Samsung R&D Institute UK(三星英国研发院)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Texas A&M University(德克萨斯农工大学)
;
Imperial College London(伦敦帝国学院)