SOLIDGEO: Measuring Multimodal Spatial Math Reasoning in Solid Geometry
专题命中 视觉空间推理 :reasoning(title,abstract);math reasoning(title)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(title,abstract);math reasoning(title)
CharTool: 集成工具的视觉推理用于图表理解
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) ; Suzhou Laboratory(苏州实验室) ; AISpeech Co., Ltd.(思必驰科技股份有限公司)
专题命中 视觉空间推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。
Comments Accepted by ACMMM 2026
追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架
机构 * East China Normal University(华东师范大学) ; Zhongguancun Academy(中关村学院) ; Stevens Institute of Technology(史蒂文斯理工学院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL
AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。
Comments 19 pages, 7 figures
回溯应达到何种程度?探索SFT与RL在增强大语言模型推理能力中的相互作用
机构 * Duke University(杜克大学) ; Mila - Quebec AI Institute(魁北克人工智能研究所)
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI
AI总结 本研究探索SFT与RL在LLM推理中的相互作用,提出回溯是关键算子,发现最优回溯深度随任务难度变化,引入以回溯为核心的训练方案,证实合理回溯可提升模型推理能力。
推理中的回声:通过思维链实现隐蔽且有效的数字水印
机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) ; Nanyang Technological University, Singapore(南洋理工大学) ; National University of Singapore, Singapore(新加坡国立大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.LG
AI总结 提出BiCoT框架,通过将水印嵌入推理轨迹的内部几何结构,并利用基于Top-logprob的黑盒验证器RSR,在不影响推理保真度的前提下实现鲁棒的水印检测。
Comments This paper is accepted by ICML2026
森林在树之前:用于高效视觉推理的潜在叠加
机构 * MBZUAI ; Fudan University(复旦大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Harvard University(哈佛大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出Laser方法,通过动态窗口对齐学习实现视觉推理的'森林在树之前'认知层次,提升模型在保持全局特征叠加的同时,实现高效且可解释的视觉推理。
Comments Accepted by ACL 2026 Main Conference
可信的GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理
机构 * IIT Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出Faithful GRPO,通过约束策略优化提升多模态模型的空间推理质量,减少推理不一致率并提升视觉 grounding 评分。
Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理
机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) ; Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。
Comments CVPR 2026 - main
面向小规模MLLMs的漫画中忠实推理方法
机构 * Duke Kunshan University(昆山杜克大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。
PointCoT: 一种用于显式3D几何推理的多模态基准
机构 * Xi'an Jiaotong University(西安交通大学) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; Nanyang Technological University(南洋理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Institute of Automation, CASIA(中国科学院自动化研究所) ; Taiyuan University of Technology(太原理工大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。
更多未必更好:对视觉空间推理中空间与常识信息的系统分析
机构 * The University of Melbourne(墨尔本大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 本文通过系统分析发现,过多信息未必提升视觉空间推理性能,针对性单空间提示和精确空间定位可提高准确性。
Comments 5 pages, 6 figures, Under review
3DGSNav: 通过主动3D高斯散射增强视觉-语言模型的物体导航
机构 * Zhejiang University of Technology, Hangzhou, China(浙江工业大学,杭州,中国) ; Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 3DGSNav通过主动3D高斯散射提升视觉-语言模型的物体导航能力,结合结构化视觉提示和链式推理,实现高效且可靠的导航性能。
细粒度偏好优化提升视觉语言模型的空间推理能力
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL
AI总结 细粒度偏好优化方法SpatialReasoner-R1通过改进空间推理能力,在空间推理任务中取得显著性能提升。
通过视觉抽象思考:通过视觉抽象增强多模态推理
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
AI总结 通过引入视觉抽象思考范式,提升多模态大语言模型在视觉感知和推理任务中的性能,实现更高效的视觉推理机制。
DrawingBench:通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.CL
AI总结 DrawingBench通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力,揭示了模型在复杂场景中的表现及外部监督的重要性。
Comments AAAI 2026 TrustAgent Workshop
PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) ; Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) ; Spatialtemporal AI(时空人工智能) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。
机构 * Holcombe Department of Electrical and Computer Engineering(霍尔科姆电气与计算机工程系) ; Clemson University(克莱姆森大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI
Comments RoboSense Challenge with IROS 2025
机构 * University of Virginia(弗吉尼亚大学) ; Morgan Stanley(摩根士丹利)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG
Comments 23 pages
机构 * University of California, Davis(加州大学戴维斯分校) ; Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所人工智能学院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
Comments 51 pages, 23 figures, NeurIPS'25
机构 * SETLabs Resarch GmbH(SETL实验室)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI
Comments 11 pages, 3 figures
机构 * Independent Researcher(独立研究者)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Hong Kong University of Science and Technology(香港科技大学) ; Department of Thoracic Surgery, the Seventh Affiliated Hospital, Sun Yat-sen University(中山大学第七附属医院胸外科部门) ; Bioengineering/Imperial-X, Imperial College London(生物工程/Imperial-X,帝国理工学院伦敦分校) ; ROAS Thrust, Hong Kong University of Science and Technology (Guangzhou)(ROAS项目,香港科技大学(广州)) ; Department of Electronic and Computer Engineering, Hong Kong SAR(香港特别行政区电子与计算机工程系)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI
Comments Project page: https://vita-epfl.github.io/DrivingVQA
专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
Comments Accepted by ICML 2024
将神经符号程序蒸馏到3D多模态大语言模型中
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 提出APEIRIA,通过三阶段课程学习将符号推理模式蒸馏到3D多模态大语言模型中,实现透明推理与开放词汇空间推理的统一。
Comments To appear in ICML 2026
MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。
Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026
迈向增强医学多模态大语言模型中的 3D 空间推理
机构 * University of International Relations(国际关系学院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。