Exploring and Improving the Spatial Reasoning Abilities of Large Language Models
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Published in NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Published in NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments EMNLP 2023
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted by 2nd MATH-AI Workshop at NeurIPS'22
Journal ref Adv. Artif. Intell. Mach. Learn.(2023), 3(1):839-852
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted for publication at the International Conference on Machine Learning, ICML 2023
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 11 pages in main paper + 71 pages in appendix
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Journal ref Eleventh International Conference on Learning Representations (ICLR) 2023
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments CVPR 2023. Project page: https://vis-www.cs.umass.edu/3d-clr/
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments NAACL 2022 (13 pages)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments ICLR 2022; Code: https://github.com/NVlabs/RelViT
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments ICLR 2022
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments Accepted to ICCV 2021. PaperId : ICCV2021-10857 Copyright transferred to IEEE ICCV. DOI will be updated later
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Updated version
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments NAACL 2021
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted to CVPR 2021. Resources including the TRANCE dataset and the code can be found at our homepage https://hongxin2019.github.io/TVR
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to EMNLP'20 Findings
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments to appear in EMNLP 2018
前沿大语言模型在空间意象推理中的局限性
机构 * Institute of Mathematics and Statistics – University of São Paulo(数学统计研究所 – 圣保罗大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究通过引入外部“意象模块”辅助3D模型旋转任务,发现即使外包整体3D状态维护,前沿模型仍缺乏基础视觉空间原语,导致准确率最高仅62.5%。
Comments 25 pages. v2: Title updated; added a section on object/spatial imagery and propositional reasoning; added new experimental results for the single-object rotation probe
通过文本表示引导推理来解锁多模态大语言模型中的空间推理
机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。
Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
Comments 10 pages,a detail and effective benchmark for spatial reasoning
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
Comments 10 figures. 8 pages. Accepted for presentation at 36th International Workshop on Qualitative Reasoning (QR-23), in conjunction with ECAI2023 in Krakow, Poland
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
Comments Technical Report for Humane-AI micro-project "Multi-Relational Contextual Reasoning for Complex Scene Generation for Autonomous Vehicle Data". 23 pages, 6 figures
通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉
机构 * Meta AI
专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。
CoLT: 教会多模态模型通过潜在思维链进行思考
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; NKIARI ; AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) ; Tianjin University(天津大学)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。
Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT
面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs
机构 * Nanyang Technological University(南洋理工大学) ; DAMO Academy, Alibaba Group(阿里集团大模型研究院) ; HuPan Lab(虎派实验室) ; Alibaba Group(阿里集团)
专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)
AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。
AdaTooler-V:面向图像和视频的自适应工具使用
机构 * MMLab, CUHK(香港中文大学MML实验室) ; THU(清华大学) ; SJTU(上海交通大学) ; DB Group, CUHK(香港中文大学DB小组) ; UCF(佛罗里达大学) ; Sangfor(Sangfor公司) ; JMU(约翰·霍普金斯大学)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。
Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V
Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型
机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。
SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成
机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Zhongguancun Academy(中关村学院)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。
EgoTL:用于长时任务的目视思考链
机构 * UMN(明尼苏达大学) ; TAMU(德克萨斯农工大学) ; Brown University(布朗大学) ; McGill University(麦吉尔大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; Columbia University(哥伦比亚大学) ; Northwestern University(西北大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 本文提出EgoTL,通过构建目视思考链管道,提升长时任务中视觉语言模型和世界模型的推理与规划能力,发现基础模型在作为目视助手或开放世界模拟器方面仍有不足。
Comments https://ego-tl.github.io/