arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3368 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3368 篇

2312.01054 2023-12-05 cs.RO cs.AI cs.CL 81%

Exploring and Improving the Spatial Reasoning Abilities of Large Language Models

Manasi Sharma

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Published in NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.19785 2023-10-31 cs.CL cs.CV cs.LG 81%

What's "up" with vision-language models? Investigating their struggle with spatial reasoning

Amita Kamath, Jack Hessel, Kai-Wei Chang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16705 2023-10-18 cs.CV cs.CL cs.LG 81%

Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning

David Noever, Samantha Elizabeth Miller Noever

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13007 2023-07-06 cs.CV cs.AI cs.LG 81%

EuclidNet: Deep Visual Reasoning for Constructible Problems in Geometry

Man Fai Wong, Xintong Qi, Chee Wei Tan

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted by 2nd MATH-AI Workshop at NeurIPS'22

Journal ref Adv. Artif. Intell. Mach. Learn.(2023), 3(1):839-852

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03175 2023-06-07 cs.AI cs.LG stat.ML 81%

Infusing Lattice Symmetry Priors in Attention Mechanisms for Sample-Efficient Abstract Geometric Reasoning

Mattia Atzeni, Mrinmaya Sachan, Andreas Loukas

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted for publication at the International Conference on Machine Learning, ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11164 2023-04-25 cs.CL cs.AI 81%

Dialectical language model evaluation: An initial appraisal of the commonsense spatial reasoning abilities of LLMs

Anthony G Cohn, Jose Hernandez-Orallo

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages in main paper + 71 pages in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12810 2023-03-28 cs.CL cs.AI 81%

Are LLMs the Master of All Trades? : Exploring Domain-Agnostic Reasoning Skills of LLMs

Shrivats Agrawal

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04928 2023-03-22 cs.AI cs.LG cs.NE cs.SC 81%

GAMR: A Guided Attention Model for (visual) Reasoning

Mohit Vaishnav, Thomas Serre

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Journal ref Eleventh International Conference on Learning Representations (ICLR) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11327 2023-03-21 cs.CV cs.AI cs.LG cs.RO 81%

3D Concept Learning and Reasoning from Multi-View Images

Yining Hong, Chunru Lin, Yilun Du, Zhenfang Chen, Joshua B. Tenenbaum, Chuang Gan

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments CVPR 2023. Project page: https://vis-www.cs.umass.edu/3d-clr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03961 2022-07-11 cs.CL cs.AI cs.CV 81%

CoSIm: Commonsense Reasoning for Counterfactual Scene Imagination

Hyounghun Kim, Abhay Zala, Mohit Bansal

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments NAACL 2022 (13 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11167 2022-06-14 cs.CV cs.AI cs.LG 81%

RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning

Xiaojian Ma, Weili Nie, Zhiding Yu, Huaizu Jiang, Chaowei Xiao, Yuke Zhu, Song-Chun Zhu, Anima Anandkumar

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments ICLR 2022; Code: https://github.com/NVlabs/RelViT

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12162 2022-03-01 cs.LG cs.AI cs.CV 81%

Measuring CLEVRness: Blackbox testing of Visual Reasoning Models

Spyridon Mouselinos, Henryk Michalewski, Mateusz Malinowski

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments ICLR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01934 2021-09-07 cs.CV cs.CL cs.LG 81%

Weakly Supervised Relative Spatial Reasoning for Visual Question Answering

Pratyay Banerjee, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to ICCV 2021. PaperId : ICCV2021-10857 Copyright transferred to IEEE ICCV. DOI will be updated later

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.13613 2021-06-08 cs.AI cs.CL 81%

Joint Spatio-Textual Reasoning for Answering Tourism Questions

Danish Contractor, Shashank Goel, Mausam, Parag Singla

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05832 2021-04-14 cs.CL cs.AI 81%

SpartQA: : A Textual Question Answering Benchmark for Spatial Reasoning

Roshanak Mirzaee, Hossein Rajaby Faghihi, Qiang Ning, Parisa Kordjmashidi

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13160 2021-04-05 cs.CV cs.AI cs.LG 81%

Transformation Driven Visual Reasoning

Xin Hong, Yanyan Lan, Liang Pang, Jiafeng Guo, Xueqi Cheng

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2021. Resources including the TRANCE dataset and the code can be found at our homepage https://hongxin2019.github.io/TVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.05001 2020-10-13 cs.CL cs.AI 81%

Beyond Language: Learning Commonsense from Images for Reasoning

Wanqing Cui, Yanyan Lan, Liang Pang, Jiafeng Guo, Xueqi Cheng

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP'20 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01943 2018-09-07 cs.IR cs.AI cs.CL cs.CV 81%

Cascaded Mutual Modulation for Visual Reasoning

Yiqun Yao, Jiaming Xu, Feng Wang, Bo Xu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments to appear in EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26779 2026-06-02 cs.CV cs.AI 80%

Limits of Spatial Imagery Reasoning in Frontier LLM Models

前沿大语言模型在空间意象推理中的局限性

Sergio Y. Hayashi, Nina S. T. Hirata

机构 * Institute of Mathematics and Statistics – University of São Paulo(数学统计研究所 – 圣保罗大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究通过引入外部“意象模块”辅助3D模型旋转任务,发现即使外包整体3D状态维护,前沿模型仍缺乏基础视觉空间原语,导致准确率最高仅62.5%。

Comments 25 pages. v2: Title updated; added a section on object/spatial imagery and propositional reasoning; added new experimental results for the single-object rotation probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL 80%

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13782 2025-11-19 cs.AI 80%

Imagine in Space: Exploring the Frontier of Spatial Intelligence and Reasoning Efficiency in Vision Language Models

Xiaoxing Lian, Aidong Yang, Jun Zhu, Peng Wang, Yue Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

Comments 10 pages,a detail and effective benchmark for spatial reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15577 2023-09-28 cs.AI 80%

An Evaluation of ChatGPT-4's Qualitative Spatial Reasoning Capabilities in RCC-8

Anthony G Cohn

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

Comments 10 figures. 8 pages. Accepted for presentation at 36th International Workshop on Qualitative Reasoning (QR-23), in conjunction with ECAI2023 in Krakow, Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02255 2023-05-04 cs.AI cs.LO 80%

Contextual Reasoning for Scene Generation (Technical Report)

Loris Bozzato, Thomas Eiter, Rafael Kiesel, Daria Stepanova

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

Comments Technical Report for Humane-AI micro-project "Multi-Relational Contextual Reasoning for Complex Scene Generation for Autonomous Vehicle Data". 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 80%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31986 2026-08-04 cs.CV 版本更新 80%

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT: 教会多模态模型通过潜在思维链进行思考

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) NKIARI AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) Tianjin University(天津大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。

Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19528 2026-05-20 cs.CV 80%

Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs

Xueying Jiang, Wenhao Li, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里集团大模型研究院) HuPan Lab(虎派实验室) Alibaba Group(阿里集团)

专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)

AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 80%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV 80%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07961 2026-04-24 cs.CV 80%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09535 2026-04-13 cs.CV 80%

EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks

EgoTL:用于长时任务的目视思考链

Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan

机构 * UMN(明尼苏达大学) TAMU(德克萨斯农工大学) Brown University(布朗大学) McGill University(麦吉尔大学) UT Austin(德克萨斯大学奥斯汀分校) Columbia University(哥伦比亚大学) Northwestern University(西北大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出EgoTL,通过构建目视思考链管道,提升长时任务中视觉语言模型和世界模型的推理与规划能力,发现基础模型在作为目视助手或开放世界模拟器方面仍有不足。

Comments https://ego-tl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏