arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3368 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3368 篇

2603.25091 2026-03-27 cs.CV cs.AI 83%

Pixelis: Reasoning in Pixels, from Seeing to Acting

Pixelis:在像素中推理,从看见到行动

Yunpeng Zhou

机构 * University of Reading(雷丁大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。

Comments 28pages, 16figures, 18tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22279 2026-03-24 cs.CV cs.AI 83%

3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing

3D-Layout-R1: 为语言指导的空间编辑进行结构化推理

Haoyu Zhen, Xiaolong Li, Yilin Zhao, Han Zhang, Sifei Liu, Kaichun Mo, Chuang Gan, Subhashree Radhakrishnan

机构 * NVIDIA UMass Amherst(马萨诸塞大学阿默斯特分校)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20662 2026-03-24 cs.AI cs.CV 83%

Attention in Space: Functional Roles of VLM Heads for Spatial Reasoning

空间中的注意:VLM头部在空间推理中的功能角色

Xueqi Ma, Shuo Yang, Yanbei Jiang, Shu Liu, Zhenzhen Liu, Jiayang Ao, Xingjun Ma, Sarah Monazam Erfani, James Bailey

机构 * The University of Melbourne(墨尔本大学) Australian National University(澳大利亚国立大学) Fudan University(复旦大学) Monash University(莫纳什大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08007 2026-03-10 cs.CV cs.AI 83%

ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation

ViSA增强的空中视觉语言导航:一种增强视觉空间推理能力的空中视觉语言导航框架

Haoyu Tong, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou, Chenghao Lin

机构 * Tianmushan Laboratory, Beihang University(北航之梦实验室,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北京航空航天大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 ViSA增强框架通过结构化视觉提示提升空中VLN的空间推理能力,显著提高成功率,为该领域提供有力支持。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15828 2026-03-10 cs.RO cs.AI 83%

Context Matters! Relaxing Goals with LLMs for Feasible 3D Scene Planning

情境至关重要!利用LLMs进行可行的3D场景规划

Emanuele Musumeci, Michele Brienza, Francesco Argenziano, Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Domenico D. Bloisi

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(Sapienza大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 ContextMatters结合LLMs与经典规划,通过分层目标放松提升3D场景规划的成功率

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09820 2026-03-10 cs.RO cs.AI 83%

ViLAM: Distilling Vision-Language Reasoning into Attention Maps for Social Robot Navigation

ViLAM:将视觉-语言推理转化为注意力图用于社交机器人导航

Mohamed Elnoor, Kasun Weerakoon, Gershom Seneviratne, Jing Liang, Vignesh Rajagopal, Dinesh Manocha

机构 * Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA) Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA) James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 ViLAM通过蒸馏视觉-语言模型的注意力图,提升社交机器人导航的社会适应性与导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00207 2026-03-03 cs.CV cs.AI 83%

VisRef: Visual Refocusing while Thinking Improves Test-Time Scaling in Multi-Modal Large Reasoning Models

VisRef: 通过思考进行视觉再聚焦以提高多模态大推理模型的测试时间扩展

Soumya Suvra Ghosal, Youngeun Kim, Zhuowei Li, Ritwick Chaudhry, Linghan Xu, Hongjing Zhang, Jakub Zablocki, Yifan Xing, Qin Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Amazon(亚马逊) Physion Labs(Physion实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 VisRef通过视觉再聚焦提升多模态大推理模型测试时间扩展性能,有效解决视觉依赖任务中推理性能下降问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18296 2026-02-25 cs.CE cs.AI 83%

Context-Aware Mapping of 2D Drawing Annotations to 3D CAD Features Using LLM-Assisted Reasoning for Manufacturing Automation

基于LLM辅助推理的上下文感知2D绘图注释到3D CAD特征映射

Muhammad Tayyab Khan, Lequn Chen, Wenhe Feng, Seung Ki Moon

机构 * Singapore Institute of Manufacturing Technology (SIMTech), A*STAR, Singapore(新加坡制造技术研究所) Advanced Remanufacturing and Technology Centre (ARTC), A*STAR, Singapore(先进再制造与技术中心) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM辅助推理的上下文感知框架,实现2D绘图注释到3D CAD特征的映射,提升制造自动化精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07082 2026-02-10 cs.CV cs.AI 83%

MosaicThinker: On-Device Visual Spatial Reasoning for Embodied AI via Iterative Construction of Space Representation

MosaicThinker: 通过迭代构建空间表示实现设备端具身AI的视觉空间推理

Haoming Wang, Qiyao Xue, Weichen Liu, Wei Gao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Pittsburgh(匹兹堡大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 MosaicThinker通过迭代构建空间表示,提升设备端具身AI在复杂跨帧空间推理任务中的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02453 2026-02-04 cs.AI 83%

Thinking with Comics: Enhancing Multimodal Reasoning through Structured Visual Storytelling

用漫画思考:通过结构化视觉叙事增强多模态推理

Andong Chen, Wenxin Zhu, Qiuyu Ding, Yuchen Song, Muyun Yang, Tiejun Zhao

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出用漫画作为中间视觉表示,通过结构化视觉叙事提升多模态推理效率和性能。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16891 2026-01-27 cs.AI 83%

LLMs as Layout Designers: Enhanced Spatial Reasoning for Content-Aware Layout Generation

LLMs作为布局设计师:增强的空间推理用于内容感知布局生成

Sha Li, Stefano Petrangeli, Yu Shen, Xiang Chen, Naren Ramakrishnan

机构 * Virginia Tech(弗吉尼亚理工大学) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 LaySPA通过强化学习框架增强LLM的空间推理能力,实现内容感知布局生成,优于通用LLM和专用布局模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16965 2026-01-26 cs.AI 83%

Spatial-Agent: Agentic Geo-spatial Reasoning with Scientific Core Concepts

空间智能体:基于科学核心概念的地理空间推理

Riyang Bao, Cheng Yang, Dazhou Yu, Zhexiang Tang, Gengchen Mai, Liang Zhao

机构 * Emory University(埃默里大学) Rutgers University(罗格斯大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 Spatial-Agent通过基于空间信息科学的理论框架,实现了可解释的地理空间推理,优于现有方法并产生可执行的工作流。

Comments 15pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14339 2026-01-22 cs.CV cs.AI 83%

CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments

CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试

Haotian Xu, Yue Hu, Zhengqiu Zhu, Chen Gao, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京研究院) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12742 2026-01-21 cs.RO cs.AI 83%

AirHunt: Bridging VLM Semantics and Continuous Planning for Efficient Aerial Object Navigation

AirHunt: 通过融合视觉语言模型语义与连续规划实现高效空中物体导航

Xuecheng Chen, Zongzhuo Liu, Jianfa Ma, Bang Du, Tiantian Zhang, Xueqian Wang, Boyu Zhou

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Energy Engineering, Southern University of Science and Technology(南方科技大学机械与能源工程系) Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Physics, Southern University of Science and Technology(南方科技大学物理系)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 AirHunt通过融合视觉语言模型语义与连续规划,实现高效空中物体导航,提升开放集物体定位的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05622 2025-12-29 cs.RO cs.AI 83%

CityNavAgent: Aerial Vision-and-Language Navigation with Hierarchical Semantic Planning and Global Memory

CityNavAgent:基于层次语义规划和全局记忆的空中视觉-语言导航

Weichen Zhang, Chen Gao, Shiquan Yu, Ruiying Peng, Baining Zhao, Qian Zhang, Jinqiang Cui, Xinlei Chen, Yong Li

机构 * Tsinghua University(清华大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 CityNavAgent通过层次语义规划和全局记忆模块,提升空中视觉-语言导航在复杂城市环境中的导航性能。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05809 2025-12-08 cs.CV cs.AI 83%

Probing the effectiveness of World Models for Spatial Reasoning through Test-time Scaling

通过测试时缩放探查世界模型在空间推理中的有效性

Saurav Jha, M. Jehanzeb Mirza, Wei Lin, Shiqi Yang, Sarath Chandar

机构 * MILA – Quebec AI Institute(魁北克人工智能研究所) Polytechnique Montréal(蒙特利尔理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Institute for Machine Learning, Johannes Kepler University Linz(林茨约瑟夫·夫兰克大学机器学习研究所) Nankai University(南开大学)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出ViSA框架,通过可验证的微断言改进世界模型的空间推理能力,但发现当前模型在复杂任务中仍存在信息瓶颈。

Comments Extended abstract at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02340 2025-12-03 cs.AI cs.CV 83%

Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective

多视角视觉空间推理的推理路径与潜在状态分析:从认知科学视角

Qiyao Xue, Weichen Liu, Shiqi Wang, Haoming Wang, Yuyang Wu, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 ReMindView-Bench从认知科学视角评估VLMs在多视角空间推理中的表现,揭示其在跨视角对齐和视角取向方面的不足。

Comments 23 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22659 2025-12-01 cs.AI cs.CV 83%

Geometrically-Constrained Agent for Spatial Reasoning

几何约束代理用于空间推理

Zeren Chen, Xiaoya Lu, Zhijie Zheng, Pengrui Li, Lehan He, Yijin Zhou, Jing Shao, Bohan Zhuang, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) ZIP Lab, Zhejiang University(浙江大学ZIP实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 Geometrically-Constrained Agent 通过引入正式任务约束,解决视觉语言模型在空间推理中的语义到几何差距问题,实现更稳健的推理路径。

Comments 27 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21395 2025-12-01 cs.CV cs.AI 83%

Monet: Reasoning in Latent Visual Space Beyond Images and Language

Monet: 在图像和语言之外的潜在视觉空间推理

Qixun Wang, Yang Shi, Yifei Wang, Yuanxing Zhang, Pengfei Wan, Kun Gai, Xianghua Ying, Yisen Wang

机构 * Peking University(北京大学) Kling Team(Kling团队) Amazon AGI SF Lab(Amazon AGI SF实验室) MIT(麻省理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 Monet通过在潜在视觉空间中直接推理,提升多模态大语言模型的视觉推理能力,解决了潜在-视觉对齐和嵌入监督不足的问题,展示了在现实世界和抽象视觉任务中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12868 2025-11-18 cs.CV cs.AI 83%

Video Finetuning Improves Reasoning Between Frames

Ruiqi Yang, Tian Yun, Zihan Wang, Ellie Pavlick

机构 * Brown University(布朗大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

Comments Accepted at CogInterp @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11916 2025-11-18 cs.AI 83%

An Analysis of Architectural Impact on LLM-based Abstract Visual Reasoning: A Systematic Benchmark on RAVEN-FAIR

Sinan Urgun, Seçkin Arı

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03768 2025-11-07 cs.LG cs.CV 83%

What's in Common? Multimodal Models Hallucinate When Reasoning Across Scenes

Candace Ross, Florian Bordes, Adina Williams, Polina Kirichenko, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

Comments 10 pages, 6 figures. Accepted to NeurIPS Datasets & Benchmarks 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27210 2025-11-03 cs.AI cs.CV 83%

GUI-Rise: Structured Reasoning and History Summarization for GUI Navigation

Tao Liu, Chongyu Wang, Rongjie Li, Yingchen Yu, Xuming He, Bai Song

机构 * ShanghaiTech University(上海科技大学) ByteDance(字节跳动) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24155 2025-10-30 cs.CL 83%

Blind Spot Navigation in Large Language Model Reasoning with Thought Space Explorer

Jinghan Zhang, Fengran Mo, Tharindu Cyril Weerasooriya, Xinyue Ye, Dongjie Wang, Yanjie Fu, Kunpeng Liu

机构 * Clemson University(克莱姆森大学) Université de Montréal(蒙特利尔大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心) The University of Alabama(阿拉巴马大学) University of Kansas(堪萨斯大学) Arizona State University(亚利桑那州立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17462 2025-10-20 cs.RO cs.AI cs.CV 83%

General-Purpose Robotic Navigation via LVLM-Orchestrated Perception, Reasoning, and Acting

Bernard Lange, Anil Yildiz, Mansur Arief, Shehryar Khattak, Mykel Kochenderfer, Georgios Georgakis

机构 * Stanford University(斯坦福大学) Jet Propulsion Laboratory(喷气推进实验室) California Institute of Technology(加州理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05933 2025-10-15 cs.AI 83%

MapAgent: A Hierarchical Agent for Geospatial Reasoning with Dynamic Map Tool Integration

Md Hasebul Hasan, Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md Rizwan Parvez

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

Comments 27 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26140 2025-10-01 cs.SD cs.AI 83%

OWL: Geometry-Aware Spatial Reasoning for Audio Large Language Models

Subrata Biswas, Mohammad Nur Hossain Khan, Bashima Islam

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) Worcester Polytechnic Institute(沃斯特理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20890 2025-09-29 cs.CV cs.CL 83%

$A^2R^2$: Advancing Img2LaTeX Conversion via Visual Reasoning with Attention-Guided Refinement

Zhecheng Li, Guoxian Song, Yiwei Wang, Zhen Xiong, Junsong Yuan, Yujun Cai

机构 * University of California, San Diego(加州大学圣地亚哥分校) ByteDance(字节跳动) University of California, Merced(加州大学默塞德分校) University of Southern California(南加州大学) University at Buffalo(布法罗大学) The University of Queensland(昆士兰大学)

专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05405 2025-08-08 cs.AI 83%

DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning

Xinrun Xu, Pi Bu, Ye Wang, Börje F. Karlsson, Ziming Wang, Tengtao Song, Qi Zhu, Jun Song, Zhiming Ding, Bo Zheng

机构 * 1 Taobao \& Tmall Group of Alibaba, 2 Institute of Software, Chinese Academy of Science, 3 University of Chinese Academy of Sciences, 4 Renmin University of China, 5 Informatics Department, PUC-Rio

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20529 2025-07-29 cs.CV cs.AI 83%

Enhancing Spatial Reasoning through Visual and Textual Thinking

Xun Liang, Xin Guo, Zhongming Jin, Weihang Pan, Penghui Shang, Deng Cai, Binbin Lin, Jieping Ye

专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏