arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3368 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3368 篇

2506.11595 2025-06-16 cs.CV cs.LG 83%

EasyARC: Evaluating Vision Language Models on True Visual Reasoning

Mert Unsal, Aylin Akkus

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract);分类 cs.LG

Comments CVPR2025 Workshop on Test-time Scaling for Computer Vision

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08462 2025-06-11 cs.AI cs.HC cs.RO cs.SY eess.SY 83%

Hybrid Reasoning for Perception, Explanation, and Autonomous Action in Manufacturing

Christos Margadji, Sebastian W. Pattinson

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07235 2025-06-10 cs.CV cs.CL 83%

Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification

Tianyi Bai, Zengjie Hu, Fupeng Sun, Jiantao Qiu, Yizhen Jiang, Guangxin He, Bohan Zeng, Conghui He, Binhang Yuan, Wentao Zhang

机构 * HKUST(香港科技大学) Peking University(北京大学) Shanghai AI Lab(上海人工智能实验室) Imperial College London(伦敦帝国理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00316 2025-06-09 cs.CL 83%

MapEval: A Map-Based Evaluation of Geo-Spatial Reasoning in Foundation Models

Mahir Labib Dihan, Md Tanvir Hassan, Md Tanvir Parvez, Md Hasebul Hasan, Md Almash Alam, Muhammad Aamir Cheema, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering Bangladesh University of Engineering and Technology (BUET)(计算机科学与工程系,孟加拉国工程与技术大学) Statistics, Islamic University, Bangladesh(统计学,伊斯兰大学,孟加拉国) Faculty of Information Technology, Monash University, Melbourne, Australia(信息科技学院,墨尔本大学,澳大利亚) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

Comments ICML 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03424 2025-06-05 cs.CL cs.IR 83%

DistRAG: Towards Distance-Based Spatial Reasoning in LLMs

Nicole R Schneider, Nandini Ramachandran, Kent O'Sullivan, Hanan Samet

机构 * University of Maryland College Park(马里兰大学学院市) University of Sydney(悉尼大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00883 2025-04-16 cs.CV cs.AI 83%

Improved Visual-Spatial Reasoning via R1-Zero-Like Training

Zhenyi Liao, Qingsong Xie, Yanhao Zhang, Zijian Kong, Haonan Lu, Zhenyu Yang, Zhijie Deng

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08306 2025-04-16 cs.RO cs.CV cs.LG 83%

Reasoning in visual navigation of end-to-end trained agents: a dynamical systems approach

Steeven Janny, Hervé Poirier, Leonid Antsfeld, Guillaume Bono, Gianluca Monaci, Boris Chidlovskii, Francesco Giuliari, Alessio Del Bue, Christian Wolf

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG

Journal ref Computer Vision and Pattern Recognition Conference (CVPR) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13185 2025-03-18 cs.CV cs.AI 83%

3DAxisPrompt: Promoting the 3D Grounding and Reasoning in GPT-4o

Dingning Liu, Cheng Wang, Peng Gao, Renrui Zhang, Xinzhu Ma, Yuan Meng, Zhihui Wang

专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03787 2025-02-07 cs.LG 83%

Iterate to Accelerate: A Unified Framework for Iterative Reasoning and Feedback Convergence

Jacob Fein-Ashley

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11401 2024-03-26 cs.CV cs.AI 83%

Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning

Rao Fu, Jingyu Liu, Xilun Chen, Yixin Nie, Wenhan Xiong

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11865 2024-02-02 cs.RO cs.CL 83%

CARTIER: Cartographic lAnguage Reasoning Targeted at Instruction Execution for Robots

Dmitriy Rivkin, Nikhil Kakodkar, Francois Hogan, Bobak H. Baghi, Gregory Dudek

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14666 2021-11-30 cs.AI cs.RO 83%

An in-depth experimental study of sensor usage and visual reasoning of robots navigating in real environments

Assem Sadek, Guillaume Bono, Boris Chidlovskii, Christian Wolf

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.08424 2016-10-27 cs.RO cs.LG 83%

Counterfactual Reasoning about Intent for Interactive Navigation in Dynamic Environments

A. Bordallo, F. Previtali, N. Nardelli, S. Ramamoorthy

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG

Journal ref 2015 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2015), pp. 2943-2950

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09782 2026-03-05 cs.AI cs.CL cs.LG cs.LO 83%

The Geometry of Reasoning: Flowing Logics in Representation Space

推理的几何学:表示空间中的流动逻辑

Yufa Zhou, Yixiao Wang, Xunjian Yin, Shuyan Zhou, Anru R. Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过几何框架分析LLM推理过程,揭示其在表示空间中的流动特性,并验证逻辑结构与语义的关系。

Comments ICLR 2026. Code: https://github.com/MasterZhou1/Reasoning-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04781 2025-04-08 cs.CV 83%

OCC-MLLM-CoT-Alpha: Towards Multi-stage Occlusion Recognition Based on Large Language Models via 3D-Aware Supervision and Chain-of-Thoughts Guidance

Chaoyi Wang, Baoqing Li, Xinhan Di

专题命中 视觉空间推理 :CoT(title,abstract);reasoning(abstract,comments)

Comments This work has been accepted to the Multimodal Algorithmic Reasoning (MAR) Workshop at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04091 2023-06-23 cs.AI cs.CL cs.LG 83%

Abstract Visual Reasoning Enabled by Language

Giacomo Camposampiero, Loic Houmard, Benjamin Estermann, Joël Mathys, Roger Wattenhofer

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments The first two authors have contributed equally to this work. Accepted as regular paper at CVPR 2023 Workshop and Challenges for New Frontiers in Visual Language Reasoning: Compositionality, Prompts and Causality (NFVLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
1707.03938 2017-11-15 cs.CL cs.AI cs.LG 83%

Representation Learning for Grounded Spatial Reasoning

Michael Janner, Karthik Narasimhan, Regina Barzilay

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to TACL 2017, code: https://github.com/jannerm/spatial-reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15879 2026-05-12 cs.CV cs.AI cs.CL 82%

GRIT: Teaching MLLMs to Think with Images

GRIT: 教授大语言模型通过图像思考

Yue Fan, Xuehai He, Diji Yang, Kaizhi Zheng, Ching-Chen Kuo, Yuting Zheng, Sravana Jyothi Narayanaraju, Xinze Guan, Xin Eric Wang

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) UC Santa Barbara(加州大学圣芭芭拉分校) eBay

专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 GRIT提出一种基于图像和文本的 grounded reasoning 方法,通过强化学习实现高效训练,使大语言模型生成视觉基础的推理链。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08990 2026-08-17 cs.CV 版本更新 82%

ActFER: Agentic Facial Expression Recognition via Active Tool-Augmented Visual Reasoning

ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别

Shifeng Liu, Zhengye Zhang, Sirui Zhao, Xinglong Mao, Zhehan Kan, Zhixiang Wei, Shiwei Wu, Chaoyou Fu, Tong Xu, Enhong Chen

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12835 2026-08-14 cs.RO 新提交 82%

AirForesight: Current-to-Future Spatial Map Imagination with Cross-Space Planning Consistency for UAV-VLN

AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象

Yutong Liu, Xiaojie Li, Mingzhu Xu, Jianlong Wu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shandong University(山东大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)

AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03763 2026-08-05 cs.CV 新提交 82%

TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding

TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架

Qingxi Du, Junbo Wang, Yuke Li, Yining Zhu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%

Comments 10 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00540 2026-08-04 cs.CV 新提交 82%

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。

Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交 82%

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15670 2026-07-27 cs.CV 版本更新 82%

PixDLM: A Dual-Path Multimodal Language Model for UAV Reasoning Segmentation

PixDLM:一种用于无人机推理分割的双路径多模态语言模型

Shuyan Ke, Yifan Mei, Changli Wu, Yonghan Zheng, Jiayi Ji, Liujuan Cao, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。

Comments Accepted to CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19790 2026-07-23 cs.CV 新提交 82%

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

Trace:一种用于多领域视觉推理的分类法引导环境

Md Tanvirul Alam

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 针对视觉语言模型缺乏合适训练数据的问题,提出Trace分类法引导环境,将任务构建分解,通过共享语义状态确定相关元素,在该环境上的RLVR提升了模型在外部基准测试中的表现,证明训练可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15278 2026-07-17 cs.CV 新提交 82%

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02448 2026-07-08 cs.MA 新提交 82%

AgentsCAD: Automated Design for Manufacturing of FDM Parts via Multi-Agent LLM Reasoning and Geometric Feature Recognition

AgentsCAD: 通过多智能体大语言模型推理和几何特征识别实现FDM零件的自动化制造设计

Emmanuel George, Christopher Keefe, Peter Pak, Amir Barati Farimani

专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)

AI总结 提出AgentsCAD多智能体系统,结合B-Rep几何解析与LLM推理,自动检测FDM零件悬垂缺陷并生成修改建议,输出修正STEP文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17384 2026-07-07 cs.RO cs.CV 版本更新 82%

IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation

IndustryNav:探索动态工业导航中具身智能体的空间推理

Yifan Li, Lichi Li, Anh Dao, Xinyu Zhou, Wenjun Huang, Tianyi Ma, Yicheng Qiao, Zheda Mai, Daeun Lee, Zichen Chen, Pan Wang, Lehan Yang, Tianlong Wang, Zhen Tan, Sheng Li, Mohit Bansal, Yang Ni, Yu Kong

机构 * Michigan State University(密歇根州立大学) Independent Researcher(独立研究者) University of California, Irvine(加州大学尔湾分校) Ohio State University(俄亥俄州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) University of Pittsburgh(匹兹堡大学) University of Virginia(弗吉尼亚大学) Arizona State University(亚利桑那州立大学) Purdue University Northwest(普渡大学西北分校)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 针对视觉大语言模型在空间推理的挑战,提出IndustryNav基准,利用动态工业场景评估,给出零样本导航管道及安全指标,研究发现模型在路径规划等方面有缺陷,凸显向主动探索等任务发展的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 82%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28760 2026-06-30 cs.RO 82%

Vision-Language Models for Deployable Social Robot Navigation: Bridging Semantic Reasoning and Low-Level Control

面向可部署社交机器人导航的视觉-语言模型:弥合语义推理与低级控制

Runji Cai, Toshihiko Yamasaki, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文综述了将视觉-语言模型(VLM)集成到社交机器人导航中的方法,提出包含高层推理、低层控制及中间机制的统一框架,并讨论了关键挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏