arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2607.19288 2026-07-22 cs.CV cs.RO 新提交 75%

No Training, Better Flights: Test-Time Scaled VLMs for UAV Navigation

无需训练,飞行更佳:用于无人机导航的测试时缩放视觉语言模型

Feinan Cheng, Dongliang Xu, Wenli Nong, Zhiheng Zhang, Ang Liu, Tianyu Wang, Yue Yao

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);self-correction(abstract)

AI总结 研究如何将测试时缩放应用于无人机视觉语言导航,通过迭代细化和多标准评分函数,无需额外训练,使冻结模型自我校正,生成更准确可靠飞行计划,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07864 2026-06-01 cs.CV 75%

Thinking in Structures: Evaluating Spatial Intelligence in Constraint-Governed Spaces

在结构中思考:评估约束空间中的空间智能

Chen Yang, Guanxin Lin, Youquan He, Peiyao Chen, Guanghe Liu, Yufan Mo, Zhouyuan Xu, Linhao Wang, Guohui Zhang, Zihang Zhang, Shenxiang Zeng, Chen Wang, Jiansheng Fan

机构 * Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 提出SSI-Bench基准,通过结构约束下的空间推理任务评估视觉语言模型的空间智能,发现模型与人类存在巨大差距。

Comments ICML 2026, Project Page: https://ssi-bench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19704 2026-05-20 cs.CE 75%

RefiningGPT: Specialized language Models for Automated Refinery Unit-level Process Diagram Synthesis

RefiningGPT:用于自动化炼油厂单元级过程图综合的专用语言模型

Dongxiao Liu, Yuwen Ding, Xinghai Wei, Jiacheng Ji, Lei Li, Linghui Li, Xiaoyong Li

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出RefineGPT,一种专为炼油厂设计的自主设计代理,通过层次化架构和生成高质量训练数据的方法,提升单元级过程图综合的拓扑一致性和化学工程可行性。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14845 2026-05-15 cs.CV 75%

Exploring Vision-Language Models for Online Signature Verification: A Zero-Shot Capability Study

探索用于在线签名验证的视觉-语言模型:零样本能力研究

Marta Robledo-Moreno, Ruben Vera-Rodriguez, Ruben Tolosana, Javier Ortega-Garcia

机构 * BiometricsAI, School of Engineering, Universidad Autonoma de Madrid, Spain(生物识别AI,工程学院,马德里自治大学,西班牙)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文研究了最新视觉-语言模型在在线签名验证任务中的零样本性能,发现信号质量和伪造类型对性能有显著影响,尤其在高难度伪造场景中,基于链式推理的模型表现下降。

Comments Accepted at the 14th International Workshop on Biometrics and Forensics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07989 2026-03-10 cs.CV 75%

AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

AutoTraces:通过多模态大语言模型实现自回归轨迹预测

Teng Wang, Yanting Lu, Ruize Wang

机构 * Southeast University(东南大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15813 2026-02-18 cs.RO 75%

FAST-EQA: Efficient Embodied Question Answering with Global and Local Region Relevancy

FAST-EQA: 有效体感问答与全局和局部区域相关性

Haochen Zhang, Nirav Savaliya, Faizan Siddiqui, Enna Sachdeva

机构 * Carnegie Mellon University(卡内基梅隆大学) Honda Research Institute USA(本田研究院美国)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 FAST-EQA通过结合全局和局部区域相关性,实现高效体感问答,提升回答可靠性并加快推理速度。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14974 2026-02-17 cs.RO 75%

DM0: An Embodied-Native Vision-Language-Action Model towards Physical AI

DM0:一种面向物理AI的具身原生视觉-语言-动作模型

En Yu, Haoran Lv, Jianjian Sun, Kangheng Lin, Ruitao Zhang, Yukang Shi, Yuyang Chen, Ze Chen, Ziheng Zhang, Fan Jia, Kaixin Liu, Meng Zhang, Ruitao Hao, Saike Huang, Songhan Xie, Yu Liu, Zhao Wu, Bin Xie, Pengwei Zhang, Qi Yang, Xianchi Deng, Yunfei Wei, Enwen Zhang, Hongyang Peng, Jie Zhao, Kai Liu, Wei Sun, Yajun Wei, Yi Yang, Yunqiao Zhang, Ziwei Yan, Haitao Yang, Hao Liu, Haoqiang Fan, Haowei Zhang, Junwen Huang, Yang Chen, Yunchao Ma, Yunhuan Yang, Zhengyuan Du, Ziming Liu, Jiahui Niu, Yucheng Zhao, Daxin Jiang, Wenbin Tang, Xiangyu Zhang, Zheng Ge, Erjin Zhou, Tiancai Wang

机构 * DM0 Team(DM0团队) Dexmal StepFun

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 DM0提出了一种面向物理AI的具身原生视觉-语言-动作模型,通过统一具身操作和导航,结合预训练、中训练和后训练流程,实现对复杂物理任务的高效处理。

Comments Authors are listed in alphabetical order. Code is available at https://github.com/Dexmal/dexbotic

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14602 2026-01-22 cs.CV 75%

3D Space as a Scratchpad for Editable Text-to-Image Generation

3D空间作为可编辑的文本到图像生成的草稿纸

Oindrila Saha, Vojtech Krs, Radomir Mech, Subhransu Maji, Matheus Gadelha, Kevin Blackburn-Matzen

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Adobe Research(Adobe研究)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 本文提出一种基于3D空间推理的文本到图像生成方法,通过可编辑的3D网格实现空间一致性,提升图像生成的精度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24851 2026-01-07 cs.CV cs.RO 75%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08511 2025-12-12 cs.CV 75%

Thinking with Images via Self-Calling Agent

通过自我调用代理进行图像思考

Wenxi Yang, Yuzhong Zhao, Fang Wan, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出sCoT范式,通过自我调用代理实现无需多模态交错的高效视觉推理,实验显示其在HR-Bench 4K上性能提升达1.9%且训练效率提高75%。

Comments Code is available at https://github.com/YWenxi/think-with-images-through-self-calling

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19221 2025-12-01 cs.CV cs.RO 75%

Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

Percept-WAM:感知增强的环境感知-行动模型用于鲁棒的端到端自动驾驶

Jianhua Han, Meng Tian, Jiangtong Zhu, Fan He, Huixin Zhang, Sitong Guo, Dechang Zhu, Hao Tang, Pei Xu, Yuze Guo, Minzhe Niu, Haojie Zhu, Qichao Dong, Xuechao Yan, Siyuan Dong, Lu Hou, Qingqiu Huang, Xiaosong Jia, Hang Xu

机构 * Yinwang Intelligent Technology Co. Ltd.(亿网通智能科技有限公司) Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)

AI总结 Percept-WAM通过整合2D/3D场景理解能力,提升自动驾驶的感知与行动决策,实现端到端鲁棒性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12099 2025-12-01 cs.CV 75%

TinyRS-R1: Compact Multimodal Language Model for Remote Sensing

TinyRS-R1:用于遥感的紧凑多模态语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中欧技术大学(METU)电子与电气工程系)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 TinyRS-R1是一种专为遥感设计的紧凑多模态语言模型,通过四阶段训练实现高效性能,兼具推理增强与低资源消耗。

Comments Accepted to IEEE Geoscience and Remote Sensing Letters (GRSL). Code, models, and the captions for datasets are available at https://github.com/aybora/TinyRS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07251 2025-11-18 cs.CV 75%

Understanding Dynamic Scenes in Ego Centric 4D Point Clouds

Junsheng Huang, Shengyu Hao, Bocheng Hu, Hongwei Wang, Gaoang Wang

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments Accepted as a poster to AAAI 2026; will be published in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11433 2025-08-27 cs.CV 75%

MM-R1: Unleashing the Power of Unified Multimodal Large Language Models for Personalized Image Generation

Qian Liang, Yujia Wu, Kuncheng Li, Jiwei Wei, Shiyuan He, Jinyu Guo, Ning Xie

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11702 2025-06-23 cs.AI cs.CL cs.LG 75%

LLM-Guided Indoor Navigation with Multimodal Map Understanding

Alberto Coffrini, Paolo Barsocchi, Francesco Furfari, Antonino Crivello, Alessio Ferrari

机构 * Institute of Information Science and Technologies (ISTI)(信息科学与技术研究所) National Research Council of Italy (CNR)(意大利国家研究理事会) Department of Computer Science(计算机科学系) University of Pisa(比萨大学) University College Dublin (UCD)(都柏林大学学院) School of Computer Science(计算机科学学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 7 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00123 2025-06-03 cs.CV cs.RO 75%

Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces

Gen Luo, Ganlin Yang, Ziyang Gong, Guanzhou Chen, Haonan Duan, Erfei Cui, Ronglei Tong, Zhi Hou, Tianyi Zhang, Zhe Chen, Shenglong Ye, Lewei Lu, Jingbo Wang, Wenhai Wang, Jifeng Dai, Yu Qiao, Rongrong Ji, Xizhou Zhu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Xiamen University(厦门大学) SenseTime Research(商汤科技研究院) Zhejiang University(浙江大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14607 2025-03-20 cs.CV 75%

Can Large Vision Language Models Read Maps Like a Human?

Shuo Xing, Zezhou Sun, Shuangyu Xie, Kaiyuan Chen, Yanjia Huang, Yuping Wang, Jiachen Li, Dezhen Song, Zhengzhong Tu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18794 2025-02-12 cs.RO cs.CV 75%

Open-Nav: Exploring Zero-Shot Vision-and-Language Navigation in Continuous Environment with Open-Source LLMs

Yanyuan Qiao, Wenqi Lyu, Hui Wang, Zixu Wang, Zerui Li, Yuan Zhang, Mingkui Tan, Qi Wu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

Comments Accepted by ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18361 2024-05-29 cs.CV 75%

Is a 3D-Tokenized LLM the Key to Reliable Autonomous Driving?

Yifan Bai, Dongming Wu, Yingfei Liu, Fan Jia, Weixin Mao, Ziheng Zhang, Yucheng Zhao, Jianbing Shen, Xing Wei, Tiancai Wang, Xiangyu Zhang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);logical reasoning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12871 2024-05-10 cs.CV cs.AI cs.CL cs.LG 75%

An Embodied Generalist Agent in 3D World

Jiangyong Huang, Silong Yong, Xiaojian Ma, Xiongkun Linghu, Puhao Li, Yan Wang, Qing Li, Song-Chun Zhu, Baoxiong Jia, Siyuan Huang

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2024. The first four authors contribute equally. Project page: https://embodied-generalist.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03685 2024-05-07 cs.CV cs.AI cs.CL cs.LG 75%

Language-Image Models with 3D Understanding

Jang Hyun Cho, Boris Ivanovic, Yulong Cao, Edward Schmerling, Yue Wang, Xinshuo Weng, Boyi Li, Yurong You, Philipp Krähenbühl, Yan Wang, Marco Pavone

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project page: https://janghyuncho.github.io/Cube-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05973 2023-11-03 cs.RO cs.AI cs.CL cs.CV cs.LG 75%

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models

Wenlong Huang, Chen Wang, Ruohan Zhang, Yunzhu Li, Jiajun Wu, Li Fei-Fei

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.03768 2021-03-16 cs.CL cs.AI cs.CV cs.LG cs.RO 75%

ALFWorld: Aligning Text and Embodied Environments for Interactive Learning

Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Côté, Yonatan Bisk, Adam Trischler, Matthew Hausknecht

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2021; Data, code, and videos are available at alfworld.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21832 2026-08-25 cs.CL 新提交 74%

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

Md Abrar Jahin, Md Rizwan Parvez

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(title);分类 cs.CL

AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08021 2026-08-11 cs.CV cs.AI 新提交 74%

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Evidence-RL:面向证据密集型视觉推理

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27069 2026-07-31 cs.CV cs.AI 版本更新 74%

Visual Credit Audit for Multimodal Spatial Reasoning

多模态空间推理的视觉信用审计

Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 该研究提出视觉信用审计(VCA)方法,分解多模态空间推理基准的成功维度,发现部分模型决策正确但未获图像额外信用,验证了其在评估模型视觉关系响应上的有效性。

Comments 20 pages, 2 figures. Code: https://github.com/SouthWinter/VCA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01914 2026-06-02 cs.CL cs.CV 74%

Mechanistic Diagnostics of Spatial Lexical Bias in Multimodal Large Language Model Spatial Reasoning

多模态大语言模型空间推理中空间词汇偏差的机制诊断

Chuang Ma, Qianying Liu, Tomoyuki Obuchi, Fei Cheng, Wang Yang, Sudong Cai, Shuyuan Zheng, Akiko Aizawa, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII LLMC(日本国立信息与通信技术研究所语言模型中心) RIKEN AIP(日本理化学研究所先进理工研究所) Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学) The University of Osaka(大阪大学) University of Tokyo(东京大学)

专题命中 视觉空间推理 :reasoning(title);分类 cs.CL

AI总结 本文发现多模态大语言模型存在空间词汇偏差,即添加空间关系词会吸引模型选择该选项,并通过机制可解释性工具揭示偏差主要源于语言侧而非视觉侧,最后提出轻量级LLM-only DPO更新可有效缓解偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29165 2026-04-01 cs.CV cs.AI cs.RO 74%

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI 74%

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15388 2025-12-18 cs.AI 74%

Bilateral Spatial Reasoning about Street Networks: Graph-based RAG with Qualitative Spatial Representations

双重视觉推理关于街道网络:基于图的RAG与定性空间表示

Reinhard Moratz, Niklas Daute, James Ondieki, Markus Kattenbeck, Mario Krajina, Ioannis Giannopoulos

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 本文提出一种基于图的RAG方法,利用定性空间表示提升LLM在行人导航中的路线指引能力。

详情

展开后加载摘要…

URL PDF HTML 收藏