arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3387 篇

2602.20501 2026-03-17 cs.CV 71%

Probing and Bridging Geometry-Interaction Cues for Affordance Reasoning in Vision Foundation Models

探索并弥合几何-交互线索以实现视觉基础模型中的可及性推理

Qing Zhang, Xuesong Li, Jing Zhang

专题命中 视觉空间推理 :reasoning(title)

AI总结 本文探讨了视觉基础模型中几何感知与交互感知对可及性推理的互补作用,通过融合DINO的几何原型与Flux的交互地图,实现了与弱监督方法相当的可及性估计。

Comments 11 pages, 12 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05591 2026-03-09 cs.CV 71%

Thinking with Spatial Code for Physical-World Video Reasoning

基于空间代码的物理世界视频推理

Jieneng Chen, Wenxin Ma, Ruisheng Yuan, Yunzhi Zhang, Jiajun Wu, Alan Yuille

专题命中 视觉空间推理 :reasoning(title)

AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。

Comments Code at https://github.com/Beckschen/spatialcode

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12753 2026-03-04 cs.RO 71%

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Models Reasoning

osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航

Fujing Xie, Sören Schwertfeger, Hermann Blum

机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) University of Bonn(波恩大学) Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)

专题命中 视觉空间推理 :reasoning(title)

AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。

Comments accepted at RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20940 2025-12-25 cs.RO 71%

ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments

连续环境中的视觉-语言导航(VLN-CE)需要一个具身体验的智能体在连续环境中导航至目标,遵循自然语言指令。虽然当前基于图的方法通过将环境抽象为拓扑地图并简化动作空间到路径选择,提供了一种高效、结构化的方法,但它们在利用大规模数据和先进训练范式方面落后于基于大视觉-语言模型(LVLMs)的方法。在本文中,我们通过引入ETP-R1框架,将数据扩展和强化微调(RFT)范式应用于基于图的VLN-CE模型,以弥合这一差距。

Shuhao Ye, Sitong Mao, Yuxiang Cui, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 视觉空间推理 :planning(title)

AI总结 ETP-R1通过数据扩展和强化微调范式,提升基于图的连续环境视觉-语言导航性能,实现新状态最先进的表现。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00916 2025-11-04 cs.CV 71%

Fleming-VL: Towards Universal Medical Visual Reasoning with Multimodal LLMs

Yan Shu, Chi Liu, Robin Chen, Derek Li, Bryan Dai

机构 * Ubiquant(乌比量化)

专题命中 视觉空间推理 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07078 2025-07-16 cs.CV cs.HC 71%

VLLMs Provide Better Context for Emotion Understanding Through Common Sense Reasoning

Alexandros Xenos, Niki Maria Foteinopoulou, Ioanna Ntinou, Ioannis Patras, Georgios Tzimiropoulos

机构 * Queen Mary University of London(伦敦女王学院)

专题命中 视觉空间推理 :reasoning(title)

Comments A. Xenos, N. Foteinopoulou and I. Ntinou contributed equally to this work; 14 pages, 5 figures; Accepted at IJCNN 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02565 2025-07-04 cs.CV 71%

Reconstructing Close Human Interaction with Appearance and Proxemics Reasoning

Buzhen Huang, Chen Li, Chongyang Xu, Dongyue Lu, Jinnan Chen, Yangang Wang, Gim Hee Lee

机构 * Southeast University(东南大学) National University of Singapore(新加坡国立大学) Sichuan University(四川大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) CFAR, Agency for Science, Technology and Research, Singapore(新加坡科技研究局)

专题命中 视觉空间推理 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00886 2025-07-02 cs.CV cs.RO 71%

GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond

Anna-Maria Halacheva, Jan-Nico Zaech, Xi Wang, Danda Pani Paudel, Luc Van Gool

机构 * ETH Zurich(苏黎世联邦理工学院) TU Munich(慕尼黑技术大学)

专题命中 视觉空间推理 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05303 2025-04-08 cs.CV 71%

InteractVLM: 3D Interaction Reasoning from 2D Foundational Models

Sai Kumar Dwivedi, Dimitrije Antić, Shashank Tripathi, Omid Taheri, Cordelia Schmid, Michael J. Black, Dimitrios Tzionas

专题命中 视觉空间推理 :reasoning(title)

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07939 2025-03-12 cs.CV 71%

STRMs: Spatial Temporal Reasoning Models for Vision-Based Localization Rivaling GPS Precision

Hin Wai Lui, Jeffrey L. Krichmar

专题命中 视觉空间推理 :reasoning(title)

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07062 2023-12-15 cs.CV 71%

ThinkBot: Embodied Instruction Following with Thought Chain Reasoning

Guanxing Lu, Ziwei Wang, Changliu Liu, Jiwen Lu, Yansong Tang

专题命中 视觉空间推理 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09121 2026-08-11 cs.AI 新提交 70%

MELLON - Multimodal Enhanced LLM for Online Navigation

MELLON——面向在线导航的多模态增强型大语言模型

Ruiyu Li, Haoyang Cai, Zhitong Guo, Tong Hu

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15875 2026-07-22 cs.RO cs.AI 版本更新 70%

Fly0: Persistent Metric Anchoring for Zero-Shot Aerial Vision-Language Navigation

Fly0: 解耦语义定位与几何规划以实现零样本空中导航

Zhenxing Xu, Yihong Lu, Weidong Bao, Zhengqiu Zhu, Jingxuan Zhou, Zhichuang Wang, Ji Wang, Lihua Liu, Wei He

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) Information Support Force Engineering University(信息支援力量工程大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10383 2026-07-20 cs.CV cs.AI cs.RO 版本更新 70%

ABot-N1: Toward a General Visual Language Navigation Foundation Model

ABot-N1:迈向通用视觉语言导航基础模型

Ruiyan Gong, Yingnan Guo, Junjun Hu, Jintao Kong, Xiaoxu Leng, Tianlun Li, Weize Li, Fei Liu, Zhicheng Liu, Jia Lu, Minghua Luo, Chenlin Ming, Yanfen Shen, Jiyue Tao, Zhengbo Wang, Mingyang Yin, Minqi Gu, Zihao Guan, Wei Guo, Guoqing Liu, Huachong Pang, Menglin Yang, Zeqian Ye, Xiaoxiao Geng, Zhining Gu, Honglin Han, Di Jing, Hongyu Pan, Mingchao Sun, Kuan Yang, Jianfang Zhang, Yanghong Chen, Ye He, Wei Mei, Jiahao Shi, Xiangpo Yang, Yanqing Zhu, Yang Cai, Jingjing Ma, Shihui Su, Zixiao Tang, Linbo Zheng, Zedong Chu, Xiaolong Wu, Wenbin Tang, Mu Xu

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究旨在构建通用视觉语言导航基础模型,针对当前方法问题,提出ABot-N1,通过慢-快架构解耦认知与控制,利用双视觉语言信号,实现跨场景稳健、可推广且可解释的导航,在城市规模导航等任务中表现出色并开源新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 70%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05573 2026-07-08 cs.AI cs.CE 新提交 70%

Foundation Models for Automatic CAD Generation

用于自动CAD生成的基础模型

J de Curtò, Victoria Guillén, I. de Zarzà

机构 * BARCELONA Supercomputing Center(巴塞罗那超级计算中心) Universidad Pontificia Comillas(庞培法布拉大学) Chung-Ang University(中央大学) LUXEMBOURG Institute of Science and Technology(卢森堡科学技术研究所)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究利用统一评估管道和基准,对用于机械零件自动CAD生成的基础模型展开实证。介绍LLMForge框架,通过两种批判机制评估七个基础模型,展示了紧凑模型的效果,以及VLM批判的作用,还探讨了相关设计及影响。

Comments Accepted as a book chapter in "Advances in Global Applied Artificial Intelligence" (G. A. Tsihrintzis, M. Virvou, N. G. Bourbakis, L. C. Jain, Eds.), authenticated version will be published in Springer series: Learning and Analytics in Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 70%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31919 2026-07-01 cs.RO cs.AI cs.CV 新提交 70%

MVP-Nav: Multi-layer Value Map Planner Navigator

MVP-Nav: 多层价值地图规划导航器

Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang, Bayram Bayramli, Qiuchang Li, Xunchu Zhou, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对零样本目标导航中缺乏深度信息导致的物理不确定性,提出MVP-Nav框架,通过3D基础模型重建物理占用并构建多层价值地图,实现语义与物理约束的统一规划,达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21623 2026-06-23 cs.CV cs.AI 新提交 70%

A DVDrive Approach for doScenes Instructed Driving Challenge

一种面向 doScenes 指令驾驶挑战的 DVDrive 方法

Zijian Fu, Xiangyang Chu, Mengshi Qi, Huadong Ma, Guanghao Zhang, Wei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Xiaomi EV(小米汽车)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出基于 OmniDrive 的指令条件轨迹预测方法,引入 DVPE 分视角感知模块减少跨视角干扰,提升多视角视觉定位与语言指令对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20448 2026-06-19 cs.CV cs.LG 版本更新 70%

Do Vision-Language Models Understand 3D Scenes or Just Catalogue Objects?

视觉-语言模型是理解3D场景还是仅仅 catalogue 物体?

Animesh Maheshwari, Divyansh Sahu, Nishit Verma

机构 * Deccan AI(德克南人工智能)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文通过一个包含3034个样本的人工整理基准,探讨了视觉-语言模型对空间理解的深度有序遮挡、光学几何推断和体积重新安排规划能力,发现模型在重新安排可见布局时表现优异,但在遮挡和反射推断上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06836 2026-06-08 cs.RO cs.AI cs.CV 新提交 70%

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

像飞行员一样思考:细粒度长时程无人机导航

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

机构 * Colab Beihang University(北航) Meituan(美团) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11014 2026-06-08 cs.RO cs.AI cs.CV 版本更新 70%

MatterDoor: Sampling Zero-shot Spatio-semantic Priors using Generative Models

MatterDoor: 使用生成模型采样零样本空间语义先验

Subhransu S. Bhattacharjee, Hao Lu, Dylan Campbell, Rahul Shome

机构 * School of Computing, Australian National University(澳大利亚国立大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 针对机器人通过门缝观察时场景结构缺失的问题,提出MatterDoor方法,利用预训练生成模型(VLM引导外推、单目深度估计、语义分割)采样隐藏房间的语义3D点云先验,在Matterport3D基准上验证了零样本空间语义先验的有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17364 2026-05-19 cs.CL cs.IR 70%

NewsLens: A Multi-Agent Framework for Adversarial News Bias Navigation

NewsLens: 一个用于对抗性新闻偏见导航的多智能体框架

Joy Bose

机构 * Independent Researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出NewsLens多智能体框架,通过五个智能体协作解构新闻文章,揭示意识形态缺失、修辞操纵和框架边界,利用Qwen2.5-3B-Instruct和Mistral 7B模型进行评估,展示了系统在不同政治事件簇中的表现。

Comments 17 pages, 2 figures, 7 tables, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08501 2026-05-19 cs.AI 70%

GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games

GVGAI-LLM:通过无限游戏评估大语言模型代理

Yuchen Li, Cong Lin, Muhammad Umair Nasir, Philip Bontrager, Jialin Liu, Julian Togelius

机构 * New York University(纽约大学) University of the Witwatersrand(沃尔特·斯通大学) Meta Lingnan University(岭南大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 GVGAI-LLM通过 arcade 式游戏测试大语言模型的推理与问题解决能力,定义了可解释的评估指标,揭示了模型在空间推理和基本规划中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13167 2026-05-14 cs.CL 70%

GeoBuildBench: A Benchmark for Interactive and Executable Geometry Construction from Natural Language

GeoBuildBench:一个用于从自然语言构建可执行几何构造的基准

Jinwoong Kim, Rui Yang, Huishuai Zhang

机构 * Peking University(北京大学) Wangxuan Institute of Computer Technology(王璇计算机技术研究院)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 GeoBuildBench评估大语言模型能否将自然语言几何问题转化为可执行构造,包含489道中文教材问题,验证了多模态模型在交互构造任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13559 2026-05-01 cs.AI 70%

OpAgent: Operator Agent for Web Navigation

OpAgent:网页导航的运算代理

Yuyu Guo, Wenjie Yang, Siyuan Yang, Ziyang Liu, Cheng Chen, Yuan Wei, Yun Hu, Yang Huang, Guoliang Hao, Dongsheng Yuan, Jianming Wang, Xin Chen, Hang Yu, Lei Lei, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出OpAgent,通过在线强化学习优化网页导航策略,结合层级多任务微调和混合奖励机制,实现71.6%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22805 2026-04-28 cs.CV cs.AI cs.SY eess.SY 70%

See No Evil: Semantic Context-Aware Privacy Risk Detection for AR

见不得恶:面向AR的语义上下文感知隐私风险检测

Jialu Liu, Yao Li, Zhuoheng Li, Huining Li, Ying Chen

机构 * Pennsylvania State University(宾夕法尼亚州立大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出PrivAR框架,利用视觉语言模型进行AR环境中的语义隐私风险检测,通过上下文推理识别敏感信息并降低隐私泄露风险,实验表明其在准确率和F1分数上优于基线方法。

Comments Proc. IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18364 2026-04-21 cs.AI cs.GR cs.MA 70%

Training and Agentic Inference Strategies for LLM-based Manim Animation Generation

基于LLM的Manim动画生成的训练与代理推理策略

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, United Kingdom(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 视觉空间推理 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出ManimTrainer和ManimAgent,结合监督微调与强化学习,提升文本到代码到视频的转换性能,通过ManimBench评估17种模型,结果显示GRPO和RITL-DOC策略显著提升动画生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07957 2026-04-10 cs.AI cs.CV cs.RO 70%

WorldMAP: Bootstrapping Vision-Language Navigation Trajectory Prediction with Generative World Models

WorldMAP: 通过生成世界模型提升视觉-语言导航轨迹预测

Hongjin Chen, Shangyun Jiang, Tonghua Su, Chen Gao, Xinlei Chen, Yong Li, Zhibo Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) Shandong University(山东大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 WorldMAP通过生成世界模型与教师-学生框架,将生成的未来场景转化为语义空间结构和规划监督,提升导航轨迹预测的稳定性与准确性,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04299 2026-04-07 cs.CV cs.AI 70%

A Persistent Homology Design Space for 3D Point Cloud Deep Learning

3D点云深度学习中的持久同调设计空间

Prachi Kudeshia, Jiju Poovvancheri, Amr Ghoneim, Dong Chen

机构 * Saint Mary's University, Halifax, Canada(圣玛丽大学(哈利法克斯,加拿大)) Nanjing Forestry University, China(南京林业大学)

专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出一个统一的设计空间,将持久同调用于3D点云学习,通过六个注入点将拓扑学作为结构诱导偏差,提升分类和分割的准确性与鲁棒性。

Comments 27 pages, 12 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏