arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-25 至 2026-08-25 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 16 篇

2608.23354 2026-08-25 cs.RO cs.CV 新提交 82%

OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation

OptiSight:弥合具身导航中的语义推理与几何控制

Alperen Avan, Jordi Sanchez-Riera

机构 * Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人学与工业信息研究所(西班牙国家研究委员会-加泰罗尼亚理工大学))

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本研究提出OptiSight混合框架,结合VLM推理与确定性视觉伺服,在8GB VRAM预算下,于AI Habitat中实现了多种室内场景下的可靠零样本具身导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22128 2026-08-25 cs.AI 新提交 79%

Task-Driven 3D Printability Assistance via Geometry- and Knowledge-Grounded LLM Reasoning

基于几何与知识基础的大语言模型推理的任务驱动型3D可打印性辅助

Zhaoda Du, Qiaojie Zheng, Xiaoli Zhang

机构 * Colorado School of Mines(科罗拉多矿业学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出一种基于几何与知识基础的LLM推理的任务驱动型3D可打印性辅助框架,可生成多维度结构化打印建议,经实验验证其可提升可打印性、任务适用性及材料选择准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21919 2026-08-25 cs.LG 新提交 79%

Beyond Fixed Directions: Adaptive Representation Analysis of Reasoning and Memorization in LLMs

超越固定方向:大语言模型中推理与记忆的自适应表示分析

Shaheen Nabi

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 该研究以Qwen3-0.6B为对象,通过实验验证了推理与记忆可通过单一方向分离,但经GRPO后该方向几何结构显著重组,不过任务组的AUROC仍保持1.00,挑战了固定方向稳定性的假设。

Comments Preprint. Code and experimental resources are available on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23518 2026-08-25 cs.CV 新提交 78%

Investigating Relational Reasoning in VLMs

研究视觉语言模型(VLMs)中的关系推理

Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究以Qwen3-VL-4B为对象,构建含几何形状的合成数据集,探究VLMs的关系推理能力,发现其结合了真正视觉推理与基于语言线索的捷径策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23074 2026-08-25 cs.CV 新提交 78%

Grounding Isn't Knowing: Do VLMs Need Object Localization for Spatial Reasoning?

grounding 不等于知晓:视觉语言模型是否需要对象定位来进行空间推理?

Xiwei Liu, Yulong Li, Xinlin Zhuang, Xuhui Li, Zhixiang Lu, Haolin Yang, Imran Razzak, Yutong Xie

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究以 LLaVA-1.5 和 Qwen2.5-VL 为对象,通过多种可解释性工具揭示 VLMs 空间推理的机制,发现其空间关系预测无需精确对象定位,定位与空间推理共享早期通路但依赖部分不同通路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22637 2026-08-25 cs.CV 新提交 78%

OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies

OmniCAD:面向机器人装配任务的3D空间推理大规模基准测试集

Mingjia Wang, Taiting Lu, Ziwei Dong, Sisong Bei, Jingying Zeng, Runze Liu, Kaiyuan Lin, Hongxing Pan, Kai Zhang, Yizheng Hou, Yangshoudu Zheng, Chenchen Guo, Weiyuan Meng, Shubin Lyu, Zhijun Zheng, Dexu Wang, Xinyu Bai, Shurui Qian, Zhangzixin, Mengyu Pan, Guoliang Shi, Ling Ma, Yifan Yang, Qi He, Yi-Chao Chen, Yincheng Jin, Sung-Liang Chen, Mahanth Gowda

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出OmniCAD——涵盖多类工业系统的3D空间推理大规模基准测试集,评估VLMs三类装配推理能力,发现当前VLMs在该任务中表现不佳,将开源相关资源推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21832 2026-08-25 cs.CL 新提交 74%

GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

GUI-Primitives:诊断视觉-语言GUI定位中的空间推理失败

Md Abrar Jahin, Md Rizwan Parvez

机构 * University of Southern California(南加州大学) USC Information Sciences Institute(南加州大学信息科学研究所) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 视觉空间推理 :reasoning(title);分类 cs.CL

AI总结 本文提出GUI-Primitives基准,通过994个含7种空间关系的对比指令对,发现多数视觉-语言GUI定位模型的失败源于候选定位而非关系理解,且标记候选可提升准确率。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21438 2026-08-25 cs.CV cs.MA 新提交 71%

DesignAgent3D: Interactive 3D Scene Editing via Designer-like Multimodal Reasoning

DesignAgent3D:通过类设计师多模态推理实现交互式3D场景编辑

Xiujin Liu, Tianyu Yang, Yilun Zhao, Xiangliang Zhang

机构 * University of Michigan(密歇根大学) University of Notre Dame(圣母大学) Yale University(耶鲁大学)

专题命中 视觉空间推理 :reasoning(title)

AI总结 DesignAgent3D是一种交互式多模态智能体框架,通过类设计师的规划-感知-行动范式解决文本引导3D场景编辑的缺陷,在NeRF和3D Gaussian Splatting上均优于现有方法,实现了更优的语义对齐、空间定位精度和多视图一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23104 2026-08-25 cs.CL cs.AI 新提交 62%

Molecular LLM Agents: From Architectural Design to Scientific Autonomy

分子大语言模型智能体:从架构设计到科学自主性

Jiatong Li, Wengyu Zhang, Weida Wang, Yuxuan Ren, Wei Liu, Chenyang Mao, Yuqiang Li, Yatao Bian, Changmeng Zheng, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Shanghai AI Lab(上海人工智能实验室) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出分子LLM智能体的概念框架,从架构设计和科学自主性阶梯两方面展开,为分子领域LLM智能体的比较、设计评估及部署提供指导。

Comments 25pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22757 2026-08-25 cs.CV cs.AI 新提交 57%

Object-Uni: A Unified Model for Object-Centric Spatial Understanding and Controllable Generation

Object-Uni:面向以物体为中心的空间理解与可控生成的统一模型

Mining Tan, Yinuo Wang, Ziqi Zhou, Weize Quan, Sifei Li, Jingdong Chen, DanDan Zheng, Libin Wang, Weiming Dong

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与 mobility学院) Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出Object-Uni统一模型,通过视角方向抽象与UniSpatial-80K基准,实现以物体为中心的空间理解与可控生成,提升位姿理解及可控生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08405 2026-08-25 cs.AI physics.flu-dyn 版本更新 57%

Self-Evolving Scientific Agent Discovers Generalizable Physically-Reasoned Fluid Control

自进化科学智能体发现可泛化的物理推理流体控制

Boai Sun, Wenjin Guo, Zongmin Yu, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种由大语言模型驱动的自进化科学智能体工作流,通过迭代代码生成和物理仿真诊断,自动构建可解释的控制器,并在欠驱动双关节狗鲨游泳器目标到达任务中实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21622 2026-08-25 cs.AI 版本更新 57%

TO-Agents: A Multi-Agent AI Framework for Subjective Preference-Guided Topology Optimization

TO-Agents:一种用于基于偏好的拓扑优化的多智能体AI流水线

Isabella A. Stewart, Hongrui Chen, Faez Ahmed

机构 * Department of Mechanical Engineering Massachusetts Institute of Technology Cambridge, MA, 02139 USA(机械工程系 马萨诸塞理工学院 哥伦布, 马萨诸塞州, 02139 美国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TO-Agents,一种多智能体AI框架,通过将自然语言设计意图与迭代拓扑优化相结合,解决设计者手动转换非直接关联的偏好到求解器设置的问题,并在两个长周期设计任务中验证了其有效性。

Comments Accepted for publication in the Proceedings of the ASME 2026 International Design Engineering Technical Conferences (IDETC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22093 2026-08-25 cs.RO 新提交 50%

EndoNav: Semantic-to-Geometric Grounding for Language-Guided Robotic Endoscopic Examination

EndoNav:面向语言引导的机器人内窥镜检查的语义到几何的 grounding(语义几何关联)

Jecia Z. Y. Mao, Hisashi Ishida, Kathryn Jung, Masaru Ishii, Russell H. Taylor, Manish Sahu

专题命中 视觉空间推理 :planning(abstract)

AI总结 研究人员提出 EndoNav 框架,可将外科医生高级命令转换为患者特异性鼻窦解剖内的自主内窥镜可视化行为,其可视化效果接近住院外科医生水平,验证了该方法的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21628 2026-08-25 cs.SE cs.RO 新提交 50%

ExploreAI: Agentic Exploration Knowledge Bases for Reproducible Observable-Regression Testing of Black-Box VR and 3D Applications

ExploreAI:用于黑盒VR与3D应用可复现可观测回归测试的智能探索知识库

Jiajie Wang, Kebin Peng, Wei Wang, Xiaoyin Wang, Sen He, Xue Qin

专题命中 视觉空间推理 :planning(abstract)

AI总结 ExploreAI是LLM驱动的智能体框架,通过构建探索知识库(EKB),实现黑盒VR与3D应用的可复现可观测回归测试,在多场景中验证了其有效性。

Comments 11 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21447 2026-08-25 cs.CV 新提交 50%

BIMScript: Material-Aware Structured Scene Programs for BIM Ingestion

BIMScript:用于BIM导入的材料感知结构化场景程序

Prakash Kondibhau Naikade, Thomas B. Moeslund, Andreas Møgelmose

机构 * Aalborg University(奥尔堡大学) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出BIMScript,通过扩展布局语言属性、优化解码方案、改进粒度处理,实现合成扫描数据到BIM工具的端到端自动导入,且支持大语言模型驱动的可持续性推理。

Comments Project Page: see this https URL (https://bimscriptworld.github.io/BIMScript/); to be published in ECCV 2026 TwinWorld Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-25 cs.CV cs.RO 版本更新 50%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏