arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3380 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3380 篇

2607.11173 2026-07-14 cs.CV 新提交 78%

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Center of AI Research, VinUniversity(文大人工智能研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新 78%

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 78%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新 78%

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新 78%

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20644 2026-07-10 cs.CV 版本更新 78%

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06165 2026-07-08 cs.RO 新提交 78%

EAGOR: Embodied Reasoning in Omni-direction

EAGOR:全方位的具身推理

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。

Comments 12 Pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03614 2026-07-07 cs.CV 新提交 78%

IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning

IDEAL-Bench:用于分析3D布局推理的室内数据集和评估套件

Yuening Cai, Junwei Zhou, Youran Qu, Yu-Wing Tai

机构 * Department of Computer Science Dartmouth College(达特茅斯学院计算机科学系)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 介绍IDEAL-Bench评估套件,让视觉语言模型预测室内场景结构化3D布局,基于IDEAL-Scenes数据集,评估15个模型发现任务待解、模型存在不对称性及排名差异,为下一代模型空间智能评估铺路。

Comments 36 pages. Project page: https://ideal3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27318 2026-07-07 cs.CV 版本更新 78%

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Q-GeoMem:面向视频空间推理的问题引导几何记忆

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) TeleAI

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13742 2026-07-07 cs.HC 版本更新 78%

Spatial Balancing: Designing an LLM-Powered Spatial Externalization Interface for Iterative Science Communication Writing

空间平衡:利用空间推理在LLM辅助科学传播写作中平衡科学阐述与叙述吸引力

Kexue Fu, Jiaye Leng, Yawen Zhang, Jingfei Huang, Yihang Zuo, Runze Cai, Zijian Ding, Ray LC, Shengdong Zhao, Qinyuan Lei

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出SpatialBalancing系统,通过结合人类空间推理与大语言模型的语义能力,提升科学传播写作中科学严谨性与叙述吸引力的平衡。

Comments DIS '26

Journal ref In Designing Interactive Systems Conference (DIS '26), June 13-17, 2026, Singapore, Singapore. ACM, New York, NY, USA, 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06575 2026-07-07 cs.RO cs.CV 版本更新 78%

Think Proprioceptively: State-Grounded Visual Token Selection for VLA Policies

通过本体感知进行思考:用于VLA策略的状态基础视觉令牌选择

Fangyuan Wang, Peng Zhou, Jiaming Qi, Shipeng Lyu, Chengyang He, David Navarro-Alarcon, Guodong Guo

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology(东区技术研究所) Great Bay University(大湾大学) Northeast Forestry University(东北林业大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究VLA模型中本体感知应用问题,提出ThinkProprio方法,将本体感知离散化为视觉语言模型(VLM)词汇令牌,与指令共同作用在VLM计算前选视觉补丁,贡献是提升性能、降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13660 2026-07-07 cs.RO cs.CV 版本更新 78%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02425 2026-07-03 cs.CV 新提交 78%

Learning to Evolve Scenes: Reasoning about Human Activities with Scene Graphs

学习演化场景:用场景图推理人类活动

Francesca Pistilli, Simone Alberto Peirone, Giuseppe Averta

机构 * Politecnico di Torino(托斯托大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出SG-Ego标注集和GLEN模型,通过时空场景图显式建模人-环境交互的动态演化,实现活动驱动的场景变化推理与预测。

Comments Project page at https://francescapistilli.github.io/GLEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01929 2026-07-03 cs.SE 新提交 78%

Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution

超越文本仓库探索:面向智能体问题解决的双模态结构推理

Jiayi Zhang, Kai Huang, Yang Liu, Chunyang Chen

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01784 2026-07-03 cs.CV 新提交 78%

SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video

SpaceEra++: 面向视频中3D空间推理的统一框架

Weili Guan, Haoyu Zhang, Meng Liu, Qianlong Xiang, Yaowei Wang, Liqiang Nie

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Pengcheng Laboratory(鹏城实验室) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) City University of Hong Kong(香港城市大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出SpaceEra++框架,通过ScenePick帧采样策略缓解输入不足,并利用SpaceAlign对齐绝对坐标与相对空间关系增强推理,在多个基准上超越强基线。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25842 2026-07-03 cs.CV 新提交 78%

Graph it first! Enabling Reasoning on Long-form Egocentric Videos through Scene Graphs

先构建图!通过场景图实现长视频第一人称视频推理

Agnese Taluzzi, Riccardo Santambrogio, Simone Mentasti, Chiara Plizzari, Matteo Matteucci

机构 * Politecnico di Milano(米兰理工大学) Bocconi University(博科尼大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出利用第一人称场景图(EgoSGs)将长视频压缩为紧凑文本表示,在保持语义丰富性的同时大幅减少输入长度,使多模态大模型能在令牌预算内高效推理,在HD-EPIC VQA上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01191 2026-07-02 cs.CV 新提交 78%

Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning

感知到推理:解耦感知与推理用于细粒度视觉推理

Hongxing Li, Xiufeng Huang, Dingming Li, Wenjing Jiang, Zixuan Wang, Haolei Xu, Hanrong Zhang, Haiwen Hong, Longtao Huang, Hui Xue, Weiming Lu, Jun Xiao, Yueting Zhuang, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出Perceive-to-Reason (P2R)框架,将细粒度视觉推理解耦为感知和推理两阶段,并引入PRA-GRPO强化学习策略,在多个高分辨率基准上显著提升性能。

Comments Code: https://github.com/ZJU-REAL/Perceive-to-Reason

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00881 2026-07-02 cs.CV 新提交 78%

OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping

OmniView-Space: 通过多视角空间映射增强空间推理

Xudong Li, Mengdan Zhang, Peixian Chen, Jiaxi Tan, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Xing Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Tencent Youtu Lab(腾讯优图实验室) Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出OmniView-Space框架,通过多视角空间映射、工具引导的自我中心推理和认知图蒸馏,解决多模态大模型在多步空间推理中的参考框架动态重锚问题,在单/多图像基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31814 2026-07-01 cs.CV 新提交 78%

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

基于几何先验的自回归模型生成车道拓扑推理

Jiahui Fu, Zehao Huang, Han Li, Naiyan Wang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出TopoGPT生成式框架,通过自回归序列建模学习车道图结构的几何先验,解决现有方法端点不一致和遮挡导致图不完整的问题,在OpenLane-V2上提升6.4/11.6个点。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31645 2026-07-01 cs.CV 新提交 78%

Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning

RoboSpatial Challenge at CVPR 2026技术报告:选择性推理激活与参考框架消歧用于具身空间推理

Yuxiang Xie, Qi Lv, Jianming Xing, Zijian Hong, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Ruoyu Technology(若愚科技)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出RoboSpatialBrain,通过强制<think>前缀激活和参考框架重定向两种无训练推理机制,解决具身空间推理中的歧义问题,在RoboSpatial-Home上达到80.9%成功率,获得挑战赛第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交 78%

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31257 2026-07-01 cs.CV 新提交 78%

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31157 2026-07-01 cs.CV 新提交 78%

Rethinking Foundation Model Collaboration: Enhancing Specialized Models through Proxy Task Reasoning

重新思考基础模型协作:通过代理任务推理增强专用模型

Hongyi Lin, Yang Liu, Jinhua Zhao, Xiaobo Qu

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出FAT框架,将基础模型与专用模型协作视为任务分解而非替代,通过代理任务(如选择或验证)提升结构化预测性能,在多个任务上优于直接使用基础模型回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31071 2026-07-01 cs.CV cs.RO 新提交 78%

Hierarchical 3D Scene Graph Construction and Belief-based Planning for Semantic Navigation

层次化3D场景图构建与基于信念的语义导航规划

Bing Wu, Zuyao Chen, Changwen Chen

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 提出零样本语义导航框架,通过在线维护层次化3D场景图(HSG)实现多粒度语义拓扑,并基于信念规划进行有限视野推演,在长距离导航中显著提升成功率与路径效率。

Comments Camera-ready version accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30698 2026-07-01 cs.RO 新提交 78%

Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

面向机器人血管内导丝导航的视觉-语言程序化推理与上下文感知奖励建模

Wentong Tian, Jiyuan Zhao, Tianliang Yao, Yuxiang Fan, Zhengyu Shi, Dong Liu, Peng Qi

机构 * Department of Control Science and Engineering, College of Electronic and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学电子与信息工程学院控制科学与工程系,以及上海智能科学与技术研究院) Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院电子工程系) Shanghai Operation Robot Co., Ltd.(上海微创医疗机器人(集团)股份有限公司)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出视觉-语言程序化推理框架,利用多模态大模型实时理解视觉上下文,动态调整奖励权重,实现单策略适应复杂血管导航任务,提升可靠性与效率。

Comments This paper has been accepted by IEEE/RSJ IROS 2026. 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24814 2026-07-01 cs.RO 新提交 78%

Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics

面向内部物流的上下文语义建图中的视觉-语言模型推理

Marvin Rüdt, Hao Pang, Constantin Enke, Zäzilia Seibold, Kai Furmans

机构 * Institute for Material Handling and Logistics, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院物流与物料搬运研究所)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出结合SLAM、SAM、实例聚类和VLM多视角推理的上下文语义建图流程,零样本推断物体可移动性,实现语义分类98.93% mIoU和可移动性估计89.17% mAcc。

Comments Accepted for publication at the 31st IEEE International Conference on Emerging Technologies and Factory Automation (ETFA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29915 2026-06-30 cs.CV 78%

H-GRPO: Permutation-Invariant Reinforcement Learning for Grounded Visual Reasoning

H-GRPO: 用于基础视觉推理的置换不变强化学习

Eric Peh, Debaditya Roy, Basura Fernando

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出H-GRPO框架,通过分解式证据基础将全局查询分解为原子子问题,每个子问题需显式子答案和局部证据边界框,构建结构化推理路径以提升VLM性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21190 2026-06-30 cs.CV 78%

SpatiO: Adaptive Test-Time Orchestration of Vision-Language Agents for Spatial Reasoning

SpatiO: 用于空间推理的视觉-语言代理自适应测试时编排

Chan Yeong Hwang, Miso Choi, Sunghyun On, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) Kakao Mobility Corp.(Kakao Mobility公司) Handong Global University(Handong全球大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SpatiO通过自适应测试时编排机制协调多种视觉-语言代理,提升空间推理能力,在多个基准测试中优于现有方法。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28691 2026-06-30 cs.RO 78%

DRIVE-Nav: Directional Reasoning, Inspection, and Verification for Efficient Open-Vocabulary Navigation

DRIVE-Nav: 方向推理、检查与验证以实现高效的开放词汇导航

Maoguo Gao, Zejun Zhu, Zhiming Sun, Zhengwei Ma, Longze Yuan, Zhongjing Ma, Zhigang Gao, Jinhui Zhang, Suli Zou

机构 * Beijing Institute of Technology(北京理工大学) DeepBlue College(深蓝学院) The National Key Laboratory of Autonomous Intelligent Unmanned Systems (KAIUS), School of Automation(自主智能无人系统全国重点实验室(KAIUS),自动化学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 DRIVE-Nav通过方向化探索框架提升开放词汇导航效率,通过方向检查和验证减少冗余路径,实验显示在HM3D-OVON等数据集上性能优越。

Comments 8 pages, 4 figures. Project page: https://coolmaoguo.github.io/drive-nav-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19119 2026-06-30 cs.CV 78%

MonoSR: Open-Vocabulary Spatial Reasoning from Monocular Images

MonoSR: 从单目图像进行开放词汇空间推理

Qirui Wang, Jingyi He, Yining Pan, Si Yong Yeo, Xulei Yang, Shijie Li

机构 * Technical University of Munich(慕尼黑工业大学) A*STAR Institute of Advanced Intelligence and Computing(新加坡科技研究局高级智能与计算研究所) Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出MonoSR大规模单目空间推理数据集,涵盖多种场景并支持多种问题类型,评估先进视觉-语言模型并分析辅助信息对单目空间推理的重要性,为开放世界中的单目空间推理提供基础。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏