arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 387 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 387 篇

2608.08281 2026-08-11 cs.AI cs.RO 新提交 57%

Exploring LLM Capabilities for Situational Understanding and COLREG compliance on real-world maritime navigation scenarios

探索大语言模型(LLM)在现实世界海事航行场景中的情境理解与《国际海上避碰规则》(COLREG)遵从能力

Julius Wirbel, P. Nicholas Hansen, Line K. H. Clemmensen, Roberto Galeazzi

机构 * Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究探索LLM在海事航行中的应用,构建含50个真实场景的AIS数据集,评估不同LLM的理解与推理能力,发现不微调则难以解决海事航行任务。

Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07557 2026-08-11 cs.RO cs.AI cs.CV 新提交 57%

AeroDPO: Unleashing Lightweight UAV Navigation with High-Fidelity Perception and Automated Preference Optimization

AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力

Peng Xu, Chengcheng Wang, Shaohua Wan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。

Comments 7 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07547 2026-08-11 cs.CV cs.AI 新提交 57%

Learning an Interior Layout Policy in a Domain Specific Language Action Space

在领域特定语言动作空间中学习室内布局策略

Yuhao Lu, Weichen Zhang, Wenyi Xiao, Haohui Chen, Yiyun Fei

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对现有室内布局生成方法的缺陷,该研究提出基于LLM的LayoutDSL框架,通过领域特定语言动作空间学习布局策略,结合数据集构建与强化学习优化,显著提升了布局的空间合理性与设计逻辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06948 2026-08-10 cs.AI 新提交 57%

LMM Modality Transfer: A Pre-requisite for Autonomous GIS Agents

多模态大模型模态迁移:自主地理信息系统智能体的先决条件

Ivan Majic, Zexian Huang, Franziska Hübl, Krzysztof Janowicz, Meilin Shi, Mina Karimi, Zilong Liu, Alexandra Fortacz-Lazan

机构 * Graz University of Technology(格拉茨工业大学) University of Vienna(维也纳大学) University of Liverpool(利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06756 2026-08-10 cs.AI 新提交 57%

Capek 0.5: An Execution-Centric Vision-Language Model for Embodied Intelligence

Capek 0.5:面向具身智能的以执行为中心的视觉语言模型

Ying Chen, Weizhen Li, Zhe Hu, Zhenjiang Li, Rui Jiang, Zhifeng Gu, Lihuang Fang, Jiangping Liu, Lei Yi, Jie Chen

机构 * Xiaopeng(小鹏汽车)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出以执行为中心的具身视觉语言模型Capek 0.5,通过分类法整合四类具身能力,在多维度评估中表现优于初始化模型,可迁移至闭环具身任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06674 2026-08-10 cs.CV cs.LG 新提交 57%

Corrupting Attention: Evasion-Based Adversarial Attacks on Encoder Attention in Detection Transformers

破坏注意力:对检测 Transformer 中编码器注意力的基于规避的对抗攻击

Ridma Jayasundara, Shaheer Mohamed, Tharindu Fernando, Harshala Gammulle, Basura Fernando, Sanka Rasnayake, A V Subramanyam, Sridha Sridharan, Clinton Fookes

机构 * Queensland University of Technology(昆士兰科技大学) Agency for Science, Technology and Research, Singapore(新加坡科技研究局) National University of Singapore(新加坡国立大学) Indraprastha Institute of Information Technology, Delhi(英迪拉普拉斯塔信息技术学院(德里))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出首个针对检测 Transformer 编码器注意力的对抗攻击,在不可察觉扰动下破坏注意力结构,使 DETR-R50、DINO-Swin-L 等主流检测器 mAP 大幅下降,性能优于现有攻击。

Comments 8 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05715 2026-08-07 cs.RO cs.AI 新提交 57%

Hijacking Robots with a Piece of Paper: A Systematic Study of Physical Prompt Injection in VLM-Controlled Robots

用一张纸劫持机器人:对VLM控制机器人的物理提示注入的系统研究

S. M . Bhagya P. Samarakoon, M. A. Viraj J. Muthugala, W. K. R. Sachinthana, Mohan Rajesh Elara

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对VLM控制的分拣机器人,系统分析了四类物理提示注入攻击的成功率,发现其存在显著脆弱性,且三种简单防御措施可大幅降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04776 2026-08-06 cs.AI 新提交 57%

NSF-HRPT: Neural Semantic Field meets Hierarchical Risk Perception Tree for Safety-Critical Scenario Assessment

NSF-HRPT:神经语义场结合分层风险感知树的安全关键场景评估方法

Yu Zhao, Jiangyu Pan, Tao Hu, Ming Yin, Fan Yang, Jiangfan Liu, Xiubo Liang

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出NSF-HRPT框架,结合神经语义场与分层风险感知树,引入Sim2Real策略,实现单目视觉输入下安全关键场景的高效风险评估,在合成与现实数据集上均取得优异性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04709 2026-08-06 cs.CL 新提交 57%

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

EmpaAva:开源智能体式3D化身共情实时聊天机器人

Jie Yang, Wenhao Xu, Shuhui Lin, Hao Fei

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.CL

AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。

Comments Project&Demo: https://empaava.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02955 2026-08-05 cs.HC cs.AI cs.CY eess.IV 新提交 57%

Chat Debugging: An Exploratory Study of Human-AI Collaboration to Debug Analog Circuits

聊天调试:人机协作调试模拟电路的探索性研究

John Hu, Andrew Ash

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 该研究通过分析本科生与开源大型语言模型(LLMs)协作调试模拟电路的聊天记录,揭示了人机协作调试的模式、LLMs的优势与不足及学生的技能短板,为优化人机协作调试提供了依据。

Comments This is the accepted version of a paper to be presented at the 2026 IEEE Frontiers in Education Conference (FIE). The final version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02056 2026-08-04 cs.CV cs.AI 新提交 57%

TBSG-Net: Temporal Bipartite Scene Graph Network for Fine-Grained Video Moment Retrieval

TBSG-Net:用于细粒度视频时刻检索的时间二分场景图网络

Ji Huang, Yongsheng Dai, Tianyu Ren, Barry Devereux, Hui Wang

机构 * Queen’s University Belfast(贝尔法斯特女王大学) School of Electronics, Electrical Engineering and Computer Science(电子、电气工程与计算机科学学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对无提案视频时刻检索中静态场景图的时间动态性缺失与时间跨度编码不足问题,提出首个基于动态场景图的TBSG-Net,通过TBSG构造器与混合编码器实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01802 2026-08-04 cs.AI cs.RO 新提交 57%

CoNav-UAV: Cooperative Dual-Altitude Aerial Navigation via Stackelberg Learning

CoNav-UAV:基于Stackelberg学习的协同双高度无人机导航

Junru Song, Wenhao Zhang, Yang Yang, Xuekai Qiu, Feifei Wang, Weien Zhou, Tingsong Jiang, Ying Wen, Yang Li, Wen Yao

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对双高度无人机协同导航的合作问题,本文提出CoNav-UAV,通过迭代Stackelberg学习优化高空领导者与低空跟随者,在AerialVLN基准上显著提升导航成功率且适配数据需求更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01185 2026-08-04 cs.CV cs.LG 新提交 57%

3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering

3DZip:面向3D视觉问答的空间感知特征多样性引导的Token压缩方法

Changwoo Baek, Kyeongbo Kong

机构 * Pusan National University(釜山国立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文针对3D视觉问答中Token压缩忽略空间特性的问题,提出三阶段框架3DZip,在三个基准上以128个Token保留94.7%性能、提速1.92倍,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://cvsp-lab.github.io/3DZip

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01106 2026-08-04 cs.CV cs.AI 新提交 57%

SG-Layout: Structured Scene Graph-Guided Layout Generation with LLMs

SG-Layout:基于结构化场景图引导的大语言模型布局生成方法

Junsheng Wang, Chao Chen, Mengying Xie, Mingyan Li, Fuqiang Gu

机构 * Chongqing University(重庆大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SG-Layout通过两阶段训练将结构化空间知识融入LLMs,在三类任务中提升了空间推理与几何一致性,尤其适配关系密集的复杂场景。

Comments 16 pages, 5 figures. Accepted at WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29031 2026-08-03 cs.RO cs.AI 新提交 57%

Auto-JEPA: A Latent World Model of Continuous Intent for End-to-End Autonomous Driving

Auto-JEPA:面向端到端自动驾驶的连续意图隐式世界模型

Jiwei Yang, Zhengxian Chen, Chaosheng Huang, Jun Li

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 Auto-JEPA是面向端到端自动驾驶的连续意图隐式世界模型,通过联合嵌入预测学习未来驾驶意图,无需密集未来世界建模,在NAVSIM数据集上取得优异规划性能,可聚焦规划相关视觉特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28858 2026-08-03 cs.CV cs.AI 新提交 57%

A Unified Benchmark of Deep Learning Models for Multi-task 3D Brain Tumor Segmentation from Magnetic Resonance Imaging

用于磁共振成像多任务3D脑肿瘤分割的深度学习模型统一基准

Diego J. Torrejón, Luna Y. Hernández, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心(CTIM)) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(网络、企业与社会大学研究所(IUCES)) University of Las Palmas de Gran Canaria(拉斯帕尔马斯大加那利大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本研究构建统一基准,在相同条件下对比3D U-Net等5种深度学习模型在BraTS 2023、2024数据集上的脑肿瘤分割性能,明确了不同架构的准确率与效率权衡及适用场景。

Comments 27 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27627 2026-07-31 cs.RO cs.AI 新提交 57%

Arm2Air: Cross-Embodiment Skeleton Transfer for 3D Relay Formation

Arm2Air:用于三维中继组网的跨 embodiments 骨架迁移

Dohun Lee, Kyeonghyun Yoo, Seokmin Kim, Byongho Lee, Seungjoo Oh, Hwangnam Kim

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 Arm2Air 实现跨 embodiments 骨架迁移,高效优化无人机中继部署,在规划速度、中继性能及数据效率上均优于基线方法,为异构 embodied 任务结构先验迁移提供新方案。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26769 2026-07-30 cs.CV cs.AI 新提交 57%

See2Think: Do Multimodal Models Really Use Intermediate Visual States?

See2Think:多模态模型是否真正利用中间视觉状态?

Siyu Yan, Zhuoran Yan, Haiying Xu, Panhao Zhou, Jingyu Chen, Chenhao Ji, Shuo Cao, Yongheng Zhang, Haoze Liu, Siyu Zhang, Xiwen Gu, Yihao Liu, Alex Jinpeng Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出See2Think评估框架,通过See2ThinkBench和VAoT测试多模态模型对中间视觉状态的依赖,发现视觉推理具模型与环境依赖性,准确渲染是瓶颈,受损反馈会使模型准确率降超10个百分点。

Comments 10 pages, 5 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25537 2026-07-29 cs.CV cs.AI 新提交 57%

Visual prompt engineering for video models

视频模型的视觉提示工程

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24904 2026-07-29 cs.CV cs.CL 新提交 57%

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 57%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 57%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23491 2026-07-28 cs.CV cs.CL 新提交 57%

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

PlanCraft:用于受建筑师启发的渐进式3D住宅场景生成的草图绘制、细化和布置

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对自动住宅平面图生成中忽视的设计渐进性及二维平面图重要性问题,提出PlanCraft,通过SketchPlan提供训练信号,PlanCraft-Diff细化草图,PlanCraft-Agent布置场景,实验显示其在FID及空间合理性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22721 2026-07-28 cs.CV cs.AI 新提交 57%

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

用于精神分裂症认知康复的交互式视觉语言平台

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) RIIMA Laboratory(RIIMA实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22043 2026-07-27 cs.CL cs.CV 新提交 57%

Scaling Native Multimodal Pre-Training From Scratch

从零开始扩展原生多模态预训练

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯大语言模型部)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15621 2026-07-20 cs.RO cs.AI 新提交 57%

Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving

以5Hz思考,20Hz行动:用于闭环驾驶的异步快慢视觉-语言-动作推理

Yun Li, Jiachen Gong, Simon Thompson, Ehsan Javanmardi, Qunli Zhang, Zifan Zeng, Shiming Liu, Peng Wang, Zixuan Guo, Manabu Tsukada

机构 * The University of Tokyo(东京大学) TIER IV, Inc.(TIER IV公司) Huawei(华为)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于闭环驾驶时推理延迟与车辆控制速率冲突的问题,提出快慢架构,慢系统用冻结主干处理历史,快专家基于缓存和当前帧回归航路点,经训练在CARLA上提升路线完成率,降低误差且可零样本转移。

Comments 13 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13877 2026-07-16 cs.LG 新提交 57%

AI-Augmented Adaptive Digital Twin Modeling for Brain Tumor Evolution Prediction and Treatment Scheduling

用于脑肿瘤进化预测和治疗计划安排的人工智能增强自适应数字孪生建模

Wenxi Liu, Michael Trimboli, Xianqi Li

机构 * Florida Institute of Technology(佛罗里达理工学院) Department of Mathematics and Systems Engineering(数学与系统工程系)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 针对脑肿瘤进化预测和治疗计划难题,提出人工智能增强自适应数字孪生框架,集成多种模型与方法。实验表明该框架能有效提升预测准确性,降低肿瘤负荷,为患者特异性治疗优化提供统一框架,奠定向现实治疗计划转化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13451 2026-07-16 cs.RO cs.AI cs.CV 新提交 57%

Learning Physics-Guided Residual Dynamics for Deformable Object Simulation

学习用于可变形物体模拟的物理引导残差动力学

Shivansh Patel, Kaifeng Zhang, Sanjay Pokkali, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) Columbia University(哥伦比亚大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 研究针对可变形物体模拟中动力学预测难的问题,提出物理引导残差动力学(PGRD)框架,结合物理与学习方法优势,采用特定架构和公式,在多物体模拟上结果更准,还展示了其在操作规划和交互式模拟中的应用效用。

Comments Website: https://pgrd-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13072 2026-07-16 cs.RO cs.AI eess.SP 新提交 57%

HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models

HRO:用于基于大语言模型的零样本目标导航的分层房间到物体框架

Luyuan Jia, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对零样本目标导航问题,提出LLM驱动的分层房间到物体(HRO)框架,引导智能体粗到细探索导航至目标物体,实验表明该框架在Gibson和HM3D数据集上优于现有基于LLM的方法。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11377 2026-07-14 cs.RO cs.AI 新提交 57%

A Glimpse into Long-term Physical Coexistence with Intelligent Robots

深入了解与智能机器人的长期物理共存

Weiqi Jin, Peijun Tang, Kuncheng Luo, Baifu Huang, Binyan Sun, Haotian Yang, Shangjin Xie, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究与智能机器人长期物理共存问题,提出基于机器人网关抽象的多机器人代理PHILIA,解耦代理推理与机器人执行,实现即插即用集成,在Astribot S1机器人上验证架构,展示用例,强调人机交互流程对有效协助的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏