arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-25 至 2026-08-25 共收录 92 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 2 篇

2608.22701 2026-08-25 cs.RO 新提交 84%

Physics Filtering Favors the Generalization of Robot Learning

物理滤波有利于机器人学习的泛化

Jindou Jia, Shixuan Han, Meng Wang, Gen Li, Zihan Yang, Sicheng Zhou, Kexin Guo, Jianfei Yang, Xiang Yu, Wei Wang, Lei Guo

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) National University of Singapore(新加坡国立大学) Beijing Aerospace Control Instrument Research Institute(北京航天测控仪器研究所)

专题命中 机器人学习 :robot learning(title);robotics(abstract,comments);robotic(abstract);分类 cs.RO

AI总结 该研究提出轻量、模型无关的 PhyFilter 反馈机制,无需海量训练数据,即可提升机器人在动态不确定性下的泛化能力,在四类机器人系统上验证了其有效性。

Comments Accepted by npj Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22197 2026-08-25 cs.LG 新提交 57%

On the Capability Separation Between World-Model Policy Learning and Imitated World-Action Models

世界模型策略学习与模仿世界-动作模型之间的能力分离

Yang Yu

机构 * Nanjing University(南京大学)

专题命中 机器人学习 :world model(abstract);分类 cs.LG

AI总结 该研究对比了直接行为克隆策略等三类策略,明确世界-动作模型学习与直接行为克隆的能力差异,指出观测演示无法识别动作效果,干预可实现零遗憾值。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 25 篇

2608.22067 2026-08-25 cs.RO cs.AI cs.CV cs.LG 新提交 90%

Inferring Action from Future Latent State for Robotic Manipulation

从未来隐状态推断机器人操纵动作

Fenghao Lei, Zhixiong Huang, Long Yang, Jiabao Chen, Jie Cheng, Peilin Huang, Han Fu, Zhuo Li, Xiaoxue Ren

机构 * DeepLeap Research(DeepLeap研究院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出无需视频生成的机器人操纵模型DELE-w0.5,通过从捕获动作相关物理结果的未来隐状态推断动作,在4项长程操纵任务的480次试验中,其性能优于最强基线47.5和30.7个百分点,实现最优表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22100 2026-08-25 cs.RO 新提交 89%

Contact-Rich Robotic Manipulation in Construction via Zero-Shot Learning: A Diffusion Policy-Guided Adaptive Control

基于零样本学习的建筑领域接触丰富型机器人操作:扩散策略引导的自适应控制

Roman Ibrahimov (1), Salma Mozaffari (1), Arash Adel (1) ((1) Princeton University)

机构 * Princeton University(普林斯顿大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本研究提出扩散策略与L1启发自适应控制器耦合的框架,实现建筑接触丰富型机器人装配的零样本仿真到真实迁移,在多类任务中取得高成功率,降低真实数据需求,推进多阶段装配自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22296 2026-08-25 cs.RO cs.CV 新提交 88%

TONAV: Task-Oriented Navigation and Action-Velocity Chunk Learning for Articulated Object Quadrupedal Mobile Manipulation

TONAV:面向关节物体四足移动操作的任务导向导航与动作-速度块学习

Haoran Lin, Mingyu Yang, Pengfei Qi, Kehan Chen, Qiang Diao, Liangji Zeng, Wenrui Chen, Yaonan Wang, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(湖南大学机器人视觉感知与控制技术国家工程研究中心) College of Semiconductors (College of Integrated Circuits), Hunan University(湖南大学半导体学院(集成电路学院))

专题命中 机器人操作 :manipulation(title,abstract);navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对四足移动操作中导航与操作的耦合问题,提出TONAV框架,结合任务导向导航与动作-速度块学习,通过遥操作、视觉语言推理及速度监督实现更优的操作性能。

Comments The project page is at this https URL (https://haochen611.github.io/TONAV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22278 2026-08-25 cs.RO 新提交 88%

DreamMimic: Learning Visuomotor Whole-Body Loco-Manipulation via World Model

DreamMimic:通过世界模型学习视觉运动全身移动操作

Jie Yin, Xingyu Lai

机构 * Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 DreamMimic 框架通过世界模型辅助蒸馏,将特权教师策略提炼为基于视觉的人形机器人控制器,引入 PCG 平衡引导与探索,在 OMOMO 和 BEHAVE 上提升了视觉移动操作性能。

Comments accepted to IROS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21592 2026-08-25 cs.RO 新提交 88%

Force/Torque-Based Kinematic Adaptation for Robotic Manipulation Tasks

基于力/力矩的机器人操作任务运动学自适应

Carl Glen Henshaw (US Naval Research Laboratory)

机构 * U.S. Naval Research Laboratory(美国海军研究实验室)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 本文提出一种仅用关节角与腕部力/力矩传感器的在线自适应方案,推导了稳定的运动学更新律,通过仿真验证其在孔轴插入任务中的有效性,为操作学习分解为任务策略与自适应运动学组件奠定基础。

Comments 29 pages including appendices, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22800 2026-08-25 cs.RO cs.AI 新提交 84%

Triplet2Track: A Hierarchical System with Object-Centric Representations for Reliable Long-Horizon Manipulation

Triplet2Track:一种基于以对象为中心表征的可靠长 horizon 操作分层系统

Jianxiang Liu, Gaojing Zhang, Chuan Wen, Qipeng Liu, Yuxuan Zhao, Ning Guo, Wenzhao Lian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) School of Engineering and Informatics, University of Sussex(萨塞克斯大学工程与信息学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对长 horizon 机器人操作可靠性难题,提出 Triplet-to-Track System(TTS),该闭环模仿学习系统用人类视频减少数据依赖,经实验平均成功率达74.8%,支持对象级与组合泛化。

Comments 8 pages, 6 figures. Accepted for presentation at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22799 2026-08-25 cs.RO cs.CV eess.SY 新提交 81%

Reproducible Vision-Guided 6-DoF Robotic Manipulator with a Mixed Stepper-Driver Architecture and Browser-Native Control

可复现的视觉引导6自由度机械臂:混合步进电机驱动器架构与浏览器原生控制

Lasan Perera, Deneth Priyadarshana, Dulana Pitiwaduge, Isitha Dinujaya, Mokshan Colambage

机构 * University of Moratuwa(莫拉图瓦大学)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究推出开源低成本6自由度机械臂NeuralNexus Arm,采用混合步进驱动器架构与浏览器原生控制,具备视觉引导自主抓取能力,所有设计开源且可复现。

Comments 13 pages, 16 figures, 7 tables. Design files and firmware: this https URL (https://github.com/Lasan-Perera/6-dof-arm-neuralnexus)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22449 2026-08-25 cs.RO cs.AI 新提交 81%

EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting

EMPIRE:将显式操作规划作为可学习中间表征用于自我中心视角下手运动预测

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有手运动预测方法忽略操作过程、梯度干扰的问题,提出两阶段框架EMPIRE,构建EMPIRE-651K数据集,实现了更优的手运动预测精度。

Comments 14 pages, 10 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23238 2026-08-25 cs.CV 新提交 79%

Mover360: Controllable Object Manipulation in 360° Panoramic Images

Mover360:360°全景图像中的可控物体操作

Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers, Taehyun Rhee

机构 * Victoria University of Wellington(惠灵顿维多利亚大学) University of New South Wales(新南威尔士大学) The University of Melbourne(墨尔本大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 Mover360是针对360°全景图像的可控物体操作框架,以物体平移为核心,支持插入、移除辅助任务,在多域多评估协议下优于相关强基线,代码与基准数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21735 2026-08-25 cs.RO 新提交 79%

Safety-Critical Bilateral Teleoperation for Omnidirectional Aerial Manipulation Using Force-Sensorless Haptic Feedback

采用无力传感器触觉反馈的全向空中操纵安全关键双边遥操作

Yubin Kim, Jinwoo Lee, Yongjun You, H. Jin Kim, Jeonghyun Byun

机构 * Seoul National University(首尔大学) Automation and System Research Institute (ASRI)(自动化与系统研究所) Institute of Advanced Aerospace Technology (IAAT)(先进航空航天技术研究所)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出一种整合视觉与无力传感器触觉力反馈的安全关键双边遥操作框架,采用基于控制障碍函数的分层安全滤波器,避免自由飞行时的意外反馈,提升空中操纵的安全性与稳定性。

Comments 8 pages, 10 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22419 2026-08-25 cs.RO cs.CV 新提交 73%

Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking

基于极其简单的模态掩码机制的鲁棒双臂视觉-语言-动作模型

Dongzhou Cheng, Ziang Li, Yixiao Zhou, Haojuan Li, Jinghao Zhang, Lei Lei, Minjing Dong, Jie Gui, Jiaqi Wang

机构 * Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Southeast University(东南大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究针对双臂操作中查询式VLA模型的动作不连续问题,提出仅训练用的模态掩码机制(M3),在RoboTwin 2.0等任务上使平均成功率提升超11.4%至30%以上,有效增强了模型鲁棒性。

Comments 35 pages, 22 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22398 2026-08-25 cs.RO cs.CV 新提交 73%

MotionDLO: Hybrid Event- and Frame-Based Tracking of Deformable Linear Objects

MotionDLO:基于事件与帧的混合可变形线性物体跟踪框架

Annalena Hartmann, Priyamvada Ajithkumar, Patrick Bründl, Jörg Franke

机构 * Institute for Factory Automation and Production Systems, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学工厂自动化与生产系统研究所)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 MotionDLO是基于事件与帧的混合可变形线性物体跟踪框架,结合CPD算法,以12ms更新速率实现实时、高精度DLO跟踪,适用于机器人操作,源代码与数据集公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21550 2026-08-25 cs.RO 新提交 70%

GOLEM: Modular Humanoid Autonomy Towards Electric Vehicle Battery Disassembly

GOLEM:面向电动汽车电池拆解的模块化人形自主系统

Max Conway, William Xie, Allen Devaraj, Yutong Zhang, Niraj Pudasaini, Mateo Feit, Adam Abid, Zachary Allen, Chen Liu, Xuan Tan, Jensen Lavering, Jason Chen, Lyle Antieau, Anthony Von Pischke, Alessandro Roncone, Zachary Sunberg, Nikolaus Correll

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) University of Notre Dame(圣母大学)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 该研究针对人工拆解报废EV电池的痛点,提出适配Unitree H1-2人形机器人的GOLEM开源模块化架构,通过仿真与现实实验验证了其在电池拆解各模块的性能,可用于人形机器人相关能力的公平对比与开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21424 2026-08-25 cs.CV cs.GR cs.HC cs.LG cs.MM 新提交 62%

EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing

EditStream:用于交互式视频生成与编辑的统一自回归框架

Yuqian Zhou, Zhenghong Zhou, Zongze Wu, Cameron Smith, Richard Zhang, Jiebo Luo, Eli Shechtman, Zhe Lin

机构 * Adobe Research(Adobe研究院) University of Rochester(罗切斯特大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本研究提出EditStream框架,整合多类视频生成编辑任务,通过两阶段蒸馏方法优化自回归模型,实现高质量交互式视频创作,填补了扩散模型与创意工作流的衔接空白。

Comments 25 pages, 12 figures, Project page: this https URL (https://real-time-video-research.github.io/editstream/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22965 2026-08-25 cs.CV 新提交 57%

Simplified Cross-Modal Calibration for Heterogeneous Event-RGB Stereo Systems

面向异构事件-RGB立体系统的简化跨模态标定

Nico Hessenthaler, Adam T. Müller, Nicolaj C. Stache

机构 * Center for Machine Learning Heilbronn University of Applied Sciences(海尔布隆应用科学大学机器学习中心)

专题命中 机器人操作 :robotic(abstract);分类 cs.CV

AI总结 针对异构事件-RGB立体系统的标定瓶颈,提出无运动跨模态标定框架,简化流程且降低重投影误差,在机器人眼到手标定中具实用性。

Comments Accepted to the 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-25 cs.LG cs.CL 新提交 57%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21894 2026-08-25 cs.RO cs.HC 新提交 57%

An Interpretable Deep Learning Framework for Material Perception and Classification from Multisensory Tactile Data

用于多感官触觉数据材料感知与分类的可解释深度学习框架

Li Zou, Dave Hogendoorn, Yasemin Vardar

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 该研究开发含三个深度学习模型的可解释框架,结合集成梯度实现高准确率与可解释性,揭示热线索具高信息价值,为触觉信号到材料感知提供计算解释。

Comments 7 pages, 5 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21841 2026-08-25 cs.AI cs.HC 新提交 57%

AI Watchdog: Agent Interfaces for Detecting and Defending Against Manipulative Dark Patterns in AI Conversations

AI 看门狗:用于检测和防御 AI 对话中操纵性黑暗模式的智能体接口

Rachel Poonsiriwong, Chayapatr (Pub) Archiwaranguprok, Constanze Albrecht, Monchai Lertsutthiwong, Pattie Maes, Pat Pataranutaporn

机构 * MIT Media Lab(麻省理工学院媒体实验室) KASIKORN Labs(Kasikorn实验室)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本研究提出 AI Watchdog 浏览器智能体接口,可检测对话式 AI 的五类黑暗模式,实验发现无认知强制的即时警告能显著降低用户对含黑暗模式的 AI 引导建议的依从性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21803 2026-08-25 cs.CR cs.AI 新提交 57%

ExplainGuard: A Zero Trust Framework for Post-Hoc Explanation Integrity Guarantees in Blackbox XAI Models

ExplainGuard:一种用于黑盒XAI模型事后解释完整性保证的零信任框架

Maraz Mia, Shovan Roy, Mir Mehedi A. Pritom, Maanak Gupta

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 本文提出ExplainGuard零信任框架,通过策略决策点的三项验证支柱,中和XAI解释操纵攻击,将审计过程转为可验证操作,保障黑盒XAI模型事后解释的完整性。

Comments 9 pages, 2 figures. Accepted at the IEEE Cybersecurity Awareness and Research Symposium 2026 (IEEE CARS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21776 2026-08-25 cs.CV 新提交 57%

SpatialDiff: 3D-Aware Object Movement via Implicit Spatial Modeling

SpatialDiff:基于隐式空间建模的三维感知物体运动

Zheng Liu, Zijian He, Huiguo He, Weizhi Zhong, Yejun Tang, Huan Yang, Kun Gai, Guanbin Li

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Kuaishou Technology(快手科技) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 SpatialDiff通过隐式三维空间建模和全局空间监督,解决了现有图像编辑方法难以处理复杂场景中物体空间运动的问题,提升了空间运动的准确性与保真度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21500 2026-08-25 cs.CR cs.AI 新提交 57%

SecOPD: Mitigating Adaptive Prompt Injections by On-Policy Distillation

SecOPD:通过策略内蒸馏缓解自适应提示注入攻击

Yibo Peng, Long Lian, David Wagner, Sizhe Chen

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 针对AI智能体面临的自适应提示注入攻击,提出SecOPD方法,通过令牌级反馈优化防御微调,大幅降低攻击成功率,且安全性可泛化到工具调用等新领域。

Comments EMNLP 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22230 2026-08-25 cs.CL 新提交 50%

Whitewashing Hate, Smearing Harmless Content: Annotator-Style Rebuttal Attacks on LLM-Based Moderation

洗白仇恨内容、抹黑无害内容:针对基于大语言模型的内容审核的标注者式反驳攻击

Junyu Lu, Kaiyuan Liu, Jingyi Kang, Deyi Ji, Hailong Zhang, Lanyun Zhu, Qi Zhu, Bo Xu, Liang Yang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Tongji University(同济大学)

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对LLMs内容审核提出标注者式反驳攻击,发现洗白仇恨内容与抹黑无害内容的攻击效果存在模型特异性不对称性,防御措施无法完全消除攻击影响,凸显需定向防御与反馈鲁棒性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23561 2026-08-25 cond-mat.str-el cond-mat.mes-hall 新提交 50%

Flux-induced Aharonov-Bohm Oscillation in the Tunneling Spectroscopy of Kitaev Spin Liquids

Kitaev自旋液体隧穿谱中通量诱导的阿哈罗诺夫-玻姆振荡

Wen-Han Kao, Elio J. König

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对Kitaev自旋液体中通量激发与费米子互统计的探测难题,通过理论与数值分析揭示了通量诱导的隧穿谱振荡,为相关统计特征的诊断提供了无需操纵单个任意子的新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23560 2026-08-25 cond-mat.quant-gas 新提交 50%

Spinor condensate persistent currents in an atomtronic Josephson necklace

原子电子约瑟夫森项链中的旋量凝聚体持续电流

Sayan Chatterjee, Nalinikanta Pradhan, Rina Kanamoto, M. Bhattacharya, Pankaj Kumar Mishra

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究探究环形多约瑟夫森结上旋量原子玻色-爱因斯坦凝聚体的持续电流,考察多种因素对其的影响,揭示第二种组分可实现超流的多种操控机制,为相关工程应用提供路线图。

Comments 7 pages, 4 figures, with supplementary including 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21493 2026-08-25 cond-mat.mtrl-sci 新提交 50%

All-Optical Control of Interfacial Polarization in MoS$_2$/WSe$_2$ Heterobilayers

MoS₂/WSe₂异双层中界面极化的全光调控

Muhammad Sufyan Ramzan, Giancarlo Soavi, Caterina Cocchi

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究基于第一性原理预测了强超快脉冲可诱导MoS₂/WSe₂异双层产生持久界面极化,揭示了场强对层间电荷转移的影响,为低维异质结构的全光操控提供理论蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 19 篇

2608.22896 2026-08-25 cs.RO 新提交 83%

SuperMap: A Spatio-Temporal SLAM System for Visual-Language Navigation

SuperMap:用于视觉-语言导航的时空SLAM系统

Shibo Zhao, Guofei Chen, Honghao Zhu, Zhiheng Li, Changwei Yao, Nader Zantout, Seungchan Kim, Wenshan Wang, Ji Zhang, Sebastian Scherer

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出SuperMap,一种结合几何SLAM与开放词汇感知的4D时空建图框架,用于视觉-语言导航,可稳定维护目标身份,经基准与真实机器人验证后开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21926 2026-08-25 cs.CV 新提交 83%

AirAlign: Geometry-Aware Relative Pose Alignment for UAV Last-Meter Navigation

AirAlign:面向无人机最后一米导航的几何感知相对位姿对齐

Jinyi Zhou, Shuo Feng, Yufei Wu, Piji Li

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 具身导航 :navigation(title,abstract);manipulation(abstract);分类 cs.CV

AI总结 针对无人机最后一米导航中视角与外观变化导致的位姿对齐难题,提出仅用RGB图像对的AirAlign框架,结合预训练几何模型与场景拆分训练,经PairUAV挑战赛实验验证其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22678 2026-08-25 cs.RO cs.AI cs.CV 新提交 82%

RACO: Reliability-Aware Coarse-Goal Optimization for Inspection-Oriented UAV Vision-Language Navigation

RACO:面向巡检的无人机视觉语言导航的可靠性感知粗目标优化

Sen Wang, Yiming Sun, Jiaxuan He, Pengfei Zhu

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对面向巡检的无人机视觉语言导航,提出RACO框架,通过可靠性感知优化粗目标,在未见场景下较HETT基线显著提升成功率,改善巡检区域到达率并降低错误验证风险。

详情

展开后加载摘要…

URL PDF HTML 收藏