arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 567 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 567 篇

2608.06803 2026-08-10 cs.ET cs.RO 新提交 57%

Ising Acceleration for Multi-Robot Multi-Target Planning

面向多机器人多目标规划的伊辛加速

Ahmet Efe, Recep B. Uludag, Chris H. Kim, Ulya R. Karpuzcu

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文研究CMOS伊辛机在多机器人多目标规划中的加速能力,提出适配硬件的规划方法与流水线,其能耗远低于经典方案,路径质量接近经典基准,可用于规划栈的部分环节。

Comments 11 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05797 2026-08-07 cs.LG cs.CL 新提交 57%

Predicting Task Difficulty Without Rollouts

无需展开预测任务难度

Stefan Krsteski, Charlotte Meyer

机构 * Andromede AI(安卓迈德人工智能)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 该研究针对17个跨多领域的智能体基准,提出无需展开的任务难度预测方法,发现token级熵是有效预测信号,可通过难度残差暴露环境缺陷,助力校准基准与构建训练课程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05586 2026-08-07 cs.RO 新提交 57%

PathCover: A Fast Convex Decomposition along a Path via Randomized Iterative Space Partitioning (RISP) on Point Clouds

PathCover:基于点云的随机迭代空间划分(RISP)沿路径的快速凸分解

Kunal S. Narkhede, Abhijeet M. Kulkarni, Guoquan Huang, Ioannis Poulakakis

机构 * University of Delaware(特拉华大学) Athena Research Center(雅典娜研究中心) National Technical University of Athens(雅典国家技术大学) HERON–Center of Excellence in Robotics(赫伦机器人卓越中心)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 PathCover是基于点云的快速凸分解框架,采用RISP算法,可高效生成无障碍物多面体,速度较现有方法提升一个数量级,经仿真与实机验证适用于机器人导航。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04905 2026-08-06 cs.RO 新提交 57%

PRIMAL3: Pathfinding via Reinforcement and Imitation Multi-Agent Learning - Leveraging LaCAM3

PRIMAL3:基于强化学习与模仿的多智能体路径规划——利用LaCAM3

Chengyang He, Tanishq Duhan, Gadiel Sznaier Camps, Fangyuan Wang, Yuhong Cao, Jiankai Sun, Ge Sun, Mac Schwager, Guillaume Sartoretti

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 PRIMAL3是整合强化学习、LaCAM3等的超大规模多智能体路径规划框架,性能优于现有基线,可扩展至10万智能体,能部署于物理机器人系统

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04723 2026-08-06 cs.RO 新提交 57%

A Vision-based Control Framework for Real-time Autonomous UUV Operations

用于实时自主水下航行器(UUV)作业的基于视觉的控制框架

Erik Tjærand Frøland, Marco Job, Md Ether Deowan, Eleni Kelasidi

机构 * NTNU(挪威科技大学) Oceaneering AS(奥星海洋公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 提出一种用于动态复杂水下环境中UUV的基于视觉的控制框架,可实现实时定位、导航与建图,经合成数据集验证及实船测试,性能实时且鲁棒,支持海洋机器人现场部署完成水下关键任务。

Comments Accepted to IFAC WC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04420 2026-08-06 cs.RO 新提交 57%

SCOPE: Field-of-View-Aware Path Planning in Unknown 3D Environments via Safety-Volume Certification

SCOPE:通过安全体积认证在未知三维环境中感知视场的路径规划

Junbin Yuan, Muqing Cao, Yunwoo Lee, Brady Moon, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学) Brigham Young University(杨百翰大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 SCOPE是一种在未知3D环境中规划路径的框架,通过安全体积认证实现视场感知,可到达所有目标、减少任务时间,真实机器人演示验证其有效性。

Comments Project website: https://yuanjunbin.github.io/scope-planner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03155 2026-08-05 cs.RO 新提交 57%

POMDPs for Autonomous Science Exploration

用于自主科学探测的POMDP

Daniel Guirguis, Nathan Wallace, Hanna Kurniawati, Salah Sukkarieh

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究提出SHM-POMDP模型,解决高维观测下POMDP规划融入科学表征的难题,在RockSample域和Cuprite地质探测任务中,其性能优于传统POMDP与信息论基线方法。

Comments 8 pages, 3 figures, 2 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03060 2026-08-05 cs.RO math.OC nlin.CD 新提交 57%

Passively Safe Convex Guidance for Cislunar Rendezvous and Proximity Operations

地月交会与接近操作的被动安全凸制导

Ian M. Down, Connor Plaks, Matthew Bolliger, Michael Caudill

机构 * Advanced Space, LLC(Advanced Space有限责任公司)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 该研究提出纯凸规划方法,设计适用于地月轨道被动安全脉冲交会与接近操作的机动,验证其在NASA CAPSTONE 02任务中的性能,为星上自主制导提供基线方案。

Comments Presented at the 2026 AAS/AIAA Astrodynamics Specialist Conference, Whistler, BC

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02052 2026-08-04 cs.LG 新提交 57%

Secrets Everywhere: Auditing Memorization in Mobility Prediction Models

无处不在的秘密:移动性预测模型中的记忆审计

Anne Josiane Kouam, Hristo Boyadzhiev, Konrad Rieck

机构 * Inria(法国国家信息与自动化研究所) TU Berlin(柏林工业大学) BIFOLD(数据科学与人工智能柏林研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 本文首次系统审计移动性预测模型的记忆风险,提出框架量化不同粒度的移动性记忆,发现普遍记忆模式关联用户规律性并提升数据提取风险,呼吁开展强制性隐私审计。

Comments Full version of the paper accepted for publication at the ACM SIGSAC Conference on Computer and Communications Security (CCS 2026). Includes supplementary appendices omitted from the proceedings version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01636 2026-08-04 cs.RO 新提交 57%

A Forward-Inverse Dynamic Game Framework for Enhanced Multi-Agent Trajectory Planning

用于增强多智能体轨迹规划的前向-逆向动态博弈框架

Tianle Liu, Youcheng Niu, Jing Zeng, Shuo Li, Jinming Xu

机构 * College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 针对多智能体轨迹规划的动态博弈方法局限,本文提出带状态依赖权重的KL正则化动态博弈及上下文感知逆向博弈模块,经模拟与多机器人实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00792 2026-08-04 cs.RO 新提交 57%

StochSIPP: Safe Interval Path Planning in Stochastic Dynamic Environments

StochSIPP:随机动态环境下的安全区间路径规划

Ajith Kemisetti, Shahaf S. Shperberg, Yoonchang Sung

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 StochSIPP是针对带不确定边/顶点状态的时间路网的精确条件规划器,通过SIPP与有界AND/OR搜索实现安全导航,可缩短到达时间并解决保守规划器无法处理的门控场景。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29638 2026-08-03 cs.CV 新提交 57%

HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

HierDoc:用于长文档视觉问答的分层页到区域证据路由

Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 HierDoc是分层证据路由框架,将长文档视觉问答的页与区域选择整合为连续两阶段,在开放权重系统中达SOTA,使LongDocURL提升16.87%,区域证据可显著提升单页系统性能。

Comments 15 pages, 4 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28947 2026-08-03 cs.LG 新提交 57%

Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination

通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应

Jingwen Fu, Zhen Liu, Yuhan Liu, He Zhang, Nanning Zheng

专题命中 具身导航 :robotic(abstract);分类 cs.LG

AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28045 2026-07-31 cs.RO 新提交 57%

RaDiVe: Robust 4D Radar Odometry with Distance-Bounded NDT and Velocity-Discrepancy Point Uncertainty

RaDiVe:基于距离约束NDT与速度差异点不确定性的鲁棒4D雷达里程计

Sangwoo Jung, Dongjae Lee, Chiyun Noh, Ayoung Kim

机构 * SNU(首尔国立大学)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出RaDiVe框架,通过距离约束NDT、速度差异点不确定性模型及SDF表面点提取构建鲁棒4D雷达里程计,在多数据集上优于现有基线且保持实时性

Comments 8 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27418 2026-07-31 cs.LG 新提交 57%

Context-Informed Ship Trajectory Prediction via Conditional Attention

基于条件注意力的上下文感知船舶轨迹预测

Yuan Guan, Chandler Squires, Timothy Hu, Pradeep Ravikumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Advanced Technology Laboratories Lockheed Martin(洛克希德·马丁公司先进技术实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.LG

AI总结 该研究提出Conditional Informer架构,通过条件注意力机制编码船舶与环境的物理依赖,结合Modality Masking策略,在AIS与ERA5数据上提升了船舶轨迹预测准确率并降低了传感器故障时的误差。

Comments Accepted for publication at the 2026 29th International Conference on Information Fusion (IEEE FUSION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26770 2026-07-30 cs.RO 新提交 57%

Vision-TL-Action: Neuro-Symbolic Trajectory Generation from Visual Observations and Temporal Logic

Vision-TL-Action:基于视觉观测和时序逻辑的神经符号轨迹生成

Zezhi Liu, Zhiwei Zheng, Hanqian Luo, Deyun Qin, Shizhen Wu, Yongchun Fang

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出Vision-TL-Action模型,通过融合视觉与TL节点标记生成动作轨迹,在Panda、AntMaze任务中优于或接近基线,实现无需物体几何信息的视觉到TL目标的轨迹生成。

Comments 17 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24795 2026-07-29 cs.AI cs.HC 新提交 57%

When Shortest Isn't Safest: A Design Science Approach to Senior-Friendly Pedestrian Routing

当最短路径并非最安全路径时:一种面向老年人友好型行人路线规划的设计科学方法

Erdi Ünal, Daniel Eisenhardt, Christian Meske, Seyed Nima Afzali, Aysegül Dogangün

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究针对行人导航系统忽视老年人出行障碍等问题,通过设计科学方法开发老年人友好型行人路线规划制品,经访谈得出设计要求和原则并实例化,实地研究表明该制品生成的路线更受青睐,综合见解给出完善原则,为从业者提供指导。

Journal ref Design for Better Futures: Beyond the Science of the Artificial. Completed Research, LNCS 16605 (2026) 406-424

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24757 2026-07-29 cs.HC cs.AI cs.CY 新提交 57%

From Idea to Classroom in Days: Using "Vibe Coding" to Create a Programming Process Visualizer from IDE Activity Logs

数天内从想法到课堂:利用“氛围编码”从IDE活动日志创建编程过程可视化工具

Heidi Taveter, Marina Lepp

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 利用人工智能辅助的“氛围编码”,快速开发并在课堂部署Thonny日志可视化工具,可分析Python IDE日志,生成学生编程过程视图,支持教师决策,经评估和试点收集反馈后进行了可用性改进。

Comments 9 pages, 6 figures. Accepted for presentation at the 2026 IEEE Frontiers in Education Conference (FIE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24233 2026-07-28 cs.RO 新提交 57%

Quality-Adaptive Multi-UAV 3D Reconstruction with Sparse Workload Redistribution

基于稀疏工作负载重新分配的质量自适应多无人机三维重建

Benjamin Sportich, Kenza Boubakri, Olivier Simonin, Alessandro Renzaglia

机构 * Inria, INSA Lyon, CITI(法国国家信息与自动化研究所、里昂国立应用科学学院、CITI)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 针对无人机三维重建中计算和能量受限及协调难问题,提出质量自适应分散决策策略,集成质量导向准则,采用两级协调,仿真显示该方法提高路径效率且实现更高保真度重建,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23842 2026-07-28 cs.NE cs.AI 新提交 57%

Limbomorphs

肢体形态

Alex Alvarez, Michael Levin

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究人工生命系统中Gifbreeder的肢体形态,通过用户审美选择进化时空场产生类似生物的形态,用输入空间扰动评估其行为,探讨其反应是否反映目标导向行为及类似智能体动力学如何在无明确规则系统中出现。

Comments 3 pages, 3 figures. Extended abstract accepted as a Late Breaking Abstract at the Artificial Life Conference (ALIFE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23797 2026-07-28 cs.RO 新提交 57%

Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map

注意力的记忆:通过视觉-语言-运动地图进行语言条件下的重新感知

Dibyendu Ghosh

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 研究携带行为注释地图的机器人的规划问题,通过将重新感知视为注意力决策,利用持久地图的记忆实现资源分配优化,在语言条件任务中表现出色,证明地图能指导机器人关注重点,而非空间导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23702 2026-07-28 cs.RO 新提交 57%

Try Once, Then Optimal: De-Redundified Procedure Memory for Cross-Episode Exploration Amortization

一试即优:用于跨情节探索摊销的去冗余过程记忆

Haizhou Ge, Haochen Ouyang, Zhixing Chen, Yufei Jia, Yue Li, Lu Shi, Lei Han, Guyue Zhou, Ruqi Huang

机构 * Tsinghua University(清华大学) DISCOVER Robotics(DISCOVER机器人公司) Northeast Agricultural University(东北农业大学)

专题命中 具身导航 :manipulation(abstract);分类 cs.RO

AI总结 研究如何让机器人避免重复探测隐藏状态物体,提出面向实例的记忆框架IOM,用视觉语言模型实例化,在多任务中减少操纵操作,提升效率且不降低成功率,即使过程错误也能成功。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23473 2026-07-28 cs.RO 新提交 57%

PRISM: Polynomial Representations for Interaction-Structured Motor Control

PRISM:用于交互结构运动控制的多项式表示

Seung Hyun Lee, Stella X. Yu

机构 * University of Michigan(密歇根大学)

专题命中 具身导航 :manipulation(abstract);分类 cs.RO

AI总结 研究针对机器人观察中物理变量交互作用问题,提出PRISM策略表示,通过因式分解多项式模块展现高阶交互特征,在强化和模仿学习中应用,提升了人形机器人运动等性能,还能产生无传感器柔顺行为,表明多项式表示应成运动控制标准选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22750 2026-07-28 cs.AI 新提交 57%

Commitment To Cooperation With Self-Negotiated Contracts

通过自我协商合同实现合作承诺

Tim Wyse, Kaitlin Bustos, Yulia Volkova, Max Kleiman-Weiner

机构 * University of Washington(华盛顿大学)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究人工智能代理在多智能体世界中的合作问题,借鉴法律制度和契约,通过在时空博弈\CT中研究基于大型语言模型的代理使用不同合同表示,发现自我协商合同可改善合作结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22773 2026-07-28 eess.IV cs.CV physics.med-ph 新提交 57%

Metric Surface Reconstruction of Neurosurgical Scenes from Monocular Operating Microscope Images and Microscope Pose

从单目手术显微镜图像和显微镜位姿重建神经外科场景的度量曲面

Thomas Bucher, Didier Neuenschwander, Thomas Petutschnigg, Michael Murek, David Bervini, Andreas Raabe, Manuela Eugster

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 研究能否从单目手术显微镜图像和位姿数据重建神经外科场景的三维几何度量,利用预训练模型估计深度、泊松曲面重建点云成网格,结果显示该方法在模型设置中有技术可行性,支持相关手术技术进一步发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23006 2026-07-28 cs.IR cond-mat.mtrl-sci cs.AI 新提交 57%

VecTree-RAG: An Agentic Retrieval-Augmented Generation Framework Combining Vector and Tree Retrieval for Efficiency and Accuracy

VecTree-RAG:一种结合向量和树检索的智能检索增强生成框架,以提高效率和准确性

Xinyan Zhong, Yuwei Shi, Yuqi Wei, Chen Shen, Tianhang Zhou, Zhenghao Wu

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 研究针对科学问答中识别相关论文及找支持证据的问题,提出VecTree-RAG框架,结合向量与树检索机制。经多组问题评估,该框架在多个基准上获高分,证据页面精度高,且完整架构所需推理令牌少,为科学文献问答提供结构感知且可追溯的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22123 2026-07-27 cs.RO 新提交 57%

DB-VIO: Dual-Branch Visual Inertial Odometry with Enhanced Visual-Inertial Representation

DB-VIO:具有增强视觉惯性表示的双分支视觉惯性里程计

Ziyu Wan, Lin Zhao

机构 * National University of Singapore(新加坡国立大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 研究针对视觉惯性里程计问题,提出DB-VIO双分支框架,通过融入深度线索、姿态先验和解耦姿态估计进行运动特定时间建模,实验表明该方法在自动驾驶和空中机器人基准测试中性能优异,提升了旋转和平移估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21611 2026-07-27 cs.HC cs.AI 新提交 57%

A Systematic Survey on Image Description Techniques for STEM Domains

关于STEM领域图像描述技术的系统综述

Marco Cardia, Letizia Angileri, Marina Buzzi, Giulio Galesi, Barbara Leporini

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 综述20项关于AI描述STEM视觉的研究,关注可及性和人机交互。分析目标视觉类型等多方面内容,指出从静态转向交互式多模态系统,同时存在事实不准确等挑战,最后概述人机交互关键研究方向。

Comments This is the Author's Original Manuscript of an article accepted for publication in International Journal of Human-Computer Interaction, published by Taylor and Francis. The Version of Record is available at DOI 10.1080/10447318.2026.2668031

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21438 2026-07-24 cs.CV 新提交 57%

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

DAPM:从任意高度、俯仰、横滚和视场角进行无人机单目深度估计

Tong Ling, Wenhui Diao, Yingchao Feng, Hanbo Bi, Zhongyan Hou, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 研究针对无人机单目深度估计在多样视角和大尺度深度分布下的难题,提出DAPM模型,通过建立视角定量表示,引入IGD和PQB模块,在UAPD数据集上实验,该模型在深度和相机姿态估计方面达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21043 2026-07-24 cs.RO 新提交 57%

A Real-Time Generalized Nash Equilibrium Framework for Interaction-Aware Autonomous Driving in Mixed Traffic

用于混合交通中交互感知自动驾驶的实时广义纳什均衡框架

Nouhed Naidja, Mohamed-Cherif Rahal, Steve Pechberti, Stéphane Font, Guillaume Sandou, Marc Revilloud

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 针对自动驾驶在混合交通环境中的挑战,提出将驾驶交互建模为广义纳什均衡问题的决策框架,基于粒子群优化提出实时求解器,经实验验证能处理关键场景,求解器操作可行且收敛快。

Journal ref The 12th 2026 International Conference on Control, Decision and Information Technologies (CoDIT 2026), Jul 2026, Bari (Italy), Italy

详情

展开后加载摘要…

URL PDF HTML 收藏