Unordered Landmark Visual Navigation
无序地标视觉导航
专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
无序地标视觉导航
专题命中 具身导航 :navigation(title,abstract);embodied AI(abstract);分类 cs.RO
AI总结 针对无序图像导航的挑战,本文提出无需时间与里程计先验的ULVN框架,通过整合建图、定位与规划,在仿真和真实场景中性能优于现有最优方法。
Comments ECCV2026 Oral & Spotlight
基于旅游视频先验的面向目标的导航指令生成
机构 * Uni-Ubi AI(优必爱人工智能) ; Zhejiang University(浙江大学) ; Tongji University(同济大学)
专题命中 具身导航 :navigation(title,abstract);分类 cs.CV
AI总结 本研究提出面向目标的视频 grounding 导航指令生成任务VideoNIG,设计两阶段课程学习框架解决该任务,实验表明其可提升指令质量,集成VLN智能体后可实现端到端导航。
AeroDPO:释放具备高保真感知与自动偏好优化的轻量级无人机导航能力
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出AeroDPO,通过高保真感知与自动偏好优化,使20亿参数轻量级无人机导航模型达到70亿参数模型的成功率,同时降低分布外场景碰撞率,成为自主空中智能体新SOTA。
Comments 7 pages, 3 figures, 4 tables
不会发生漂移的AI科学家:四足机器人导航研究循环中的偏好、结构与可证伪发现
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 该研究提出一款基于自研究范式的AI科学家,通过新增实验卡片、专门子智能体和偏好神谕kkanbu的组件,解决自主研究循环漂移问题,在四足机器人导航实验中验证了框架的有效性。
MAESTRO:在具有GUI的对话代理中通过用户偏好适应GUI并引导导航
专题命中 具身导航 :navigation(title,abstract)
AI总结 MAESTRO通过提取用户偏好并指导工作流导航,提升对话代理中GUI的适应性和导航效率,通过实验验证其有效性。
Comments 19 pages, 6 figures, 2 tables. Published at UIST '26. This is the camera-ready version, posted under CC BY 4.0
Journal ref Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), November 2-5, 2026, Detroit, MI, USA
从语义接地到决策优化:面向长 horizon 无人机视觉语言导航的统一框架
机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV
AI总结 本文针对无人机视觉语言导航的现有问题,提出统一语义到决策框架,经实验在AerialVLN和OpenFly基准上达到SOTA性能。
Comments 10 pages, 5 figures. Accepted at ACM Multimedia 2026 (MM '26)
结构化参数环境下用于鲁棒导航策略的课程生成
机构 * Cornell University(康奈尔大学)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.LG
AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。
Comments 22 pages, 5 figures
无人机辅助的无人机-无人车协同积雪覆盖地形自主导航
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV
AI总结 针对积雪覆盖地形传统导航方法失效的问题,提出无人机-无人车协同导航框架,采用定制U-Net、EKF、YOLOv5等技术实现高分割精度与低定位误差,可在遮挡环境中完成自主导航。
CoCoNav:面向人群环境中安全机器人导航的保形控制
机构 * The University of Manchester(曼彻斯特大学) ; Italian Institute of Technology(意大利技术研究院) ; Genisom AI ; University of Warwick(华威大学) ; Newcastle University(纽卡斯尔大学)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.LG
AI总结 本文提出CoCoNav框架,结合在线保形校准与“先松弛再验证”规划器,在人群环境机器人导航中实现了避碰、任务成功与效率的良好平衡。
场域知晓:从导航到黑洞的跨维度几何
机构 * National Engineering Research Center of Robot Visual Perception and Control Technology(机器人视觉感知与控制技术国家工程研究中心)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI
AI总结 该研究提出了由单个因果对比损失训练的连续度量场框架,可跨维度发现几何结构,在机器人导航和黑洞场景中均表现出良好性能,具备零样本泛化能力。
MELLON——面向在线导航的多模态增强型大语言模型
专题命中 具身导航 :navigation(title,abstract);分类 cs.AI
AI总结 针对网页导航智能体现有模型的不足,本文以WebShop为基准,提出MELLON等三项多模态增强方案,训练1个epoch后MELLON任务完成准确率提升9.26%,验证了多模态方法的重要性。
微型机器人导航的分钟级训练
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO
AI总结 本文针对微型机器人DRL导航训练耗时久的问题,提出含全向量化模拟器与TSR奖励框架的学习框架,将训练缩至10分钟内,支持零样本部署,可缩短设计周期、加速部署。
重新思考GUI视觉代理中历史截图的标记剪枝:语义、空间和时间视角
机构 * Sichuan University(四川大学) ; Sun Yat-sen University(中山大学) ; Australian National University(澳大利亚国立大学) ; Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 具身导航 :navigation(title,abstract);分类 cs.CV
AI总结 本文从语义、空间和时间角度研究GUI视觉代理中历史截图的标记剪枝,发现背景区域对界面状态转换有重要价值,随机剪枝在空间结构保留上更有效,且GUI代理具有近期效应,通过分配更多预算给近期截图可降低计算成本而不影响性能。
面向基于粒子群优化(PSO)的集群导航与避障的通信高效数字孪生框架
机构 * University of Kaiserslautern (RPTU)(凯撒斯劳滕大学(RPTU)) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO
AI总结 针对工业集群目标定位的避障与通信难题,提出部署于MEC服务器的DT辅助PSO框架,可减少通信负载、加快收敛,在复杂工业协同探索场景具有应用潜力。
Comments Accepted by IEEE Access
结合通用趋势与个人偏好的城市环境下定制化游客导航
专题命中 具身导航 :navigation(title,abstract)
AI总结 该研究针对游客城市导航难题,推出PATH工具,基于游客频率与POI偏好的启发式规则计算最优路径,经维泰博案例验证,推荐路线获高度好评,可提升城市探索体验。
基于回旋曲线(Clothoid)的横向控制器增强自动驾驶车辆导航
专题命中 具身导航 :navigation(title);分类 cs.RO
AI总结 本研究提出结合自适应预瞄机制的Clothoid横向控制器,通过准反馈算法与超前滤波器提升自动驾驶车辆路径跟踪精度与稳定性,经TruckSim-Simulink联合仿真验证性能显著改善。
Comments Published version. 21 pages. Published in Applied Sciences, 2024
Journal ref Applied Sciences 14(5), 1817 (2024)
Traj-VLN:通过自回归轨迹生成学习像素空间交互
机构 * Southern University of Science and Technology(南方科技大学) ; Peng Cheng National Laboratory(鹏城国家实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 具身导航 :embodied agent(abstract);navigation(abstract);分类 cs.RO、cs.CV
AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。
用于评估心脏介入效率、精度和深度感知潜在提升的增强型实时六自由度扩展现实导管跟踪技术
专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 本研究开发基于XR的实时6-DOF导管跟踪平台,经20名医学生测试,其可使心脏介入操作速度提升超5倍、导管移动距离减约5倍,还能提高精度、降低变异性,优化操作体验。
RoboAtlas:上下文感知主动SLAM
机构 * Mitsubishi Electric Research Laboratories(三菱电机研究实验室) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV
AI总结 提出RoboAtlas框架,通过上下文感知的多臂赌博机平衡几何探索与语义推理,结合3D语义地图OpenRoboVox,在真实环境中实现100%任务成功率,并在GOAT-Bench上以90.6%成功率达到SOTA。
Comments Alexander Schperberg and Shivam K. Panda made equal contribution
图引导的安全扩散器:用于安全扩散规划的拓扑图引导
机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 该研究提出图引导的安全扩散器(G2SD)框架,用高层拓扑图规划器引导低层扩散模型,解决扩散规划器的流形破裂问题,在Maze2D导航等任务中大幅提升无碰撞目标到达率与任务性能。
Comments 18 pages, 2 figures
面向大规模场景重建的结合局部到全局回环检测的多子图隐式神经SLAM
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Carnegie Mellon University(卡内基梅隆大学) ; School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院)
专题命中 具身导航 :robotic(abstract);分类 cs.CV
AI总结 本文提出一种带多子图架构与双层回环检测机制的神经SLAM系统,结合渐进式建图、光流跟踪、局部到全局回环及子图间在线蒸馏算法,在大规模场景重建性能上优于现有最优方法。
EndoMD-SLAM:光学退化下的内窥镜高斯溅射SLAM,具备记忆与静态-瞬态分解能力
机构 * Texas A&M University(德克萨斯农工大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Minnesota(明尼苏达大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 EndoMD-SLAM是针对内窥镜光学退化问题的SLAM框架,通过记忆驱动门控、静态-瞬态分解等机制,在结肠镜检查基准上实现了轨迹误差降低91%、PSNR提升9.9 dB的效果。
Comments Project page: https://endomd-slam.github.io/
基于主动感知的全切片病理图像智能体视觉推理
机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。
Comments 14 pages, 5 figures
SkillsMetric:映射恶意智能体技能静态分析的检测边界
专题命中 具身导航 :manipulation(abstract);分类 cs.AI
AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。
Comments 6 pages, 3 figures, 3 tables
通过信息多视图投影可视化高维图嵌入
机构 * Khoury College of Computer Sciences, Northeastern University(东北大学库里计算机科学学院) ; School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院)
专题命中 具身导航 :navigation(abstract);分类 cs.LG
AI总结 提出在高维空间中嵌入图,并通过可微分的边交叉代理搜索优化美学和可读性指标的二维视角,优于标准布局,并引入交互系统DataFly。
Comments 20 pages, 15 figures
全局-局部注意力分解用于人形感知运动中的地形编码
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司)
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 提出全局-局部注意力分解(GLAD)方法,通过粗到细编码器分离全局地形感知和局部立足点选择,实现人形机器人在稀疏立足点和受限环境中的鲁棒运动。
视角:透视如何影响感知的机器人社交性
机构 * Humanoid Robots Lab, University of Bonn, Germany(波恩大学人形机器人实验室,德国)
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 本文通过VR用户研究,比较全知视角与第一人称视角对机器人轨迹社交性的感知差异,发现全知视角下社交性高的轨迹在近距离第一人称体验中可能更令人不安,而头部点头等社交信号可提升感知社交性。
LineGraph2Road:基于线路图的结构图推理用于道路网络提取
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 LineGraph2Road通过构建全局稀疏欧几里得图并应用图变换器,提升道路网络提取的连通性预测,解决长距离依赖和复杂拓扑问题,实现高精度道路提取。
CLEAR: 一种用于大规模无结构环境的语义-几何地形抽象
机构 * Department of Computer Science and Engineering, University at Buffalo(计算机科学与工程系,布法罗大学) ; Department of Mechanical and Aerospace Engineering, University at Buffalo(机械与航空航天工程系,布法罗大学)
专题命中 具身导航 :navigation(abstract);分类 cs.RO
AI总结 CLEAR通过结合边界感知的空间分解与递归平面拟合,实现了大规模无结构环境中的高效地形抽象,提高了路径规划的速度和可靠性。
Comments Accepted in IEEE RA-L August, 2026
ITO:通过意图检测实现实时浏览器标签编排
专题命中 具身导航 :navigation(abstract)
AI总结 研究针对浏览器标签组织同步性差的问题,提出混合主动方法Ito,通过实时意图检测生成动态Flows,经实验验证可提升任务管理效率并减轻负担。