arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8686 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8686 篇

2608.07905 2026-08-11 cs.AI cs.RO 新提交 62%

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

GraphThink:用于长视距具身任务规划的图增强大语言模型思维

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23755 2026-08-11 cs.CV cs.RO 交叉投稿 62%

DAP-Pose: Deep Temporal Alignment and Physics-aware Cross-modal Sensor Fusion for Robust Pose Estimation

DAP-Pose:用于鲁棒姿态估计的深度时间对齐和物理感知跨模态传感器融合

Jianhan Lin, Yuchu Qin, Jiateng Yuan, Wenbo Zhang, Shuai Gao

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) International Research Center of Big Data for Sustainable Development Goals(可持续发展大数据国际研究中心) University of Chinese Academy of Sciences(中国科学院大学) The University of Adelaide(阿德莱德大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对复杂环境下多模态传感器的姿态估计问题,提出DAP-Pose模型,通过双级跨模态融合模块捕捉线索,深度时间对齐模块处理异步流,结合物理感知约束,在KITTI数据集上达最优性能,平均平移误差1.31%,旋转误差0.46°,严重错位下也能准确估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19517 2026-08-11 cs.LG cs.AI 版本更新 62%

Automating Deception: Scalable Multi-Turn LLM Jailbreaks

自动化欺骗:可扩展的多轮LLM欺骗攻击

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(埃弗格林谷学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07018 2026-08-10 eess.IV cs.CV cs.LG 新提交 62%

IceHorizon: A Dataset for Horizon Detection in Ice-Covered Maritime Environments and Comparative Evaluation of Detection Methods

IceHorizon:冰盖海域环境中地平线检测的数据集及检测方法的对比评估

Alisa Pesotskaia, Emin Zerman

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV、cs.LG

AI总结 本文构建了IceHorizon数据集,对比评估六种地平线检测算法,发现混合方法准确率最高,且船舶图像检测性能优于无人机图像,相关资源已公开供后续研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06122 2026-08-10 cs.LG cs.AI 版本更新 62%

Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?

Omar Coser, Antonio Orvieto, Paolo Soda, Loredana Zollo

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。

Comments 21 pages, 7 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13108 2026-08-10 cs.RO cs.CV eess.IV 版本更新 62%

Panoramic Multimodal Semantic Occupancy Prediction for Quadruped Robots

四足机器人全景多模态语义占用预测

Guoqiang Zhao, Zhe Yang, Sheng Wu, Fei Teng, Mengfei Duan, Yuanfan Zheng, Kai Luo, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出PanoMMOcc数据集和VoxelHound框架,通过垂直抖动补偿和多模态信息融合提升四足机器人全景多模态3D感知性能。

Comments The dataset and code will be publicly released at https://github.com/SXDR/PanoMMOcc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04398 2026-08-06 cs.RO cs.AI 新提交 62%

Approximate Multi-Objective Search Under Rulebooks

规则手册下的近似多目标搜索

Omar Muhammetkulyyev, Oren Salzman, Tichakorn Wongpiromsarn

机构 * Iowa State University(爱荷华州立大学) Technion - Israel Institute of Technology(以色列理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对机器人规划中规则手册下多目标最优解计算成本高的问题,提出RA*pex算法,结合降维与规则层次处理,大幅提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02150 2026-08-06 cs.CV cs.AI 版本更新 62%

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

PhyCheck:面向视频大语言模型的物理规律理解细粒度证据驱动数据集

Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin

机构 * Zhejiang University(浙江大学) ZJU-Hangzhou Global Scientific and Technological Innovation Center(浙江大学杭州国际科技创新中心) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出PhyCheck数据集,通过粗粒度、细粒度及诊断子集提升视频大语言模型的物理规律理解,实验证实其训练效果,同时指出当前模型难以整合因果条件的问题。

Comments 15pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25073 2026-08-06 cs.CR cs.AI cs.LG 62%

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向

Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

机构 * Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) The University of Melbourne(墨尔本大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。

Comments 39 pages, 7 figures, 22 tables

Journal ref Software: Practice and Experience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14006 2026-08-06 cs.CV cs.RO 版本更新 62%

ResPlan: A Large-Scale Vector-Graph Dataset of 17,000 Residential Floor Plans

ResPlan:包含17000张住宅平面图的大规模矢量图数据集

Mohamed Abouagour, Eleftherios Garyfallidis

机构 * Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 ResPlan是含17000张住宅平面图的矢量图数据集,具备功能空间标注与四类图边,相比RPLAN、MSD有更高质量单元布局,含相关代码与三个基准任务基线,可公开获取。

Comments 11 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2008.08454 2026-08-06 cs.CV cs.RO 62%

Exploring the Impacts from Datasets to Monocular Depth Estimation (MDE) Models with MineNavi

Xiangtong Wang, Binbin Liang, Menglong Yang, Wei Li

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

Comments 6 pages,10 figures

Journal ref Wang X, Liang B, Yang M, et al. What makes the unsupervised monocular depth estimation (UMDE) model training better[J]. Scientific Reports, 2022, 12(1): 21999

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03296 2026-08-05 cs.RO cs.CV 新提交 62%

PLS-Calib: A Partial Least Squares Framework for Event Camera and Odometry Calibration under Ground Motion Constraints

PLS-Calib:一种在地面运动约束下用于事件相机与里程计校准的偏最小二乘框架

Guangyu Li, Xiao Li, Yujie Wu, Changshuo Wang, Prayag Tiwari, Jiang Cai, Fangwen Yu, Mingkun Xu

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对地面约束机器人的传感器校准难题,提出PLS-Calib框架,利用PLS回归建模传感器流相关性,结合极性感知事件表示,在合成与真实数据集上验证其校准鲁棒性和精度优于现有最优方法。

Comments 8 pages, 10 figures, 4 tables. Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03198 2026-08-05 cs.CV cs.RO 新提交 62%

Bridging Online and Offline Handwriting via Differentiable Physical Rendering

通过可微物理渲染连接在线与离线手写文字

Seonmi Park, Seunghyun Shin, Vihaan Misra, Dongmin Shin, Ukcheol Shin, Jean Oh, Hae-Gon Jeon

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出统一在线-离线手写生成框架,通过物理画笔模型与可微渲染模块解决两类手写生成范式的缺陷,经实验验证实现了结构与视觉保真度。

Comments Accepted at ECCV 2026, Project page: https://seonmip.github.io/onoff

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15673 2026-08-05 cs.AI cs.LG 版本更新 62%

Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking

哪里出错了?基于语义状态追踪的Web智能体过程级评估

Jiwan Chung, JiHyuk Byun, Vibhav Vineet, Seon Joo Kim

机构 * Yonsei University(延世大学) Microsoft Research(微软研究院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出WebStep基准,通过语义MDP追踪过程状态,揭示隐藏于终端成功率下的智能体差异,并定位具体改进方向。

Journal ref COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02270 2026-08-04 cs.RO cs.AI 新提交 62%

TS-MAMP: A Remanufactured Agricultural Robot Powered by Second-Life EV Components and NMS-Free On-Device Weed Detection

TS-MAMP:基于退役电动汽车部件和无NMS设备端杂草检测的再制造农业机器人

Weijie Shi, Zicheng Xu, Zhenbang Cheng, Haoran Xuan, Mingbo Duan, Gan Ge

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究基于退役电动汽车部件开发了平价再制造农业机器人TS-MAMP,采用无NMS的YOLOv10n检测器实现设备端杂草检测,为小农户提供了低成本AI农业自动化方案。

Comments 6 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交 62%

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01402 2026-08-04 cs.RO cs.AI 新提交 62%

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

揭秘视觉-语言-动作模型在接触丰富任务中的失效时机、原因及修复方法

Carlota Parés-Morlans, Nils Kuhn, Isabel Liu, Alberta Longhini, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 该研究揭示视觉-语言-动作模型在接触丰富操纵任务中的两种失效模式,提出针对性机制整合而成的FACT模型,在5项任务上平均成功率达66%,优于现有基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01129 2026-08-04 cs.RO cs.CV 新提交 62%

FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity

FeDepth:面向机器人异构性的深度估计联邦学习

Ganghyeon Lee, Inha Lee, Junhee Lee, Jeongeon Lee, Sung Whan Yoon, Kyungdon Joo

机构 * Ulsan National Institute of Science and Technology (UNIST)(蔚山科学技术院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人感知深度估计中联邦学习因客户端异构性导致性能下降的问题,本文提出FeDepth框架,通过软聚类建模客户端关系,在多架构上提升了联邦学习的鲁棒性。

Comments Accepted at ECCV 2026. Ganghyeon Lee and Inha Lee contributed equally. Kyungdon Joo is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08340 2026-08-04 cs.CV cs.AI 版本更新 62%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29596 2026-08-03 cs.RO cs.CV 新提交 62%

FibVLA: An Efficient Temporal Vision-Language-Action Model with Fibonacci Sampling

FibVLA:一种采用斐波那契采样的高效时序视觉-语言-动作模型

Li Lin, Wujun Xu, Weiwei Meng, Kaiwen Xia, Kang Hao Cheong, Shuai Wang

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出FibVLA框架,通过对数事后采样和流匹配等技术,解决了视觉-语言-动作模型时序信息捕捉与推理效率的矛盾,提升了动作性能与实时响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27690 2026-08-03 cs.RO cs.AI 版本更新 62%

LabEvolver: Training-Free Experience Evolution for Safe and Grounded Wet-Lab Agents

LabEvolver:面向安全且务实的湿实验室智能体的无训练经验演化框架

Jingya Wang, Yuyang Gao, Liuzhenghao Lv, Yonghong Tian, Yuyang Liu

机构 * School of AI for Science, Peking University(北京大学AI科学学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Computer Science, Peking University(北京大学计算机学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 LabEvolver是无训练框架,通过内外部循环为湿实验室智能体配备情景记忆,在溶液制备任务中提升效率与安全性,在ALFWorld中也提升了连续任务成功率,支持闭环自动化科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22174 2026-08-03 cs.RO cs.LG 版本更新 62%

ASVSim (AirSim for Surface Vehicles): A High-Fidelity Simulation Framework for Autonomous Surface Vehicle Research

ASVSim(面向水面车辆的AirSim):面向自主水面车辆研究的高保真仿真框架

Bavo Lesy, Siemen Herremans, Robin Kerstens, Jan Steckel, Walter Daems, Siegfried Mercelis, Ali Anwar

机构 * IDLab, Faculty of Applied Engineering, University of Antwerp - imec(ID实验室,应用工程学院,安特卫普大学 - imec) Cosys-Lab, Faculty of Applied Engineering, University of Antwerp(Cosys实验室,应用工程学院,安特卫普大学) Flanders Make Strategic Research Centre(弗拉芒制造战略研究中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出ASVSim,一个用于自主水面车辆研究的开源高保真仿真框架,结合船舶动力学与海洋传感器模拟,支持生成合成数据集用于训练计算机视觉模型和强化学习代理,通过水道分割和自主导航实验验证其能力。

Comments 18 Pages, 13 Figures. Accepted at IEEE ACCESS

Journal ref IEEE Access, vol. 14, pp. 63803-63820, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27597 2026-07-31 cs.RO cs.AI cs.SY eess.SY 新提交 62%

A Systems Engineering Framework for Vision-Language-Enabled UAV Triage and Disaster Response

面向视觉语言赋能的无人机分类与灾害响应的系统工程框架

Swapnil Saha, Bhuvan Rajanasiriyur Jagadeesha, Karishma Patnaik, Neelakshi Majumdar

机构 * University of Arkansas(阿肯色大学) University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。

Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum

Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.06320 2026-07-29 cs.CV cs.LG eess.IV 版本更新 62%

A2D2: Audi Autonomous Driving Dataset

A2D2:奥迪自动驾驶数据集

Jakob Geyer, Yohannes Kassahun, Mentar Mahmudi, Xavier Ricou, Rupesh Durgesh, Andrew S. Chung, Lorenz Hauswald, Viet Hoang Pham, Maximilian Mühlegg, Sebastian Dorn, Tiffany Fernandez, Martin Jänicke, Sudesh Mirashi, Chiragkumar Savani, Martin Sturm, Oleksandr Vorobiov, Martin Oelker, Sebastian Garreis, Peter Schuberth

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV、cs.LG

AI总结 为加速机器学习等领域研究,发布奥迪自动驾驶数据集A2D2,含同步图像与3D点云等,有多种注释,传感器全方位覆盖,数据经同步配准,还提供大量未标注序列,按许可可商业使用,数据等信息可在指定网址获取。

Comments https://a2d2-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22789 2026-07-28 eess.IV cs.CV cs.RO 新提交 62%

Learning-based Hierarchical Tracheal Anatomy Understanding from Sparse Surgical Demonstration Annotations for Ultrasound Robots

基于稀疏手术演示标注的超声机器人气管解剖结构分层学习理解

Hiu Ching Cheung, Wenchao Yue, Zhengran Han, Mingcong Chen, Guanglin Cao, Hongbin Liu, Hongliang Ren

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对气管切开术定位问题,提出结合YOLOv8n与SAM2的学习框架,经混合训练平衡多方面性能,优于U-Net基线,实现高吞吐量,为机器人辅助气管切开术提供标准化自主手术辅助基础,提升安全性与精度。

Comments 17 pages, 8 figures, accepted at the 2026 International Conference on Cyborg and Bionic Systems (2026ICCBS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24249 2026-07-28 cs.CV cs.RO 新提交 62%

SILICA: Repurposing Diffusion Priors for Joint Glass Segmentation and Depth Estimation

SILICA:将扩散先验用于联合玻璃分割和深度估计

Tarun R, Anuj Verma, Laksh Nanwani, Sourav Garg, K. Madhava Krishna

机构 * Robotics Research Center (RRC), IIIT Hyderabad(海得拉巴国际信息技术研究所机器人研究中心)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV

AI总结 研究透明表面深度估计难题,提出SILICA统一管道,利用文本到图像扩散模型先验联合预测玻璃分割和深度,无需真实世界玻璃深度注释,经实验验证其在不同环境中零样本转移性能出色,优于现有模型。

Comments IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24031 2026-07-28 cs.AI cs.HC cs.RO eess.SP 新提交 62%

A Cyclic Adaptation-Generalization Framework with Uncertainty-Guided Self-Paced Learning for Long-Term Brain-Machine Interfaces

一种用于长期脑机接口的具有不确定性引导自步学习的循环适应-泛化框架

Jiyu Wei, Di Hong, Zhanjie Zhang, Dazhong Rong, Qinming He, Yueming Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 针对侵入性脑机接口因神经漂移面临的长期部署挑战,提出UnSPC框架,通过UnSPL机制协同DA和DG,利用噪声鲁棒排序策略挖掘可靠伪标签样本,引入CycAG策略整合DA和DG,经实验验证其有效性和鲁棒性,为长期BMI控制铺路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23669 2026-07-28 cs.CV cs.RO 新提交 62%

RRTrack: Robust and Recoverable Object 6D Pose Tracking for Dynamic Scenes

RRTrack:用于动态场景的鲁棒且可恢复的物体6D姿态跟踪

Junyue Li, Ye Zheng, Yifan Chen, Zhe Sun, Xuelong Li

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) College of Future Information Technology, Fudan University(复旦大学未来信息技术学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对动态场景中物体6D姿态跟踪难题,提出RRTrack。它采用2D-6D闭环跟踪策略,集成记忆视频对象分割与6D姿态细化,还有双库模板匹配模块。在合成基准和真实世界实验中验证,相比FoundationPose有显著提升,兼具高效与鲁棒性。

Comments 6D Pose Tracking, 10 pages, real-world experiments, training-free

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23565 2026-07-28 cs.RO cs.LG 新提交 62%

Anticipatory Risk-Guided Reinforcement Learning for Safe Flight Through Dynamic Clutter

用于在动态杂波中安全飞行的预期风险引导强化学习

Yuchao Mei, Guohao Zhang, Luxia Ai, Haopeng Chen, Wenbing Tao

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.LG

AI总结 研究在动态杂波中四旋翼安全飞行问题,提出预期风险引导强化学习框架,利用特权模拟器状态构建风险地图,通过非对称架构训练网络自我预测风险,结合轻量级编码器提取线索,实验证明该方法有效提高安全裕度和飞行效率,且能实现模拟到现实的零样本转移。

Comments 8 pages, 7 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22702 2026-07-28 cs.CV cs.LG 新提交 62%

MIME: Multimodal Interactive Motion Encoder

MIME:多模态交互式运动编码器

Addison Zucek, Prerit Gupta, Kamila Kuatova, Aniket Bera

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV、cs.LG

AI总结 研究针对动画、AR/VR等场景中多人交互的文本-运动表示学习问题,提出多模态交互式运动编码器MIME,通过特定方法捕捉结构并训练,在文本-运动检索任务中表现出色,还能跨数据集支持下游运动生成。

Comments Under review at WACV 2027

详情

展开后加载摘要…

URL PDF HTML 收藏