arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 497 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 497 篇

2606.09108 2026-06-09 cs.RO cs.LG 新提交 62%

RAM: Reachability Across Morphologies

RAM: 跨形态可达性

Tim Walter, Xinyu Chen, Jonathan Külz, Matthias Althoff

机构 * Department of Computer Engineering(计算机工程系) German Electron Synchrotron Technical University(德国电子同步加速器技术大学) Technical University Munich(慕尼黑技术大学) University of Hamburg(汉堡大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出一种形态条件隐式神经表示RAM,快速、可微地预测可达性并泛化至未见形态,基于前向运动学生成大规模数据集训练,在纳秒级推理中F1达86%,显著加速形态和轨迹优化。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23468 2026-07-28 cs.CV 新提交 61%

Robust 6-DoF Object Pose Tracking with Built-In Recovery under Occlusions and Rapid Object Motions

在遮挡和快速物体运动情况下具有内置恢复功能的鲁棒6自由度物体姿态跟踪

Balázs Opra, Léo Ghafari, Thomas Stewart, Cyrill Stachniss

机构 * Woven by Toyota, Inc.(丰田编织公司) University of Bonn(波恩大学) University of Bonn, Center for Robotics, and the Lamarr Institute for Machine Learning and Artificial Intelligence(波恩大学机器人中心以及拉玛尔机器学习与人工智能研究所)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.CV

AI总结 针对RGB-D数据中未见物体的6自由度跟踪问题,尤其是遮挡和快速运动场景,提出结合关键点匹配与优化对齐及故障检测恢复模块的方法,在多场景评估中表现出色,是鲁棒6自由度物体跟踪的重要进展。

Comments 8 pages, 4 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05777 2026-07-08 cs.RO 新提交 61%

Observation Quality Matters: Robust Multi-Fisheye Calibration via Failure-Oriented Analysis

观测质量至关重要:通过面向失败的分析实现鲁棒多鱼眼相机校准

Peize Liu, Zhe Tong, Chen Feng, Shaojie Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO

AI总结 研究多鱼眼相机校准难题,通过面向失败分析发现内参初始化是主因,提出CO - Calib框架,结合鲁棒目标检测器和误差分析引导帧选择器,实验表明该框架提升校准成功率、外参精度及校准稳定性。

Comments 9 pages, 7 figures, 6 tables. Code: https://github.com/HKUST-Aerial-Robotics/CO-Calib

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20271 2026-08-21 cs.AI cs.DC 新提交 57%

Catching the Rug: Early Prediction of Fraudulent Memecoins on Solana via Machine Learning

捕获“ rug pull”:基于机器学习的Solana平台欺诈性模因币早期预测

Jianghai Li, Pavel Kuznetsov, Yury Yanovich, Konstantin Nott-Whaley, Igor Vodolazov

机构 * Higher School of Economics(高等经济学院) Moscow State University(莫斯科国立大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本研究针对Solana平台模因币的“ rug pull”欺诈问题,利用XGBoost等经典机器学习模型,基于交易初期5分钟数据实现早期检测,多源数据融合提升了跨平台泛化能力,为投资者提供了保护框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19212 2026-08-21 cs.CL cs.CV 新提交 57%

NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection

NepOOC-M:面向OOC检测的尼泊尔语-英语双语基准及多模态架构的对比分析

Sanjeev Khatiwada

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 针对尼泊尔语OOC虚假信息检测,构建首个尼泊尔语多语言OOC基准NepOOC,评估多模态等架构发现仅文本mBERT性能最优,数据集扩充比架构优化更有效。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18734 2026-08-20 cs.CV 新提交 57%

CL4D: Contrastive Language-4D Pretraining for Vision-Language Reasoning in Dynamic Scenes

CL4D:用于动态场景视觉-语言推理的对比语言-4D预训练

Kumal Hewagamage, Isuranga Senavirathne, Sasika Amarasinghe, Hasitha Gallella, Dulanga Weerakoon, Vigneshwaran Subbaraju, Ranga Rodrigo

机构 * University of Moratuwa(莫拉图瓦大学) Singapore-MIT Alliance for Research & Technology (SMART) Centre(新加坡-麻省理工研究与技术联盟(SMART)中心) Agency for Science, Technology and Research (A*STAR)(新加坡科学、技术与研究局(A*STAR))

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本研究提出CL4D(首个4D视觉编码器)及基于其的4DVLM,在自建DynAction4D数据集上训练,CL4D性能较现有方法提升约16.75%,4DVLM优于Gemini、GPT-5等前沿视频VLM。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18632 2026-08-20 cs.RO 新提交 57%

Evaluation of Monocular SLAM Systems on High-Altitude Nadir UAV Footage

高空天底视角无人机影像下单目SLAM系统的评估

Gašper Spagnolo, Matej Dobrevski, Danijel Skočaj

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 该研究评估5种单目SLAM系统在高空天底视角无人机影像的性能,发现DROID-SLAM表现最优,MASt3R-SLAM水平误差最低,但所有系统垂直位置估计差、大面积轨迹失真,纯视觉单目SLAM不足以可靠应用于航空导航。

Comments 6 pages, submitted to ERK 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18624 2026-08-20 cs.CV 新提交 57%

Evaluation of Image Matching Methods for Visual Odometry on UAVs

无人机视觉里程计的图像匹配方法评估

Gašper Spagnolo, Luka Čehovin Zajc, Matej Dobrevski

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV

AI总结 该研究针对无人机视觉里程计任务,在合成数据集上评估多种图像匹配方法,发现RoMa匹配器性能最优,SIFT特征表现优于部分最新最先进方法,为无人机视觉导航提供参考。

Comments 5 pages, published in the Proceedings of the 33rd International Electrotechnical and Computer Science Conference ERK 2024

Journal ref Proceedings of the 33rd International Electrotechnical and Computer Science Conference ERK 2024, pp. 479-483, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17496 2026-08-19 cs.RO 新提交 57%

Calibrated Predictive Safety for Heterogeneous Robots: An Action-Conditioned JEPA Framework with Model-Based Safety Shields

异构机器人的校准预测安全性:一种带基于模型安全盾的动作条件联合嵌入预测架构(JEPA)框架

Kaiming Zhong, Tianhua Liu, Yue Wang

机构 * Guangdong Bifang Intelligent Control Technology Co., Ltd.(广东毕方智能控制技术有限公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO

AI总结 本研究提出带基于模型安全盾的动作条件JEPA框架,用于异构机器人,可预测候选动作的任务进展与物理风险,在仿真中提升了成功率并降低碰撞漏报率。

Comments 17 pages, 9 figures. Simulation-only empirical results on LIBERO-Long (no real-robot experiments). Source, figure-generation scripts and reproducibility checklist included. Level-3 offline reranking significance test not executed; see Sec. 7 (Scope and honesty statement) for detailed disclosure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16859 2026-08-18 cs.CV 新提交 57%

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

HarnessEval-W:将视觉世界评估智能体化

Weiliang Chen, Haowen Sun, Jun Gao, Jiawei Chi, Hanyang Wang, Qiyu Dai, Yihao Li, Hao Li, Jingnan Gao, Yi-Hsin Hung, Xingzhuo Guo, Shangchen Miao, Zhiyuan Shi, Xiang Li, Fengrui Tian, Weihua Du, Ziqi Huang, Shenyuan Gao, Siqiao Huang, Mingyu Liu, Yifei Li, Shizun Wang, Xi Wang, Tianqi Zhang, Xue Luo, Xiyin Ren, Jinshan Ren, Xiaoyang Shen, Xiaobo Hu, Zhiyang Dou, Mingyu Ding, Yichao Yan, Xinchao Wang, Yizhou Wang, Shilong Liu, Wenzhao Zheng, Yueqi Duan, Yuan Gong, Ziwei Liu, Ming-Yu Liu, Jialong Wu, Jiangran Lyu, Fangfu Liu

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。

Comments Project Page: https://mirros-lab.github.io/HarnessEval-W

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16741 2026-08-18 cs.RO 新提交 57%

Semantic- and Density-Aware Planning for Accessibility-Preserving Multi-Object Placement

面向可访问性保持的多物体放置的语义与密度感知规划

Benno Wingender, Nils Dengler, Nicolas Busch, Sicong Pan, Maren Bennewitz

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 针对在线多物体货架放置场景,提出SDPP方法,结合语义-密度评分与AM,在提升语义放置质量和货架密度的同时,减少可行位姿识别时间,适用于家庭货架存储场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16014 2026-08-18 cs.CV 新提交 57%

Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision

面向机器人视觉的深度引导多视图曝光 bracketing(HDR 成像技术)

Jinnyeong Kim, Juhyung Choi, Woohyeok Kim, Sunghyun Cho, Seung-Hwan Baek

机构 * POSTECH(浦项科技大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 针对多传感器机器人系统 HDR 感知评估基准缺失的问题,构建含真实与合成场景的大规模数据集,提出深度引导多视图曝光 bracketing(DMEB)单帧 HDR 方法,经评估该方法可作为参考基准且具应用潜力。

Comments 14 pages, ECCV 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 57%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交 57%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14490 2026-08-17 cs.AI 新提交 57%

Twin: Playing an Unknown Game with a Test-Time Digital Twin

Twin:利用测试时数字孪生玩未知游戏

Alexy Skoutnev, Kirill Acharya, Gaston Longhitano, Madeleine Udell, Kevin Ellis, Iddo Drori

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。

Comments Project website with action-by-action replays of all 25 runs: https://arc-agi-3-twin.vercel.app/ Code: AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14407 2026-08-17 cs.AI 新提交 57%

The Past and Future of AI Scientists

AI科学家的过去与未来

Ross D. King

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI

AI总结 本文综述AI科学家的过去与未来,指出其核心挑战是多技术集成,现有技术已支持构建更通用系统,其有望变革科学,诺贝尔图灵挑战目标进展超前。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13420 2026-08-14 cs.AI 新提交 57%

Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes

通过小型语言模型(SLMs)与边缘计算增强虚拟智能体:对思考与记忆过程的探索性评估

Aimilios Hadjiliasi, Louis Nisiotis

机构 * University of Central Lancashire(中央兰开夏大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI

AI总结 本文探索利用SLMs与边缘计算支持CEAA的“思考”“记忆”组件,在NVIDIA Jetson Orin NX上用Qwen2.5模型开发边缘虚拟智能体网关,经模拟实验验证其可高效运行部分CEAA过程,助力沉浸式虚拟世界具身智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12476 2026-08-14 cs.AI 新提交 57%

Governed Persistent Memory: Source-Bound State Semantics and Fail-Closed Release for Long-Horizon Agents

受控持久内存:长程智能体的源绑定状态语义与故障关闭式释放

Guodong Xu

机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛果动先生网络科技有限公司)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文针对长程智能体内存的矛盾记录问题,提出受控持久内存(GPM)模型,经多组基准测试与服务评估,其在GPM-ReleaseBench、中英文指令分支等场景均实现零不匹配,修复大量基线故障且无退化。

Comments 23 pages, 2 figures, 11 tables. Includes a sealed end-to-end governed-memory service evaluation with an ungoverned local Qwen2.5-7B comparison

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11790 2026-08-13 cs.LG 新提交 57%

High-Order Liquid Evidence Encoding for Gradual GNSS Spoofing Detection in Autonomous Driving

面向自动驾驶中渐进式GNSS欺骗检测的高阶液体证据编码

Muhammad Ayub Sabir, Junbiao Pang, Fatima Ashraf

机构 * Faculty of Information Technology, Beijing University of Technology(北京工业大学信息学部)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 针对自动驾驶中渐进式GNSS欺骗难检测问题,提出因果高阶液体证据框架,在AV-GPS数据集子集上获最高F1分数,可快速检测正常到攻击的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11692 2026-08-13 cs.AI 新提交 57%

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

HUGIN:增强自主物流分拣的视觉-语言规划能力

Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI

AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11286 2026-08-13 cs.CR cs.LG cs.SY eess.SY 新提交 57%

Benchmarking Cyberattack Detection in Electric Vehicle Charging Infrastructure with Benign User Updates

基于良性用户更新的电动汽车充电基础设施网络攻击检测基准测试

Hannan Chen, Roshni Anna Jacob, Jie Zhang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文构建了保留真实ACN会话的泄漏控制会话级基准,提出双分支Masked-AE转换增强模型,在多类模型对比中实现最强鲁棒验证性能,可检测电动汽车充电基础设施的恶意请求操纵且不拒绝合法用户选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10623 2026-08-12 cs.RO 新提交 57%

When Your State Estimator Has Lost The Plot: Detecting Estimator Failures Via Spectral Analysis

当你的状态估计器“迷失方向”时:通过频谱分析检测估计器故障

Christian Lanegger, Helen Oleynikova, Roland Siegwart, Michael Pantic

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本研究提出一种与传感器无关的频域分析方法,用于检测状态估计器故障,在三类里程计框架中可检测51%-58%的故障,精度达60%-84%,可作为轻量级自省工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09898 2026-08-11 cs.CL cs.LG 新提交 57%

Consilience for Verifier-Free Test-Time Scaling

无验证器的测试时扩展的一致性方法

Lecheng Kong, Like Hui, Haitao Mao, Jun Huan

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG

AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09593 2026-08-11 cs.SD cs.AI 新提交 57%

MADBench: A Benchmark for Modality-Aware Audio Deepfake Detection

MADBench:面向模态感知音频深度伪造检测的基准

Yanqiu Li, Yang Xiao, Jisheng Bai, Bin Chen, Hong Jia, Ting Dang

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09556 2026-08-11 cs.RO cs.SY eess.SY 新提交 57%

TDMA Based Communications Control Co-Design for Cooperative Carrying: Delay Calibration and Sampling-Rate Optimization

基于TDMA的协同搬运通信控制协同设计:时延校准与采样率优化

Zahra Seifaei, Maximilian Luebke, Torsten Reissland, Danial Dehghani, Norman Franchi

机构 * Institute for Smart Electronics and Systems, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学智能电子与系统研究所)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文针对多机器人协同搬运的通信挑战,在MuJoCo仿真中评估三种控制方法,发现动态采样降开销、轮换领导提公平性且不影响搬运能力,为通信受限场景部署协同机器人提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09388 2026-08-11 cs.CV 新提交 57%

Efficient Human-Contact Representation for Human-Scene Interaction

面向人-场景交互的高效人体接触表示

Nghia Vu, Tuong Do, Binh X. Nguyen, Erman Tjiputra, Anh Nguyen

机构 * AIOZ University of Liverpool(利物浦大学) NTHU(国立清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。

Comments Accepted in ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08884 2026-08-11 cs.RO cs.HC 新提交 57%

SHRIMP: Iterative Refinement of Robot Task Plans

SHRIMP:机器人任务计划的迭代优化

Mya Schroder, Yuna Hwang, Callie Y. Kim, Leqian Cheng, Jeffrey Li-cheng Liu, Chenchen Zheng, Xinning He, Bilge Mutlu

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 针对协作机器人任务计划的语义歧义与透明度不足问题,提出SHRIMP系统,可通过自然语言生成分层机器人原语计划并迭代修正,经35人用户研究验证其能提升用户感知控制与机器人透明度。

Comments 11 pages, 8 figures, The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 57%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 机器人数据与评测 :robot policy(abstract);分类 cs.RO

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08070 2026-08-11 cs.RO 新提交 57%

SurgWMBench: A Vision-Based Benchmark for World-Modeling Surgical Instrument Motion Planning

SurgWMBench:面向世界建模的手术器械运动规划视觉基准

Huanrong Liu, Weiliang Huang, Bob Zhang, Weichao Cai, Chunlin Tian, Qingbiao Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO

AI总结 本文提出SurgWMBench,一种面向短程手术运动规划的视觉基准,可评估手术世界模型的器械运动预测与连续回推稳定性,解决现有指标与器械规划需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏