arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-31 至 2026-08-31 共收录 43 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 12 篇

2608.27497 2026-08-31 cs.RO 新提交 83%

Beyond Relative Geometry: Metric-Aware Geometry Perception for Robotics

超越相对几何:面向机器人的度量感知几何感知

Fengjun Zhong, Congjia Chen, Zhaoxu Liu, Jinyang Du, Yuchen Gong, Enqi Mao, Ruihao Gong, ShuJie Wang, Xianglong Liu, Zhongliang Qiao

机构 * Beihang University(北京航空航天大学) XiaoyuBot(小宇机器人)

专题命中 机器人操作 :robotics(title);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 该研究针对现有机器人几何感知仅能重建任意尺度相对几何的局限,提出端到端即插即用框架MAGP,在保持相对几何精度的同时大幅降低绝对误差,集成后可显著提升多个机器人策略的性能。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28075 2026-08-31 cs.RO 新提交 79%

Plan Along the Way: Event-Triggered Foundation-Model Planning for TAMP Execution in Partially Observable Manipulation

动态规划:部分可观测操纵任务中用于TAMP执行的事件触发式基础模型规划

Puru Ojha, Narendhiran Vijayakumar, Nav Singhal, Girish Varma, Antony Thomas

机构 * Robotics Research Center, IIIT Hyderabad(IIIT海得拉巴机器人研究中心) Center for Security, Theory and Algorithmic Research, IIIT Hyderabad(IIIT海得拉巴安全、理论与算法研究中心)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文提出ROBUST TAMP框架,针对部分可观测操纵任务,通过事件触发式重规划机制提升TAMP执行的任务成功率,验证了其在6个RLBench/CoppeliaSim场景中的有效性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28578 2026-08-31 cs.RO cs.AI cs.LG 新提交 78%

Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning

Aero Hand Open:一种适用于灵巧操作学习的可仿真肌腱驱动手

Nan Wang, Mohit Yadav, Jonathan Wulff, Aidan Rosenbaum, Kezhou Chen, Yuvan Sharma, Xu Dong, Yiwei Tao

机构 * Chestnut Robotics(栗智机器人) California Institute of Technology(加州理工学院)

专题命中 机器人操作 :manipulation(title);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出Aero Hand Open这款仿真就绪的肌腱驱动拟人化手,配套仿真模型、驱动映射与强化学习包,可实现策略在仿真中训练后直接部署到实体手,无需微调与状态估计,并发布了相关全套资源。

Comments 20 pages, 9 figures. Project page: this https URL (https://tetheria.github.io/aero-hand-open/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28570 2026-08-31 cs.RO 新提交 70%

ChainSplat: A Physics-Inspired Screw-Theoretic Model for Learning Deformable Linear Object Dynamics from Multi-View RGB Videos

ChainSplat:一种基于物理的螺旋理论模型,用于从多视角RGB视频中学习可变形线性物体的动力学

Seungyeon Kim, Noémie Jaquier

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ChainSplat是一种物理启发式框架,仅从多视角RGB视频中联合学习可变形线性物体的3D几何、外观、运动学和动力学,在相关任务上达SOTA性能,支持实时估计与轨迹优化,具实用价值。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27726 2026-08-31 cs.RO 新提交 70%

Coordinated Motion Planning for Multi-Arm Systems via Iterative LQ Games

基于迭代LQ博弈的多机械臂系统协调运动规划

Junyoung Kim, Hanwen Ren, Lei Zhang, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出迭代LQ博弈框架用于多机械臂协调运动规划,通过可微碰撞惩罚生成安全高效轨迹,性能优于传统方法,凸显微分博弈在多机器人操作中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28246 2026-08-31 cs.RO cs.AI 新提交 62%

Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring

基于视觉语言模型与几何表面评分的免训练变形无菌纸箱吸盘抓取检测

Marin Maletic, Goran Vasiljevic

机构 * University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院)

专题命中 机器人操作 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对可回收废物机器人分拣的挑战,提出一种免训练的变形无菌纸箱吸盘抓取系统,结合视觉语言模型、SAM2与几何表面评分方法,在真实机器人实验中取得了良好的抓取与检索效果。

Comments 6 pages, ICCAS 2026 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28302 2026-08-31 cs.CV 新提交 57%

FUSED: Forensic-Semantic Mixture-of-Experts for AI Inpainting Detection and Localization

FUSED:面向AI图像修复检测与定位的取证语义混合专家模型

Anton Nuzhdin, Marcel Worring, Ivona Najdenkoska

机构 * Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学研究所)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 针对AI图像修复检测与定位的分布偏移问题,提出FUSED框架,结合取证线索与语义特征,在跨生成器基准上实现最优检测与定位,迁移性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28228 2026-08-31 cs.AI cs.CY cs.HC 新提交 57%

Generative AI Alignment with Hinduism's Theological Plurality and Sacred Representation

结合印度教神学多元性与神圣表征的生成式AI对齐

Dipto Das, Arpita Kundu, Nusrat Jahan Mim, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Khulna University of Engineering & Technology(库尔纳工程技术大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 该研究以孟加拉国印度教用户的15次半结构化访谈为基础,探讨生成式AI在宗教领域的应用,指出其兼具便捷性与伦理隐患,提出生成式AI的宗教对齐需实现解释性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27562 2026-08-31 cs.CV 新提交 57%

VidParse: Online Parsing of Egocentric Procedures Like a Pro

VidParse:像专业人员一样在线解析第一人称视角流程

Anubhav Gupta, Archit Kambhamettu, Vatsal Agarwal, Pulkit Kumar, Abhinav Shrivastava

机构 * University of Maryland(马里兰大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 VidParse是一种无需训练的在线框架,通过图约束推理处理第一人称视角视频的流程解析,在复杂多步骤解析精度上较基线提升最高达10倍。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27492 2026-08-31 cs.CR cs.CV 新提交 57%

Can Tainted Pixels Expose Deepfake Videos?

被污染的像素能否揭露深度伪造视频?

Juan Hu, Shaojing Fan, Sanjay Saha, Marc Herrera, Terence Sim

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出主动视频保护方法TaintedPixels,通过在人脸视频蓝色通道注入扰动,可抵御黑盒操纵工具,实验显示其能提升伪造识别率,验证了主动防御的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28351 2026-08-31 cs.CR eess.SP 新提交 50%

False-CSI Attacks in Power-Domain NOMA for 6G: A Threat Taxonomy and System-Level Impacts

面向6G的功率域NOMA中的虚假CSI攻击:威胁分类与系统级影响

Samira Jafarli, Aysha Ebrahim, Suleyman Uludag

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究针对6G功率域NOMA的虚假CSI攻击构建分类法,分析其系统级影响,指出需将其视为控制输入完整性问题而非仅信道估计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28143 2026-08-31 cond-mat.mtrl-sci 新提交 50%

Light-induced atomic motion in ionic crystals

离子晶体中的光诱导原子运动

Jacob C. Warming, Simon P. S. Jessen, Emma A. Husted, Jan Thøgersen, Stefan Gundacker, Brian Julsgaard, Peter Balling, Rosana M. Turtos

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出离子晶体中原子位移的光激发新机制,以BaF₂为例实现光控缺陷演化,可提高STE信号产额,在电离辐射探测中具应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 14 篇

2608.28279 2026-08-31 cs.RO 新提交 83%

STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation

STEGNav:面向多模态终身目标导航的时空事件图推理

Yang Chen, Zhenyu Huang, Wenbo Fu, Danyang Peng, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对现有多模态终身导航方法的局限,本文提出无训练框架STEGNav,通过时空事件图的双轴设计优化导航性能,在多个基准数据集上取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28518 2026-08-31 cs.AI cs.CL cs.RO 新提交 81%

When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI

当机器人误听我们时:映射语音控制具身人工智能的安全风险

Sihan Jia, Oliver Lemon

专题命中 具身导航 :embodied AI(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究探讨ASR错误对语音控制具身AI安全性的影响,发现其会导致有害指令被执行,部分错误会削弱模型弃权行为,自动修正并非总能降低风险,揭示了ASR错误带来的显著安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28437 2026-08-31 eess.SY cs.RO 新提交 79%

LUCID: An Agentic AI Framework on Digital-Twin in the Loop for QoS-Guaranteeing Robotic Control

LUCID:一种用于QoS保障机器人控制的闭环数字孪生智能体AI框架

Hyeonsu Lyu, Minwoo Kim, Sehyun Ryu, Hyun Jong Yang

专题命中 具身导航 :robotic(title);robotics(abstract);分类 cs.RO

AI总结 LUCID是一种LLM智能体编排的云机器人框架,将TP-RRM动态编排于DITL环境,结合路径规划与RRM验证器,可适应动态条件并降低规划延迟,保障机器人控制的QoS。

Comments 10 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27793 2026-08-31 cs.RO 新提交 79%

CAVE-NAV: VLM-Based Autonomous 3D Navigation in Underwater Cave Environments

CAVE-NAV:基于VLM的水下洞穴环境自主三维导航

Zhenqi Wu, Yuanjie Lu, Yisheng Zhang, Miao Yu, Xuesu Xiao, Jaejeong Shin, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学) George Mason University(乔治梅森大学) University of Maryland(马里兰大学) Seoul National University(首尔大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 该研究针对水下洞穴导航的传统方法局限,提出带CoT推理的VLM导航框架,经仿真验证可完成无碰撞的端到端三维洞穴导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27584 2026-08-31 cs.CV cs.AI 新提交 79%

Quanta Perception as Probabilistic Events

作为概率事件的量子感知

Varun Sundar, Pavan Thodima, Sacha Jungerman, Mohit Gupta

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 具身导航 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出概率事件计算原语,通过递归贝叶斯推理将单个光子检测转化为低延迟信号,实现极端环境下的量子感知,其输出速度远超现有基线,连接了量子传感与机器人视觉。

Comments For project webpage, see this https URL (https://wisionlab.com/project/probabilistic-events/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27751 2026-08-31 physics.bio-ph cond-mat.stat-mech nlin.AO 新提交 78%

Noise-robust navigation from an adaptive run-and-tumble policy

抗噪声的自适应跑-翻策略导航

Aniruddha Datta, Shiladitya Banerjee

专题命中 具身导航 :navigation(title,abstract)

AI总结 研究针对噪声信号下的生物体导航问题,提出源于最优性原理的跑-翻策略,该策略自带的方差适应机制可在噪声增大时维持趋化漂移有限,虽会降低安静环境性能,但为抗噪声导航提供了新方案。

Comments 5 pages, 4 figures, 4 supplemental files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27628 2026-08-31 cs.RO 新提交 74%

One year in a forest: Analyzing the challenges of autonomous navigation in subarctic environments

森林中的一年:分析亚北极环境中自主导航的挑战

Matěj Boxan, Nicolas Lauzon, Veronica Vannini, Mathis Turgeon-Roy, François Pomerleau

机构 * Université Laval(拉瓦尔大学)

专题命中 具身导航 :navigation(title);分类 cs.RO

AI总结 本文通过对亚北极北方森林中移动机器人为期一年的部署试验,评估了9种导航方法的性能,发现环境变化会阻碍现有技术,激光雷达跨季节定位表现优于雷达和视觉,还总结了相关挑战与经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27476 2026-08-31 cs.AI 新提交 70%

Class-Based Heuristic Selection for Solving the Flying Block Puzzle

求解飞行方块谜题的基于类的启发式选择

Sanyar Ahmadi, Pedram Asadzadeh, Amanj Khorramian

机构 * Faculty of Computer Engineering(计算机工程学院) University of Tehran(德黑兰大学) K. N. Toosi University of Technology(霍加·纳绥尔·丁·图西大学) Department of Electrical and Computer Engineering(电气与计算机工程学院) University of Kurdistan(库尔德斯坦大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.AI

AI总结 针对启发式搜索在空间规划中的性能问题,提出CBHA*算法,在146个飞行方块谜题基准实例上大幅提升成功率、减少节点扩展,为高效空间规划提供了可推广的自适应启发式机制。

Comments 27 pages, 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28270 2026-08-31 cs.RO cs.AI 新提交 62%

Spatial-Semantic Reasoning using Large Language Models for Efficient UAV Search Operations

基于大语言模型的空间语义推理用于高效无人机搜索任务

Marin Maletic, Marijana Peti, Tamara Petrovic, Stjepan Bogdan

机构 * University of Zagreb(萨格勒布大学) Faculty of Electrical Engineering and Computing(电气工程与计算机学院) LARICS (Laboratory for Robotics and Intelligent Control Systems)(拉里克机器人与智能控制系统实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 该研究提出基于大语言模型的无人机实时语义导航框架,结合多技术实现高效目标导航,经仿真与真实实验验证可缩短任务时长且保持高搜索准确率。

Comments 8 pages, preprint, Published in: 2025 European Conference on Mobile Robots (ECMR), DOI: https://doi.org/10.1109/ECMR65884.2025.11163229

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28214 2026-08-31 cs.RO 新提交 61%

Probabilistic Multi-Robot Gas Source Localization with Uncalibrated Sensors: A Distributed Estimation Approach

采用未校准传感器的概率多机器人气源定位:一种分布式估计方法

Wanting Jin, Marc Zoel Arias Mitjà, Alcherio Martinoli

机构 * Distributed Intelligent Systems and Algorithms Laboratory(分布式智能系统与算法实验室) School of Architecture, Civil and Environmental Engineering(建筑、土木与环境工程学院) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 具身导航 :robotic(abstract,comments);分类 cs.RO

AI总结 本文针对多机器人异构传感器未校准的气源定位问题,提出分布式概率框架,结合秩特征与专家乘积融合,并引入信息区域分配策略,经仿真验证其性能优于基准方法。

Comments 14 pages, 6 figures, accepted by The 18th International Symposium on Distributed Autonomous Robotic Systems (DARS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28090 2026-08-31 cs.RO 新提交 57%

Stay Seated: Learning Omnidirectional Humanoid Locomotion on a Passive Mobile Chair with Casters

保持坐姿:在带脚轮的被动移动椅上学习全向人形机器人运动

Kango Yanagida, Kazuki Miyazawa, Takato Horii

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学)

专题命中 具身导航 :manipulation(abstract);分类 cs.RO

AI总结 该研究在带脚轮的被动移动椅上学习人形机器人全向坐姿运动,通过改进站立速度跟踪环境训练策略,实现零样本仿真到真实机器人的迁移,其坐姿策略速度跟踪性能优于站立策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27866 2026-08-31 cs.CV 新提交 57%

Iron: Intent-Aligned and Retrospective Dual Learning Framework for Enhancing Generalist Virtual Agents

Iron:用于增强通用虚拟智能体的意图对齐与回溯双学习框架

Jiahe Ying, Wendong Bu, Kaihang Pan, Bingchen Miao, Siyu Chen, Wen Wang, Xueming Jiang, Juncheng Li, Siliang Tang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 具身导航 :embodied AI(abstract);分类 cs.CV

AI总结 Iron是用于训练GUI智能体的意图对齐与回溯双学习框架,通过逐步循环一致奖励和事后回放机制提升性能,在跨环境等任务中优于三倍数据训练的模型,未见过的网页任务获25.06%相对提升。

Comments 11 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28217 2026-08-31 eess.SP 新提交 50%

Beam scheduling policy for communications and PNT services from LEO satellites

用于低轨卫星通信与PNT服务的波束调度策略

Alejandro Gonzalez-Garrido, Francesco Menzione, Ottavio M. Picchi, Carla Amatetti

专题命中 具身导航 :navigation(abstract)

AI总结 本文针对LEO星座通信与PNT服务的波束调度问题,提出两种策略并对比,在通信优先级下评估其PNT可用性,为融合PNT服务提供方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27693 2026-08-31 eess.SP 新提交 50%

Secure Pseudonymetry with DSSS Watermarking for LEO Satellites

用于低轨卫星的采用DSSS水印技术的安全假名机制

Nisanur Camuzcu, Alireza Vahid

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出一种用于LEO卫星的DSSS水印框架,将可恢复假名与密钥认证字段嵌入下行链路,可在多卫星干扰下实现被动检测验证,且对传统接收器透明。

Comments 6 pages, 7 figures. Accepted to the 2026 IEEE Military Communications Conference (MILCOM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 2 篇

2608.28541 2026-08-31 cs.LG cs.AI 新提交 81%

An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Models

闭合模式是一种规范选择:认证代码世界模型中相对于可达性的拓扑结构

Javier Aguilar Martín

机构 * AGILabs

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究探讨认证代码世界模型中相对于可达性的拓扑,通过LLM合成实验得出三条原则,揭示危险与可达性的关联、修复的限制及缓解措施需匹配错误维度方向的结论。

Comments 33 pages, 2 figures. Paper 3 of a series (companion papers: arXiv:2607.14169 (https://arxiv.org/abs/2607.14169), arXiv:2608.17956 (https://arxiv.org/abs/2608.17956) ). Code, data, and Lean formalization: this https URL (https://github.com/JaviMaligno/code-world-models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28491 2026-08-31 cs.AI cs.RO 新提交 76%

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 具身推理 :world model(title);分类 cs.RO、cs.AI

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人基础模型 2 篇

2608.27609 2026-08-31 cs.RO cs.AI 新提交 73%

PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models

PHR-VLA:面向视觉-语言-动作模型的规划视界推理

Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang, Bihao Zhang, Xiao Liang, Yu She, Minghui Zheng

机构 * Texas A&M University(德克萨斯农工大学) Purdue University(普渡大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有视觉-语言-动作模型缺乏未来任务动态推理机制的问题,提出PHR-VLA框架,通过辅助未来头对齐潜在动态,提升了机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28108 2026-08-31 cs.RO cs.CV 新提交 62%

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA:在单一视觉-语言-动作模型(VLA)中统一基于语言和指示手势的指令模式

Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出DeicticVLA,将三种指令模式统一于单一VLA,经仿真与真实任务验证,其在未见场景和新类别下的表现优于仅用语言指令的模型,为相关设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏