arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 61441 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22164 篇

2607.22721 2026-07-28 cs.CV cs.AI 新提交 73%

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

用于精神分裂症认知康复的交互式视觉语言平台

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) RIIMA Laboratory(RIIMA实验室)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.CV

AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19060 2026-07-22 cs.LG cond-mat.soft cs.AI physics.data-an stat.ML 新提交 73%

Deep learning-based prediction of time-resolved adhesive forces in viscoelastic Hertzian contacts

基于深度学习的粘弹性赫兹接触中时间分辨粘附力预测

Ali Maghami, Merten Stender, Michele Ciavarella, Antonio Papangelo

机构 * Chair of Cyber-Physical Systems in Mechanical Engineering, Technische Universität Berlin(柏林工业大学机械工程系网络物理系统主席) TriboDynamics Lab, Department of Mechanics, Mathematics and Management, Polytechnic University of Bari(巴里理工大学力学、数学与管理系摩擦动力学实验室)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究针对软机器人等领域中快速预测粘弹性接触响应的挑战,训练标量条件、序列到序列的深度学习模型,引入FMS表示,经多种架构训练比较,最佳模型有LSTM架构,能快速预测力轨迹,为数值评估提供替代,可用于控制应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17257 2026-07-21 cs.RO cs.AI 新提交 73%

Asynchronous Multimodal Diffusion Policy Composition via Latency-Aware Guidance Fusion

通过延迟感知引导融合实现异步多模态扩散策略组合

Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu Fang

机构 * Shanghai Jiao Tong University(上海交通大学) Noematrix(无矩阵) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对多模态扩散策略在模态差异下的融合问题,提出LAG - Fusion框架,通过延迟感知引导融合实现异步策略组合,推导参考帧重定位规则,在接触丰富操纵实验中提升了策略响应性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14280 2026-07-17 cs.RO cs.LG 新提交 73%

DiMaS: Distribution Matching for Steering Vision-Language-Action Models

DiMaS:用于引导视觉-语言-动作模型的分布匹配

Pegah Khayatan, Sara Meziane, Jayneel Parekh, Matthieu Cord

机构 * ISIR, Sorbonne Université(法国国家信息与自动化研究所,索邦大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 研究针对基于流匹配的视觉-语言-动作模型细粒度行为控制不足的问题,提出DiMaS分布匹配引导策略,能有效控制行为,研究其泛化性并分析原因,推动了视觉运动设置下的分布匹配设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13049 2026-07-16 cs.AI cs.RO 新提交 73%

SPINE: Bridging the Cyber-Physical Gap with Agentic AI

SPINE:用智能体人工智能弥合网络物理差距

Minkyu Ham, Dongho Kim, Chan Lee, Jiayi Wang, Min Jun Kim, Yixi Zhang, Guo Ye, Jihai Zhao, Soyeon Park, Han Liu

机构 * Northwestern University(西北大学)

专题命中 机器人操作 :robotics(abstract);embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 研究针对机器人智能部署到物理平台存在的校准瓶颈,提出SPINE框架。该框架含两个多智能体工作流程,经实验验证,能跨双臂平台转移,减少对专家校准的依赖,提高操作成功率,缩短遥操作时间,推动具身人工智能向实际部署发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11377 2026-07-14 cs.RO cs.AI 新提交 73%

A Glimpse into Long-term Physical Coexistence with Intelligent Robots

深入了解与智能机器人的长期物理共存

Weiqi Jin, Peijun Tang, Kuncheng Luo, Baifu Huang, Binyan Sun, Haotian Yang, Shangjin Xie, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 机器人操作 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究与智能机器人长期物理共存问题,提出基于机器人网关抽象的多机器人代理PHILIA,解耦代理推理与机器人执行,实现即插即用集成,在Astribot S1机器人上验证架构,展示用例,强调人机交互流程对有效协助的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09825 2026-07-14 cs.RO cs.AI 新提交 73%

More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning

更多结构,而非更多容量:用于视觉运动模仿学习的以对象为中心的表示

Yi Li, Alexandre Chapin, Liming Chen, Jan Peters, Alap Kshirsagar

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究视觉运动模仿学习,对比全局场景嵌入等传统视觉模型,测试以对象为中心的插槽表示,发现其结构优势,如更高成功率,还通过故障分类法分析故障类型,指出遮挡是主要瓶颈,为视觉运动模仿学习提供新方法和见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15753 2026-07-14 cs.RO cs.CV 版本更新 73%

Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

层次化和整体化的开放词汇功能3D场景图用于室内空间

Xinggang Hu, Chenyangguang Zhang, Alexandros Delitzas, Xiangkui Zhang, Marc Pollefeys, Francis Engelmann, Xiangyang Ji

机构 * Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Dalian University of Technology(大连理工大学) Microsoft(微软) Stanford University(斯坦福大学) University of Lugano(卢加诺大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16447 2026-07-10 cs.RO cs.AI 新提交 73%

Training and Evaluating Diffusion Policies with Long Context Lengths

训练和评估具有长上下文长度的扩散策略

Abhinav Agarwal, Adam Wei, Taylan Kargin, Michael Zeng, Cole Becker, Arif Kerem Dayi, Pablo Parrilo, Asuman Ozdaglar, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文首次详细研究模仿学习中上下文长度的影响,发现简单扩展上下文长度并不脆弱,并提出联合训练多上下文长度策略的方法以降低样本复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06740 2026-07-09 cs.RO cs.AI 新提交 73%

A Continual Learning Framework for Adaptive Control of Modular Soft Robots

一种用于模块化软机器人自适应控制的持续学习框架

Nilay Kushawaha, Muhammad Sunny Nazeer, Baljinder Singh Bal, Cecilia Laschi, Egidio Falotico

机构 * The BioRobotics Institute, Scuola Superiore Sant’Anna(生物机器人研究所,圣安娜高等学校) Department of Excellence in Robotics and AI, Scuola Superiore Sant’Anna(机器人与人工智能卓越系,圣安娜高等学校) Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系) ETIS Lab UMR8051 CY Cergy Paris University - ENSEA - CNRS(ETIS实验室UMR8051,CY赛尔吉 - 巴黎大学 - ENSEA - 法国国家科学研究中心)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对模块化软机器人设计控制器的挑战,提出持续学习启发的控制框架,能顺序学习新配置不忘旧知识,可分布式学习特定模块动力学,经实验验证其能适应形态变化并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05468 2026-07-08 cs.RO cs.AI 新提交 73%

Learning 4D Geometric Priors for Inference-Efficient World Action Models

学习用于高效推理世界行动模型的4D几何先验

Jianjun Zhang, Jian Zhu, Taiyi Su, Chong Ma, Zitai Huang, Yi Xu, Hanli Wang

机构 * Midea AI Research Centers(美的人工智能研究中心)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对世界行动模型在捕捉操作所需几何信息不足的问题,提出MECo-WAM模型,通过注入4D几何先验、采用多专家协同训练等方法,在不增加推理成本的情况下提升了机器人操作性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04591 2026-07-07 cs.RO cs.AI 新提交 73%

Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning

用于视觉-语言-动作学习的从简单到复杂的结构化演示

Xinchuan Qiu, Yi Yu

机构 * Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究视觉-语言-动作模型中演示的收集与组织问题,提出用双臂机器人平台的从简单到复杂结构化演示收集策略,依三原则组织数据,提升了学习效率与稳定性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03865 2026-07-07 cs.RO cs.AI 新提交 73%

High-Fidelity One-Step Generative Visuomotor Policy via Recursive Correction, Frequency Consistency, and Contrastive Flow Matching

通过递归校正、频率一致性和对比流匹配实现高保真一步生成视觉运动策略

Yuran Chen, Xinye Cai, Zhonglin Gong, Yang Huang

机构 * School of Safety Science and Engineering, Anhui University of Science and Technology(安徽理工大学安全科学与工程学院) State Key Laboratory of Digital Intelligent Technology for Unmanned Coal Mining, Anhui University of Science and Technology(安徽理工大学煤矿智能开采技术与装备国家重点实验室) School of Artificial Intelligence, Anhui University of Science and Technology(安徽理工大学人工智能学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 研究针对生成模型多步采样有延迟、一步加速方法有偏差等问题,提出含递归校正、频率一致性和对比流匹配三机制的框架,解决相关问题,实验显示该方法在低延迟下性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03449 2026-07-07 cs.RO cs.AI 新提交 73%

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control

HiMe:用于长距离视觉-语言-动作控制的分层具身记忆

Li Ji, Siyin Wang, Pengfang Qian, Xiaopeng Yu, Yihai Tian, Zhaoye Fei, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型处理非马尔可夫任务的不足,提出HiMe分层具身记忆框架,解耦智能为高频执行器等,引入动态知识系统,平衡实时执行与思考规划冲突,提升长距离任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02549 2026-07-07 cs.CV cs.RO 新提交 73%

Learning 3D Affordances for Blade Insertion in Cluttered Stowing

学习在杂乱收纳中进行刀片插入的3D可用空间

Tianyu Li, Harpreet Sawhney, Minju Jung, Aditya Mehrotra, Kunal Mehrotra, Mudit Agrawal

机构 * Amazon Robotics(亚马逊机器人公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究杂乱收纳中刀片插入的3D可用空间问题,利用VulcanVoxel方法,通过基于3D占用场的掩码自动编码器,从单峰数据恢复多模态预测,提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00530 2026-07-02 cs.RO cs.AI 新提交 73%

From Technical Metrics to User Perception: A User Study of a Multimodal Human-Robot Interaction System for Object Detection and Grasping

从技术指标到用户感知:面向物体检测与抓取的多模态人机交互系统用户研究

Jian Song, Tian Zi, Shen Guanting

机构 * Dalian University of Technology(大连理工大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 通过24名用户的受试内实验,验证了端到端任务成功率从75%提升至90%的技术改进能显著提升用户对速度、可靠性和整体能力的感知,且70.83%的用户偏好改进系统。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30686 2026-07-01 cs.RO cs.AI 新提交 73%

Position: Vision-Language-Action Models Cannot Be Verified to Perform Physical Reasoning

立场:视觉-语言-动作模型无法被验证执行物理推理

Taozhao Chen, Ian Manchester, Huaming Chen

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文指出基于预训练视觉-语言模型的VLA系统在机器人操作基准上的性能提升无法区分语义匹配与物理泛化,现有评估指标不能验证物理推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07100 2026-07-01 cs.CV cs.RO 新提交 73%

LARA: Latent Action Representation Alignment for Vision-Language-Action Models

LARA: 视觉-语言-动作模型的潜在动作表示对齐

Mengya Liu, Baoxiong Jia, Jiangyong Huang, Jingze Zhang, Siyuan Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出LARA框架,通过表示对齐联合优化潜在动作模型和视觉-语言-动作模型,利用人类视频数据提升机器人操作性能,在模拟和真实基准上平均提升约10%、5%和15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26801 2026-06-26 cs.RO cs.CV 新提交 73%

Improving Vision-Language-Action Model Fine-Tuning with Structured Stage and Keyframe Supervision

通过结构化阶段和关键帧监督改进视觉-语言-动作模型微调

Yuan Xu, Yixiang Chen, Kai Wang, Jiabing Yang, Peiyan Li, Qisen Ma, Yan Huang, Liang Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) New Laboratory of Pattern Recognition (NLPR), State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室(NLPR)多模态人工智能系统国家重点实验室(MAIS)) FiveAges

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出StaKe框架,通过从演示中自动提取阶段分类器和关键帧预测器作为辅助监督,提升VLA模型在长时域操作任务中的微调效果,成功率相对提升14%-56%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26700 2026-06-26 cs.RO cs.AI 新提交 73%

Learning Motion Feasibility from Point Clouds in Cluttered Environments

从杂乱环境中的点云学习运动可行性

Sajid Ansari, Arthi, Girish Varma, Antony Thomas

机构 * International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出直接从RGB-D观测学习7自由度机械臂运动可行性预测的方法,构建包含270万抓取可行性标签的大规模基准,并评估三种分类器架构,最佳模型GRASPFC-PTX在新型物体上AUROC达0.996且预测速度远超基于采样的运动规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25953 2026-06-25 cs.RO cs.CV 新提交 73%

DSP-SLAM++: A Unified Framework for Multi-Class, High-Fidelity Object SLAM in the Wild

DSP-SLAM++:面向野外多类高保真物体SLAM的统一框架

Ahmad Kourani, Ghina Daoud, Daniel Asmar, Imad Elhajj

机构 * American University of Beirut(贝鲁特美国大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出DSP-SLAM++,通过异步建图流水线和单目鱼眼-激光雷达传感器融合,在支持多类物体的同时实现实时高保真物体建模,将最大物体处理延迟降低70%。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17070 2026-06-24 cs.RO cs.AI 版本更新 73%

MuTRAP: Multi-trigger Trojans Attacking Robot Task Planning Systems

MuTRAP: 攻击机器人任务规划系统的多触发器木马

Mohaiminul Al Nahian, Zainab Altaweel, David Reitano, Sabbir Ahmed, Shiqi Zhang, Adnan Siraj Rakin

机构 * Binghamton University (SUNY)(宾夕法尼亚州立大学布林顿分校)

专题命中 机器人操作 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出首个针对LLM辅助机器人任务规划器的多触发器木马攻击MuTRAP,通过少量任务特定参数注入后门,并优化触发器词以激活特定恶意行为,揭示当前基于LLM的规划器的安全漏洞。

Comments Accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03743 2026-06-23 cs.RO cs.LG 73%

House of Dextra: Cross-embodied Co-design for Dexterous Hands

Dextra之家:为灵巧手的跨具身体验共设计

Kehlani Fay, Darin Anthony Djapri, Anya Zorin, James Clinton, Ali El Lahib, Hao Su, Michael T. Tolley, Sha Yi, Xiaolong Wang

机构 * University of California, San Diego(加州大学圣迭戈分校) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种共设计框架,通过学习任务特定的手形态和互补的灵巧控制策略,实现机器人手的高效设计与控制,可在24小时内完成设计、训练、制造和部署。

Comments Code and videos: https://an-axolotl.github.io/HouseofDextra/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14944 2026-06-23 cs.RO cs.CV 版本更新 73%

HRDexDB: A Paired Human-Robot Dataset for Cross-Embodiment Dexterous Grasping

HRDexDB:用于跨本体灵巧抓取的配对人机数据集

Jongbin Lim, Taeyun Ha, Mingi Choi, Jisoo Kim, Byungjun Kim, Subin Jeon, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD(RLWRLD实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出HRDexDB,一个包含人类和多种机器人手的高保真灵巧抓取轨迹配对数据集,涵盖100种物体,提供高精度时空3D真值,作为跨本体灵巧操作的基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20906 2026-06-23 cs.RO cs.AI 版本更新 73%

DASIP: Dynamic Test-Time Compute Scaling for Robot Control with Stochastic Interpolant Policies

DASIP:基于随机插值策略的机器人控制动态测试时计算缩放

Inkook Chun, Seungjae Lee, Michael S. Albergo, Saining Xie, Eric Vanden-Eijnden

机构 * New York University(纽约大学) University of Maryland(马里兰大学) Harvard University(哈佛大学) Capital Fund Management(资本基金管理公司)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出难度感知随机插值策略(DA-SIP),通过难度分类器动态调整推理步数、求解器和ODE/SDE积分,在保持任务成功率的同时将计算时间减少2.6-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17317 2026-06-17 cs.RO cs.AI math.OC 新提交 73%

Transformer-Based Warm-Starting for Feasible and Optimal Terminal Approach to Tumbling Objects with Space Manipulators

基于Transformer的可行且最优末端接近翻滚目标的空间机械臂热启动方法

Yuji Takubo, Maximilian Adang, Mac Schwager, Simone D'Amico

机构 * Stanford University(斯坦福大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对空间机械臂末端接近翻滚目标的实时轨迹生成问题,提出基于因果Transformer的热启动方法,通过分解规划并热启动姿态-力矩分配阶段,在300个测试场景中减少28%迭代次数和23%运行时间,同时保持控制成本分布。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15768 2026-06-16 cs.RO cs.AI 新提交 73%

LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

LaWAM: 用于高效动力学感知机器人策略的潜在世界行动模型

Jialei Chen, Kai Wang, Kang Chen, Shuaihang Chen, Feng Gao, Wenhao Tang, Zhiyuan Li, Weilin Liu, Zhuyu Yao, Boxun Li, Yuanbo Xu, Chao Yu

机构 * Tsinghua University(清华大学) Jilin University(吉林大学) Nankai University(南开大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Striding.AI Infinigence AI

专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI

AI总结 提出LaWAM模型,通过潜在视觉子目标预测场景变化,实现动力学感知的机器人控制,在多个基准上达到最优或竞争性成功率,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22183 2026-06-16 cs.RO cs.AI 版本更新 73%

Action with Visual Primitives

基于视觉基元的动作生成

Weilong Guo, Yuchen Wang, Renping Zhou, Yunfeng Zhang, Rui Fang, Yuyang Pang, Wenda Xu, Gao Huang

机构 * Anyverse Dynamics Tsinghua University(清华大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出AVP架构,通过视觉语言模型推断下一阶段目标并生成视觉基元令牌,条件化流匹配动作专家,在通用拾放任务中成功率比pi_0.5提升27.61%。

Comments 9 pages, 6 figures. Project page: https://kingdroper.github.io/AVP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05230 2026-06-15 cs.CV cs.RO 版本更新 73%

Digital Twin Driven Textile Classification and Foreign Object Recognition in Automated Sorting Systems

数字孪生驱动的自动化分拣系统中的纺织品分类与异物识别

Serkan Ergun, Tobias Mitterer, Hubert Zangl

机构 * Institute of Smart Systems Technologies(智能系统技术研究所) University of Klagenfurt(克雷格弗特大学) AAU SAL USE Laboratory(AAU SAL USE实验室) Silicon Austria Labs(硅 Austria 实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出一种数字孪生驱动的机器人分拣系统,结合抓取预测、多模态感知和视觉语言模型,实现纺织品分类与异物检测,Qwen模型准确率达87.9%。

Comments 10 pages,single column, 5 figures, preprint for Photomet Edumet 2026 (Klagenfurt, Austria)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11767 2026-06-12 cs.RO cs.AI 新提交 73%

Blind Dexterous Grasping via Real2Sim2Real Tactile Policy Learning

通过真实到仿真到真实触觉策略学习的盲操作灵巧抓取

Shengcheng Luo, Xiyan Huang, Zhe Xu, Wanlin Li, Ziyuan Jiao, Chenxi Xiao

机构 * ShanghaiTech University(上海科技大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出一种结合Real2Sim触觉校准、布局感知触觉编码器和触觉条件扩散策略的框架,实现仅依赖触觉的灵巧手盲抓取,在真实机器人上对20个物体达到27%成功率。

Comments 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏