Self-supervised 6D Object Pose Estimation for Robot Manipulation
专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)
Comments Accepted to International Conference on Robotics and Automation (ICRA), 2020
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)
Comments Accepted to International Conference on Robotics and Automation (ICRA), 2020
专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)
Comments Camera-ready version for the International Symposium on Medical Robotics (ISMR) 2020
专题命中 机器人操作 :manipulation(title);分类 cs.RO;robotics(comments)
Comments Accepted in IEEE International Conference on Robotics and Automation (ICRA), Montreal, Canada, 2019. arXiv admin note: text overlap with arXiv:1905.04531
专题命中 机器人操作 :robotic(title);分类 cs.RO;robotics(comments)
Comments Robotics: Science and Systems (RSS), 2018. Code: http://github.com/dougsm/ggcnn Video: http://www.youtube.com/watch?v=7nOoxuGEcxA
迭代抓取位姿优化:一种面向二维视觉的深度强化学习方法
机构 * University of Tehran(德黑兰大学)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本研究提出结合关键点表征与DQN的强化学习框架,通过迭代优化抓取位姿,在Dex-Net数据集300个物体上对几何判定不可抓取物体实现100%成功率,且可实现仿真到真实的迁移,为接触丰富的操作任务提供解决方案。
LoopVLA: 在视觉-语言-动作模型中学习充分性
机构 * Huazhong University of Science and Technology(华中科技大学) ; Wuhan United Imaging Surgical Co.,Ltd. (UIS)(武汉联影 surgical 公司)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 LoopVLA通过递归学习实现表示细化、动作预测和充分性估计,减少计算并提升效率,实验表明其在精度和性能上优于现有方法。
FACT:面向世界-动作模型的故障感知因果训练方法
机构 * University of California San Diego(加州大学圣迭戈分校)
专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 FACT是一种故障感知因果世界-动作模型,通过将错误动作转化为训练目标,在模拟与真实双臂操作任务中提升了世界-动作模型的性能,减少了成功偏差导致的未来幻觉。
VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架
机构 * Li Auto Inc.(理想汽车) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。
不变的触觉表示
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出一种新的方法,用于提取传感器不变的触觉表示,以实现跨光学触觉传感器的零样本迁移。通过基于变压器的架构训练多样化的模拟传感器数据集,实现对新传感器的最小校准泛化。实验结果展示了该方法在多种触觉传感应用中的有效性。
Comments Accepted to ICLR'25. Project webpage: https://hgupt3.github.io/sitr/
Journal ref International Conference on Learning Representations (ICLR), 2025
3D-DLP:自监督3D物体中心场景表示学习
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 提出3D-DLP模型,通过自监督学习将场景级RGB-D或体素观测分解为3D潜在粒子,每个粒子编码解耦属性,实现可解释的逐粒子分割图,并支持场景操控和下游机器人操作。
Comments ICML 2026. Project webpage: https://eubooks3003.github.io/3d-dlp
通过视觉和触觉进行推理时策略引导
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。
边界框作为目标:通过神经符号规划实现语言条件抓取
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出GRASP框架,利用预训练VLM将自然语言查询转化为神经符号目标状态,通过边界框检测实现零样本桌面操作,无需任务特定训练。
Comments Project website: https://allisonandreyev.github.io/grasp.github.io/
使远见可操作:在世界动作模型中重新利用表示对齐
机构 * The University of Hong Kong(香港大学) ; XPENG Robotics(小鹏机器人)
专题命中 机器人操作 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。
灵巧点策略:从人类演示中学习基于点的灵巧手策略
机构 * KAIST(韩国科学技术院)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。
基于事件的光学触觉传感器的稠密力估计
机构 * Sony Advanced Visual Sensing, Zurich, Switzerland(索尼高级视觉传感公司,苏黎世,瑞士) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 提出首个利用事件相机重建稠密3D力场的方法,通过事件数据估计表面位移并映射为力,平均误差(0.14N,0.10N,0.93N),工作频率100Hz。
双优势场
机构 * NUST MISIS(努斯大学材料科学与工程学院) ; MSU(莫斯科大学) ; Computational Imaging Lab(计算成像实验室) ; MBZUAI(马斯喀特人工智能研究院) ; dunnolab(杜诺实验室) ; Innopolis University(因诺波利斯大学)
专题命中 机器人操作 :manipulation(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG
AI总结 提出双优势场(DAF)方法,利用双线性对偶值模型生成局部优势信号,通过动作-效应模型预测折扣特征位移并与目标方向对齐来评分动作,实现离线目标条件强化学习中的策略提取。
Comments Accepted by ICML 2026 Workshop on Decision-Making from Offline Datasets to Online Adaptation: Black-Box Optimization to Reinforcement Learning
Genie 4D:语义先验引导的4D动态场景重建
机构 * University of Zurich(苏黎世大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 机器人操作 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出Genie 4D框架,结合实时视觉惯性高斯泼溅前端和前馈4D骨干网络,利用冻结的DINOv3特征作为结构先验抑制身份漂移,并通过条件扩散精炼器恢复高频细节,最终通过轻量级潜在动作头实现用户可控的4D世界模型重建。
动作分块中的视野混合
机构 * Renmin University of China(中国人民大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 针对视觉-语言-动作模型中动作分块长度(视野)的权衡问题,提出混合视野策略,通过并行处理不同视野的动作片段并融合输出,同时提升长期预见与短期精度,实现性能与泛化性的改进。
Comments Accepted at ICML 2026
WarmPrior: 通过时间先验使流匹配策略更加平直
机构 * KAIST(韩国科学技术院) ; Microsoft Research(微软研究院)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出WarmPrior,通过利用近期动作历史构建的时间先验,提升机器人操作任务的成功率,改进概率路径并提高样本效率和最终性能。
闭环动作块与动态修正的训练无关扩散策略
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Artificial Intelligence, China Telecom Corp Ltd(中国电信人工智能研究院)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出DCDP框架,结合动作块生成与实时修正,提升动态场景下的适应性,无需重新训练,计算量仅增加5%,在动态PushT模拟中适应性提升19%。
Comments Accepted by ICRA2026
具有情境感知的自适应共享控制用于磁驱动双臂灵巧微 manipulation
专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract)
AI总结 本文提出Bi-CAST框架,通过融合多模态信息实现双臂磁力微 manipulation的自适应共享控制,提升复杂结构中的导航精度与效率,减少碰撞和工作负荷。
VLAD-Grasp:基于视觉-语言模型的零样本抓取检测
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。
Comments 8 pages, 4 figures, under review
COT-FM:分簇最优传输流匹配
机构 * National Taiwan University(台湾大学)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 COT-FM通过分簇策略优化流匹配框架,提升生成速度与可靠性,适用于图像生成和机器人任务。
Comments 18pages, CVPR 2026 accepted
通过概念门控视觉蒸馏克服视觉杂乱
机构 * University of Technology Sydney(技术大学悉尼大学) ; Western Sydney University(西悉尼大学)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本研究提出概念门控视觉蒸馏方法,通过视觉蒸馏技术解决杂乱环境中视觉语言动作模型的精度-推理间隙问题,显著提升机器人操作的成功率。
Comments 7 pages, 4 figures, 3 tables
通过 hindsight 经验回放实现稀疏奖励下的选项学习
机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出2HER方法,通过双目标重新标记策略提升稀疏奖励多目标任务中的学习效果。
ViTaS: 用于视觉-运动学习的视觉触觉软融合对比学习
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 ViTaS通过融合视觉和触觉信息,利用软融合对比学习提升视觉-运动学习的性能。
Comments Published to ICRA 2026
神经增强的凯尔文让用于实时软组织变形建模
专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出一种结合凯尔文让分析先验与大规模FEM数据的神经模拟框架,用于实时软组织变形建模,提升预测精度与物理合理性。
基于框架的思考:视觉上下文和测试时扩展如何增强视频推理
机构 * University of Cambridge(剑桥大学) ; Pioneer Center for AI, University of Copenhagen(人工智能先锋中心,哥本哈根大学) ; Hong Kong University of Science(香港科学大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Peking University(北京大学)
专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出通过视频生成模型进行视觉推理,利用视觉上下文和测试时扩展提升视频推理能力,展示了模型在空间和时间复杂任务中的鲁棒零样本泛化能力。
Comments 8 pages, 3 figures, 3 tables (26 pages, 13 figures, 6 tables including references and appendices)
OPENTOUCH:将全手触觉带入现实世界交互
机构 * MIT(麻省理工学院) ; Duke University(杜克大学) ; Brown University(布朗大学) ; University of Washington(华盛顿大学) ; Harvard University(哈佛大学)
专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 OpenTouch是首个现实场景的第一人称全手触觉数据集,通过同步视频-触觉-姿态数据和详细注释,推动多模态感知和机器人操作研究。
Comments https://opentouch-tactile.github.io/
H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式
机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)
专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。
Comments 13 pages, 6 figures