arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 61441 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 22164 篇

2606.11628 2026-06-11 cs.RO cs.AI 新提交 73%

LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition

LUCID:从非结构化人类视频学习与具身无关的意图模型以实现可扩展的灵巧机器人技能获取

Harsh Gupta, Guanya Shi, Wenzhen Yuan

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人操作 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出LUCID两阶段框架,从互联网规模的非结构化人类视频学习任务意图,并在大规模并行仿真中学习机器人控制,实现零样本迁移到不同具身和场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00491 2026-06-10 cs.RO cs.AI 73%

HannesImitation: Grasping with the Hannes Prosthetic Hand via Imitation Learning

HannesImitation:通过模仿学习控制Hannes假手进行抓取

Carlo Alessi, Federico Vasile, Federico Ceola, Giulia Pasquale, Nicolò Boccardo, Lorenzo Natale

机构 * Humanoid Sensing and Perception(人形感知与感知实验室) Istituto Italiano di Tecnologia(意大利技术研究院) Rehab Technologies Lab(康复技术实验室)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出HannesImitationPolicy,通过模仿学习控制Hannes假手在无结构环境中抓取物体,并引入HannesImitationDataset进行训练,实验表明其在无结构场景中优于基于分割的视觉伺服控制器。

Comments Paper accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems, Hangzhou, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09243 2026-06-09 cs.CV cs.AI 新提交 73%

EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video

EgoTactile: 从自我中心视频学习日常物体的抓取压力

Yuan Zeng, Yujia Shi, Tiao Tan, Xingting Li, Yaqi Qin, Zongqing Lu, Wenming Yang, Jing-Hao Xue, Qingmin Liao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 提出EgoTactile基准和条件扩散框架EgoPressureDiff,从自我中心视频估计全手抓取压力,解决视觉-物理歧义,实现鲁棒迁移。

Comments Accepted to ICML2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09580 2026-06-08 cs.RO cs.LG 版本更新 73%

SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows

SERNF: 通过动作块评论家和归一化流实现样本高效的真实世界灵巧策略微调

Chenyu Yang, Denis Tarasov, Davide Liconti, Romain Guntz, Hehui Zheng, Robert K. Katzschmann

机构 * Soft Robotics Lab, D-MAVT(软机器人实验室,D-MAVT) ETH Zurich(苏黎世联邦理工学院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出SERNF框架,结合归一化流策略和动作块评论家,实现真实世界灵巧操作策略的样本高效微调,解决多模态动作分布和信用分配问题。

Comments https://srl-ethz.github.io/SERNF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16705 2026-06-05 cs.RO cs.CV 73%

HERO: Learning Humanoid End-Effector Control for Visual Whole-Body Open-Vocabulary Object Grasping

HERO: 学习人形机器人的末端执行器控制用于视觉全身体对象抓取

Runpei Dong, Ziyan Li, Arjun Gupta, Xialin He, Saurabh Gupta

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 该研究提出HERO方法,通过结合大视觉模型和模拟训练,实现了视觉全身体对象抓取任务中末端执行器的高精度控制和场景理解,显著提升了抓取精度和泛化能力。

Comments Project page: https://hero-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
1702.03258 2026-06-04 cs.RO cs.LG cs.SY eess.SY 73%

Adaptive and Resilient Soft Tensegrity Robots

自适应且具有韧性的软 tensegrity 机器人

John Rieffel, Jean-Baptiste Mouret

机构 * Union College(联合学院) Inria Nancy Grand - Est CNRS, Loria, UMR 7503(法国国家科学研究中心(CNRS)、洛里亚实验室(Loria)、UMR 7503)

专题命中 机器人操作 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种易于组装的基于 tensegrity 的软机器人,能产生高动态运动步态,并在物理损伤下表现出结构和行为韧性,通过机器学习算法实现有效步态发现。

Comments video: https://youtu.be/SuLQDhrk9tQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01847 2026-06-02 cs.RO cs.LG 73%

The Lie We Tell: Correcting the Euclidean Fallacy in Vision Language Action Policies via Score Matching on Tangent Space

我们说的谎言:通过切空间上的分数匹配纠正视觉-语言-动作策略中的欧几里得谬误

Bing-Cheng Chuang, I-Hsuan Chu, Bor-Jiun Lin, YuanFu Yang, Min Sun, Chun-Yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对扩散视觉-语言-动作策略将SE(3)位姿表示为平坦R^12向量导致的欧几里得谬误,提出Lie Diffuser Actor (LDA)框架,通过左不变SDE注入噪声、在切空间预测分数并利用指数映射回缩样本,从根本上消除流形漂移、保证坐标框架等变性和测地线最优性,在CALVIN ABC→D上平均任务长度从3.27提升至3.51。

Comments ICML 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01711 2026-06-02 cs.RO cs.LG 73%

Contrastive Representation Regularization for Vision-Language-Action Models

视觉-语言-动作模型的对比表示正则化

Taeyoung Kim, Jimin Lee, Myungkyu Koo, Dongyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出机器人状态感知对比损失(RS-CL),通过对比学习对齐VLM表示与机器人本体感受状态,提升VLA模型在机器人操作任务中的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27919 2026-05-28 cs.RO cs.LG 73%

Frequency-Guided Action Diffusion via Sub-Frequency Manifold Traversal

通过子频率流形遍历的频率引导动作扩散

Junlin Wang

机构 * School of Engineering and Applied Science University of Pennsylvania(工程与应用科学学院 费城大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 提出频率引导算子(FGO),通过子频率流形逐步引导扩散策略生成平滑动作,在15个机器人操作任务上提升了动作平滑性和时间一致性。

Comments A preprint version of FGO

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21414 2026-05-21 cs.RO cs.CV 73%

PointACT: Vision-Language-Action Models with Multi-Scale Point-Action Interaction

PointACT: 多尺度点-动作交互的视觉-语言-动作模型

Shizhe Chen, Paul Pacaud, Cordelia Schmid

机构 * Inria(法国国家信息与自动化研究所) École normale supérieure(法国高等科学研究院) CNRS(法国国家科学研究中心) PSL Research University(巴黎综合理工研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出PointACT,一种集成层次化3D点云表示的3D感知视觉-语言-动作政策,通过多尺度点-动作交互机制提升机器人在3D环境中的精细几何推理和空间定位能力。

Comments Accepted to RSS 2026; project webpage: https://cshizhe.github.io/projects/pointact.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10891 2026-05-20 cs.RO cs.LG 73%

Iterative Compositional Data Generation for Robot Control

迭代组合数据生成用于机器人控制

Anh-Quan Pham, Marcel Hussing, Shubhankar P. Patankar, Dani S. Bassett, Jorge Mendez-Mendez, Eric Eaton

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种语义组合扩散变换器,通过注意力机制学习机器人、物体、障碍物和目标特定组件的交互,从而在有限任务集上训练后,能够零样本生成高质量过渡,进而学习未见任务组合的控制策略,并通过迭代自我改进过程提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14950 2026-05-15 cs.CV cs.RO 73%

Evo-Depth: A Lightweight Depth-Enhanced Vision-Language-Action Model

Evo-Depth:一种轻量化的深度增强视觉-语言-动作模型

Tao Lin, Yuxin Du, Jiting Liu, Nuobei Zhu, Yunhe Li, Yuqian Fu, Yinxinyu Chen, Hongyi Cai, Zewei Ye, Bing Cheng, Kai Ye, Yiran Mao, Yilei Zhong, MingKang Dong, Junchi Yan, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 大学科学与技术大学) Nanyang Technological University(南洋理工大学) SJTU-Quic Robot Joint Lab(上海交通大学-Quick 机器人联合实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Evo-Depth模型,通过轻量隐式深度编码模块和空间增强模块提升视觉-语言-动作任务中的空间感知能力,实现高效部署与高精度操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13117 2026-05-14 cs.RO cs.AI 73%

SECOND-Grasp: Semantic Contact-guided Dexterous Grasping

SECOND-Grasp:语义接触引导的灵巧抓取

Han Yi Shin, Heeju Ko, Jaewon Mun, Qixing Huang, Jaehyeok Lee, Sung June Kim, Honglak Lee, Sujin Jang, Sangpil Kim

机构 * Korea University(韩国大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan(密歇根大学) Hanyang University(翰阳大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SEmantic CONtact-guided Dexterous Grasping框架,通过语义推理与物理可行性结合,提升机器人手部抓取的稳定性和语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10094 2026-05-13 cs.RO cs.AI 73%

Retrieve-then-Steer: Online Success Memory for Test-Time Adaptation of Generative VLAs

检索后再引导:生成式视觉-语言-动作模型的在线成功记忆用于测试时适应

Jianchao Zhao, Huoren Yang, Yusong Hu, Yuyang Gao, Qiguan Ou, Cong Wan, SongLin Dong, Zhiheng Ma, Yihong Gong

机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) One Robotics Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种在线成功记忆引导的测试时适应框架,用于生成式视觉-语言-动作模型,在重复或缓慢变化的环境中通过重用成功经验提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09954 2026-05-12 cs.RO cs.CV 73%

JODA: Composable Joint Dynamics for Articulated Objects

JODA:可组合的联合动力学用于连杆物体

Tianhong Gao, Cheng Yu, Yinghao Xu, Mengyu Chu

机构 * Peking University(北京大学) Ant Group, Robbyant(蚂蚁集团,Robbyant)

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 JODA通过结构化三通道场生成关节级动力学,结合视觉和语言模型推断并优化关节动力学,实现可控的连杆物体动力学建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06222 2026-05-12 cs.RO cs.AI 73%

When to Trust Imagination: Adaptive Action Execution for World Action Models

何时相信想象:为世界动作模型的自适应动作执行

Rui Wang, Yue Zhang, Jiehong Lin, Kuncheng Luo, Jianan Wang, Zhongrui Wang, Xiaojuan Qi

机构 * Southern University of Science and Technology(南方科技大学) The University of Hong Kong(香港大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出FFDC和混合时间 horizon训练,通过预测-观察一致性实现自适应动作执行,提升机器人在复杂场景中的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08245 2026-05-05 cs.RO cs.AI 73%

STEP: Warm-Started Visuomotor Policies with Spatiotemporal Consistency Prediction

STEP: 带时空一致性的预热视觉运动策略

Jinhao Li, Yuxuan Cong, Yingqiao Wang, Hao Xia, Shan Huang, Yijia Zhang, Ningyi Xu, Guohao Dai

机构 * Shanghai Jiao Tong University, Shanghai, China.(上海交通大学,上海,中国。) Shanghai Innovation Institute, Shanghai, China.(上海创新研究院,上海,中国。)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出STEP策略,通过轻量级时空一致性预测机制生成高质量预热动作,同时保持生成能力。引入速度感知扰动注入机制,防止执行停滞,提升实时任务性能。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.11544 2026-04-29 cs.RO cs.AI 73%

Visuo-Haptic Object Perception for Robots: An Overview

机器人视觉-触觉物体感知综述

Nicolás Navarro-Guerrero, Sibel Toprak, Josip Josifovski, Lorenzo Jamone

机构 * Advanced Robotics at Queen Mary (ARQ), School of Engineering and Materials Science, Queen Mary University of London(伦敦女王大学工程与材料科学学院先进机器人研究中心)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文综述了机器人视觉-触觉物体感知的现状,探讨了生物基础、传感技术、计算方法及未来研究方向,强调多模态学习的挑战与应用进展。

Comments published in Autonomous Robots

Journal ref Autonomous Robots, 27 (2023) https://link.springer.com/article/10.1007/s10514-023-10091-y

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21898 2026-04-27 cs.RO cs.AI 73%

Flexible Multitask Learning with Factorized Diffusion Policy

灵活的多任务学习与因子化扩散策略

Chaoqi Liu, Haonan Chen, Sigmund H. Høeg, Shaoxiong Yao, Yunzhu Li, Kris Hauser, Yilun Du

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Norwegian University of Science and Technology(挪威科学与技术大学) Columbia University(哥伦比亚大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种因子化扩散策略框架,通过将复杂动作分布分解为多个专用扩散模型,提升多任务学习的灵活性和适应性,实验证明其在仿真和现实机器人任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10446 2026-04-20 cs.RO cs.AI 73%

VeriGraph: Scene Graphs for Execution Verifiable Robot Planning

VeriGraph:用于可验证机器人规划的场景图

Daniel Ekpo, Mara Levy, Saksham Suri, Chuong Huynh, Archana Swaminathan, Abhinav Shrivastava

机构 * University of Maryland, College Park, MD USA(马里兰大学学院公园分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 VeriGraph通过整合视觉语言模型和场景图,提升机器人任务规划的可行性验证与修正,显著提高任务完成率。

Comments Accepted to ICRA 2026. Project website: https://verigraph-agent.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00695 2026-04-16 cs.RO cs.CV 73%

HAMLET: Switch your Vision-Language-Action Model into a History-Aware Policy

HAMLET: 将视觉-语言-动作模型转换为历史感知策略

Myungkyu Koo, Daewon Choi, Taeyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin

机构 * KAIST(韩国科学技术院) UC Berkeley(伯克利大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出HAMLET框架,通过引入时刻标记和轻量记忆模块,使视觉-语言-动作模型能关注历史上下文,提升长周期任务表现,实验显示在多个基准测试中均取得显著提升。

Comments ICLR 2026. Project page: https://myungkyukoo.github.io/hamlet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18082 2026-04-14 cs.CV cs.RO 73%

ActDistill: General Action-Guided Self-Derived Distillation for Efficient Vision-Language-Action Models

ActDistill: 通用动作引导自衍生蒸馏用于高效视觉-语言-动作模型

Wencheng Ye, Tianshi Wang, Lei Zhu, Fengling Li, Guoli Yang, Hengtao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) University of Technology Sydney(悉尼科技大学) Advanced Institute of Big Data(大数据先进研究院)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出ActDistill框架,通过动作先验引导知识迁移与模型压缩,实现高效视觉-语言-动作模型。实验表明,该方法在减少50%计算量的同时,性能可与全规模模型相比或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08945 2026-04-13 cs.CV cs.RO 73%

TouchAnything: Diffusion-Guided 3D Reconstruction from Sparse Robot Touches

TouchAnything: 从稀疏机器人触碰引导的3D重建

Langzhe Gu, Hung-Jui Huang, Mohamad Qadri, Michael Kaess, Wenzhen Yuan

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TouchAnything框架,利用预训练的2D视觉扩散模型作为语义和几何先验,从稀疏触觉测量中实现准确的3D重建,优于现有基线方法,支持开放世界中未见过的物体实例重建。

Comments Project Page: https://grange007.github.io/touchanything

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12866 2026-04-07 cs.RO cs.CV 73%

Learning to Grasp Anything by Playing with Random Toys

通过随机玩具学习抓取任何物体

Dantong Niu, Yuvan Sharma, Baifeng Shi, Rachel Ding, Matteo Gioia, Haoru Xue, Henry Tsai, Konstantinos Kallidromitis, Anirudh Pai, Caitlin Regan, Shankar Sastry, Trevor Darrell, Jitendra Malik, Roei Herzig

机构 * University of California, Berkeley(加州大学伯克利分校) Sapienza University of Rome(罗马大学) ItalAI Panasonic(松下)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文通过随机组装的简单玩具训练机器人,使其具备泛化抓取能力,采用对象中心视觉表示实现零样本性能,实现在YCB数据集上的67%抓取成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02108 2026-04-03 cs.RO cs.LG 73%

Cross-Modal Visuo-Tactile Object Perception

跨模态视觉-触觉物体感知

Anirvan Dutta, Simone Tasciotti, Claudia Cusseddu, Ang Li, Panayiota Poirazi, Julijana Gjorgjieva, Etienne Burdet, Patrick van der Smagt, Mohsen Kaboli

机构 * BMW Group AG(宝马集团) Imperial College of Science, Technology and Medicine(帝国理工学院) University of Crete(克里特大学) Institute of Molecular Biology and Biotechnology, Foundation for Research and Technology-Hellas(分子生物学与生物技术研究所,研究与技术基金会-希腊) Technical University of Munich(慕尼黑工业大学) Eötvös Loránd University(罗兰大学) Foundation Robotics Labs(基础机器人实验室) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出跨模态潜在滤波器(CMLF),通过贝叶斯推断实现视觉与触觉信息的双向传递,提升机器人在不确定性下的物理属性估计效率与鲁棒性,同时展现类人感知耦合现象。

Comments 23 pages, 8 figures, 1 table. Submitted for review to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01618 2026-04-03 cs.CV cs.AI 73%

Tex3D: Objects as Attack Surfaces via Adversarial 3D Textures for Vision-Language-Action Models

Tex3D: 通过对抗性3D纹理将物体作为攻击面用于视觉-语言-动作模型

Jiawei Chen, Simin Huang, Jiawei Du, Shuaihang Chen, Yu Tian, Mingjie Wei, Chao Yu, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) CFAR, A*STAR, Singapore(新加坡科技研究局CFAR) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Tex3D框架,通过对抗性3D纹理攻击视觉-语言-动作模型,揭示其在物理环境中面临的关键漏洞,展示了在仿真和真实机器人任务中显著降低模型性能的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08545 2026-04-02 cs.CL cs.AI cs.CV cs.MA 73%

Curriculum Guided Massive Multi Agent System Solving For Robust Long Horizon Tasks

课程引导的大规模多智能体系统解决稳健长周期任务

Indrajit Kar, Kalathur Chenchu Kishore Kumar

机构 * Wipro Innovation Networks(威普罗创新网络)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种分层多智能体架构,通过空间课程逐步扩展网格区域,使智能体先掌握中央任务再处理外围任务,提升长周期任务的稳定性和推理能力。

Comments 22 pages, 2 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28732 2026-03-31 cs.RO cs.CV 73%

Pandora: Articulated 3D Scene Graphs from Egocentric Vision

Pandora: 从第一人称视觉获取拟合3D场景图

Alan Yu, Yun Chang, Christopher Xie, Luca Carlone

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(麻省理工学院信息与决策系统实验室) Meta Reality Labs(Meta现实实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Pandora方法,利用人类自然探索场景时的单目数据,恢复拟合物体部件模型,并整合到3D场景图中,提升机器人移动操作能力。

Comments 14 pages, 5 figures. Presented at the 2025 British Machine Vision Conference (BMVC) in Sheffield, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22854 2026-03-27 cs.CV cs.GR cs.LG 73%

ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning

ByteLoom: 通过渐进课程学习编织几何一致的人-物体交互

Bangya Liu, Xinyu Gong, Zelin Zhao, Ziyang Song, Yulei Lu, Suhui Wu, Jun Zhang, Suman Banerjee, Hao Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ByteDance(字节跳动) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);分类 cs.CV、cs.LG

AI总结 本文提出ByteLoom框架,通过简化的人类条件和3D物体输入生成几何一致的人-物体交互视频,解决多视角信息注入和手部网格标注依赖的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24584 2026-03-26 cs.CV cs.RO 73%

TAG: Target-Agnostic Guidance for Stable Object-Centric Inference in Vision-Language-Action Models

目标无关引导:用于视觉-语言-动作模型中稳定对象中心推断的指导

Jiaying Zhou, Zhihao Zhan, Ruifeng Zhai, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TAG目标无关引导,通过对比原始观察和物体擦除观察下的策略预测差异,减少干扰和外观偏差,提升视觉-语言-动作模型在复杂场景中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏