arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3133 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3133 篇

2606.00104 2026-06-02 cs.RO cs.AI 73%

PEACE: A Planner-Executor Agent with Constraint Enforcement for UAVs

PEACE: 一种用于无人机的带约束执行的规划-执行智能体

Erdem Uysal, Timo Kehrer, Sebastiano Panichella

机构 * Institute of Computer Science, University of Bern(伯尔尼大学计算机科学研究所) AI4I - The Italian Institute of Artificial Intelligence(意大利人工智能研究所)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.RO、cs.AI

AI总结 提出一种基于大语言模型的规划-执行智能体架构,通过解耦高层任务规划与低层控制,并引入约束执行层和有限重规划,实现无人机可解释、可约束的自主飞行。

Comments Accepted to ICRA 2026 Workshop on Semantics for Reliable Robot Autonomy: From Environment Understanding and Reasoning to Safe Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13169 2026-05-18 cs.CV cs.AI 73%

PanoWorld: Towards Spatial Supersensing in 360$^\circ$ Panorama World

PanoWorld:迈向360度全景世界的空间超感知

Changpeng Wang, Xin Lin, Junhan Liu, Yuheng Liu, Zhen Wang, Donglian Qi, Yunfeng Yan, Xi Chen

机构 * Zhejiang University(浙江大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Irvine(加州大学伊维特分校) The University of Hong Kong(香港大学)

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出PanoWorld,通过构建全景原生理解能力,解决传统多模态大模型在空间感知上的不足,通过全景空间交叉注意力机制提升3D空间推理能力,并建立PanoSpace-Bench基准测试,验证了全景原生监督的有效性。

Comments Project page: https://wcpcp.github.io/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04506 2026-05-14 cs.CV cs.AI 73%

Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting

Ilov3Splat:基于高斯散射的实例级开放词汇3D场景理解

Binh Long Nguyen, Kien Nguyen, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * School of Electrical Engineering and Robotics(电气工程与机器人学学院) Queensland University of Technology(昆士兰理工大学) CSIRO Robotics(CSIRO机器人部) CSIRO

专题命中 具身推理 :robotics(abstract,abstract_cn);分类 cs.AI、cs.CV

AI总结 本文提出Ilov3Splat框架,通过增强高斯散射以实现实例级开放词汇3D场景理解,利用多分辨率哈希嵌入和对比损失提升语言语义关联与实例区分能力。

Comments The International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07758 2026-04-10 cs.CV cs.AI 73%

DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics

DailyArt: 从单张静态图像中通过潜在动态发现关节

Hang Zhang, Qijian Tian, Jingyu Gong, Daoguo Dong, Xuhong Wang, Yuan Xie, Xin Tan

专题命中 具身推理 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 DailyArt通过合成介导推理解决单张图像中关节估计问题,无需多视角输入或显式部分标注,实现关节参数同时恢复和部分级新状态合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01415 2026-03-25 cs.RO cs.AI 73%

RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems

RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习

Mingcong Lei, Honghao Cai, Yuyuan Yang, Yimou Wu, Jinke Ren, Zezhou Cui, Liangchen Tan, Junkun Hong, Gehan Hu, Shuangyu Zhu, Shaohan Jiang, Ge Wang, Junyuan Tan, Zhenglin Wan, Zheng Li, Zhen Li, Shuguang Cui, Yiming Zhao, Yatong Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK-Shenzhen(SSE,CUHK-深圳) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Ising AI

专题命中 具身推理 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04158 2026-03-05 cs.RO cs.AI 73%

GarmentPile++: Affordance-Driven Cluttered Garments Retrieval with Vision-Language Reasoning

GarmentPile++: 基于视觉-语言推理的基于 affordance 的杂乱衣物检索

Mingleyang Li, Yuran Wang, Yue Chen, Tianxing Chen, Jiaqi Liang, Zishun Shen, Haoran Lu, Ruihai Wu, Hao Dong

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 GarmentPile++通过结合视觉-语言推理和视觉affordance感知,实现基于语言指令的杂乱衣物安全检索,确保每次检索一件衣物,提升家庭助理机器人任务执行能力。

Comments ICRA2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08585 2026-02-09 cs.AI cs.CV 73%

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20208 2026-01-29 cs.RO cs.CV 73%

TRACER: Texture-Robust Affordance Chain-of-Thought for Deformable-Object Refinement

TRACER: 适用于变形物体细化的纹理鲁棒触觉链

Wanjun Jia, Kang Li, Fan Yang, Mengfei Duan, Wenrui Chen, Yiming Jiang, Hui Zhang, Kailun Yang, Zhiyong Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 TRACER通过纹理鲁棒触觉链框架,提升变形物体在复杂纹理下的触觉识别精度和长视界任务成功率。

Comments The source code and dataset will be made publicly available at https://github.com/Dikay1/TRACER

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI 73%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01999 2025-11-05 cs.RO cs.AI 73%

TRACE: Textual Reasoning for Affordance Coordinate Extraction

Sangyun Park, Jin Kim, Yuchen Cui, Matthew S. Brown

机构 * ABB Robotics(ABB机器人公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

Comments ICCV 2025. *Equal contribution. †Corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04390 2025-10-07 cs.CV cs.AI cs.CL 73%

MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator

Xuehai He, Shijie Zhou, Thivyanth Venkateswaran, Kaizhi Zheng, Ziyu Wan, Achuta Kadambi, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Los Angeles(加州大学洛杉矶分校) IIT Bombay(印度理工学院班加罗尔) Microsoft(微软公司)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25794 2025-10-01 cs.CV cs.AI 73%

Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding

Haotian Xue, Yunhao Ge, Yu Zeng, Zhaoshuo Li, Ming-Yu Liu, Yongxin Chen, Jiaojiao Fan

机构 * Georgia Tech(佐治亚理工学院) NVIDIA(英伟达)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10548 2025-07-15 cs.CV cs.AI cs.CL 73%

EmbRACE-3K: Embodied Reasoning and Action in Complex Environments

Mingxian Lin, Wei Huang, Yitang Li, Chengjie Jiang, Kui Wu, Fangwei Zhong, Shengju Qian, Xin Wang, Xiaojuan Qi

专题命中 具身推理 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.CV

Comments Project page: https://mxllc.github.io/EmbRACE-3K/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11564 2025-07-08 cs.RO cs.CV 73%

PAVLM: Advancing Point Cloud based Affordance Understanding Via Vision-Language Model

Shang-Ching Liu, Van Nhiem Tran, Wenkai Chen, Wei-Lun Cheng, Yen-Lin Huang, I-Bin Liao, Yung-Hui Li, Jianwei Zhang

机构 * Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, University of Hamburg(汉堡大学信息学院多模态系统技术部门) Hon Hai Research Institute (HHRI)(鸿海研究机构) Department of Electrical Engineering, National Taiwan University(台湾大学电子工程系) Department of Computer Science and Technology, National Tsinghua University(清华大学计算机科学与技术系)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09965 2025-06-23 cs.CV cs.AI 73%

Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

Junfei Wu, Jian Guan, Kaituo Feng, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团) CUHK MMLab(香港中文大学MMLab) Nanjing University(南京大学)

专题命中 具身推理 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20648 2025-04-30 cs.CV cs.AI 73%

SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data

Michael Ogezi, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 具身推理 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06442 2024-12-13 cs.CV cs.RO 73%

QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding

Yash Mehan, Kumaraditya Gupta, Rohit Jayanti, Anirudh Govil, Sourav Garg, Madhava Krishna

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments Accepted at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) as Oral Presentation. Also presented at the 2nd Workshop on Open-Vocabulary 3D Scene Understanding (OpenSUN3D) at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00499 2024-09-04 cs.RO cs.CV 73%

DAP: Diffusion-based Affordance Prediction for Multi-modality Storage

Haonan Chang, Kowndinya Boyalakuntla, Yuhan Liu, Xinyu Zhang, Liam Schramm, Abdeslam Boularias

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments Paper Accepted by IROS2024. Arxiv version is 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05603 2024-04-09 cs.CV cs.AI 73%

Self-Explainable Affordance Learning with Embodied Caption

Zhipeng Zhang, Zhimin Wei, Guolei Sun, Peng Wang, Luc Van Gool

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07473 2023-12-18 cs.RO cs.AI 73%

Where2Explore: Few-shot Affordance Learning for Unseen Novel Categories of Articulated Objects

Chuanruo Ning, Ruihai Wu, Haoran Lu, Kaichun Mo, Hao Dong

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01920 2023-04-13 cs.CV cs.RO 73%

Review on 6D Object Pose Estimation with the focus on Indoor Scene Understanding

Negar Nejatishahidin, Pooya Fayyazsanavi

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05200 2022-11-11 cs.CV cs.RO 73%

Affordance detection with Dynamic-Tree Capsule Networks

Antonio Rodríguez-Sánchez, Simon Haller-Seeber, David Peer, Chris Engelhardt, Jakob Mittelberger, Matteo Saveriano

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments IEEE-RAS International Conference on Humanoid Robots (Humanoids 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05624 2022-04-13 cs.CV cs.LG 73%

Continual Predictive Learning from Videos

Geng Chen, Wendong Zhang, Han Lu, Siyu Gao, Yunbo Wang, Mingsheng Long, Xiaokang Yang

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2022 (Oral). Code is available at https://github.com/jc043/CPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.02364 2020-02-18 cs.RO cs.CV 73%

Learning to Move with Affordance Maps

William Qi, Ravi Teja Mullapudi, Saurabh Gupta, Deva Ramanan

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments Published at ICLR 2020. For code, see https://github.com/wqi/A2L

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05815 2026-03-09 cs.RO 72%

Hierarchical Latent Action Model

层次化潜在动作模型

Hanjung Kim, Lerrel Pinto, Seon Joo Kim

机构 * Yonsei University(延世大学) New York University(纽约大学)

专题命中 具身推理 :world model(abstract,comments);robotic(abstract);分类 cs.RO

AI总结 HiLAM通过建模长期时间信息,从无动作视频中发现高层次潜在技能,提升了动态技能发现的鲁棒性。

Comments ICLR 2026 Workshop - 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02857 2026-02-04 cs.RO 72%

Latent Perspective-Taking via a Schrödinger Bridge in Influence-Augmented Local Models

通过影响增强的局部模型实现潜在的视角转换

Kevin Alcedo, Pedro U. Lima, Rachid Alami

机构 * Institute for Systems and Robotics(系统与机器人研究所) Universidade de Lisboa(里斯本大学) LAAS-CNRS(拉沙尔国家研究中心) Artificial and Natural Intelligence Toulouse Institute (ANITI)(图卢兹人工智能与自然智能研究所)

专题命中 具身推理 :world model(abstract,comments);navigation(abstract);分类 cs.RO

AI总结 本文提出了一种基于影响增强的局部模型和施罗德桥的神经符号框架,用于实现机器人在社交交互中的心理状态推断和决策规划。

Comments Extended Abstract & Poster, Presented at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10489 2025-08-15 cs.LG 72%

Learning State-Space Models of Dynamic Systems from Arbitrary Data using Joint Embedding Predictive Architectures

Jonas Ulmen, Ganesh Sundaram, Daniel Görges

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 具身推理 :robotics(abstract,comments);world model(abstract);分类 cs.LG

Comments 6 Pages, Published in IFAC Joint Symposia on Mechatronics & Robotics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00871 2023-03-03 cs.CV cs.AI cs.LG cs.RO 72%

Bayesian Deep Learning for Affordance Segmentation in images

Lorenzo Mur-Labadia, Ruben Martinez-Cantin, Jose J. Guerrero

专题命中 具身推理 :robotics(abstract,comments);分类 cs.RO、cs.AI、cs.CV

Comments 2023 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07265 2026-08-25 math.OC 版本更新 71%

Finite-Sample Metric Non-Collapse for Geometrically Supervised Latent World Models in Control

用于控制的学习型世界模型中的度量非崩溃:逼近理论、有限样本几何保证与确定性规划迁移

Alain Bensoussan, Minh-Nhat Phung, Minh-Binh Tran

专题命中 具身推理 :world model(title)

AI总结 该研究为非线性确定性控制系统的学习型世界模型构建三部分数学理论,含逼近理论、有限样本几何保证及确定性规划迁移方法,通过数值实验验证了相关方法的有效性。

Comments Revised version prepared in response to the editorial assessment. The main manuscript is 32 pages; detailed mathematical derivations have been moved to the accompanying Supplementary Material. The principal results and contributions are strengthened and clarified

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25532 2026-08-18 gr-qc 版本更新 71%

A New Self-Dual Gravitational Instanton Solution on a Local Conformal Kählerian Manifold in a Brane World Model

一种在膜世界模型中局部共形凯勒流形上的新自对偶引力瞬子解

Reinoud Jan Slagter

专题命中 具身推理 :world model(title)

AI总结 本文在共形膨胀子引力中找到了一种真空类克尔扭曲时空上的精确引力瞬子解,该解由一阶偏微分方程导出,与自对偶性相关,其奇点由五次多项式决定,拓扑为S^3×R/Z_2,并利用克莱因瓶上的对径边界条件描述了霍金粒子蒸发过程,最后揭示了与Janis-Newman-Winicour模型之间的联系。

Comments Version V4 : final. pictures improved --- spelling improved --- comments welcome---73 pages---70 pictures

详情

展开后加载摘要…

URL PDF HTML 收藏