arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-01-07 至 2026-01-07 共收录 46 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 13 篇

2506.09990 2026-01-07 cs.RO cs.CV cs.LG 88%

Chain-of-Action: Trajectory Autoregressive Modeling for Robotic Manipulation

动作链:用于机器人操作的轨迹自回归建模

Wenbo Zhang, Tianrun Hu, Hanbo Zhang, Yanyuan Qiao, Yuchu Qin, Yang Li, Jiajun Liu, Tao Kong, Lingqiao Liu, Xiao Ma

机构 * The University of Adelaide(阿德莱德大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.CV、cs.LG

AI总结 CoA通过逆向推理生成完整轨迹,结合连续动作表示、动态停止等设计,实现视觉-运动策略在机器人操作中的高效与灵活表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03200 2026-01-07 cs.RO 87%

A High-Fidelity Digital Twin for Robotic Manipulation Based on 3D Gaussian Splatting

基于3D高斯点云的高保真机器人操作数字孪生

Ziyang Sun, Lingfan Bao, Tianhu Peng, Jingcheng Sun, Chengxu Zhou

机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO;robot learning(comments)

AI总结 本文提出基于3D高斯点云的高保真数字孪生框架,通过语义融合和高效几何转换方法,实现快速、可靠的机器人操作

Comments Under review of Journal of Robot Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23171 2026-01-07 cs.CV 85%

RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer

RoboTransfer: 可控的几何一致视频扩散用于操控策略迁移

Liu Liu, Xiaofeng Wang, Guosheng Zhao, Keyu Li, Wenkang Qin, Jiagang Zhu, Jiaxiong Qiu, Zheng Zhu, Guan Huang, Zhizhong Su

机构 * Horizon Robotics GigaAI CASIA

专题命中 机器人操作 :manipulation(title,abstract);robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 RoboTransfer通过可控的几何一致视频扩散技术,提升机器人操控策略在真实环境中的泛化能力。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02566 2026-01-07 cs.CV 79%

Shallow- and Deep-fake Image Manipulation Localization Using Vision Mamba and Guided Graph Neural Network

使用视觉Mamba和引导图神经网络进行浅层和深层伪造图像篡改定位

Junbin Zhang, Hamid Reza Tohidypour, Yixiao Wang, Panos Nasiopoulos

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 本文提出利用视觉Mamba和引导图神经网络,实现对浅层和深层伪造图像中篡改区域的高效定位与区分。

Comments Under review for journal publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02686 2026-01-07 cs.RO 70%

Learning to Nudge: A Scalable Barrier Function Framework for Safe Robot Interaction in Dense Clutter

学习引导:一种可扩展的障碍函数框架用于安全的机器人交互在密集障碍物中

Haixin Jin, Nikhil Uday Shinde, Soofiyan Atar, Hongzhan Yu, Dylan Hirsch, Sicun Gao, Michael C. Yip, Sylvia Herbert

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出了一种可扩展的障碍函数框架,通过学习可组合的以对象为中心的函数,实现安全的机器人交互在密集障碍物中,无需重新训练即可跨任务转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10071 2026-01-07 cs.RO 70%

Openpi Comet: Competition Solution For 2025 BEHAVIOR Challenge

Openpi Comet: 2025 BEHAVIOR挑战的竞赛解决方案

Junjie Bai, Yu-Wei Chao, Qizhi Chen, Jinwei Gu, Moo Jin Kim, Zhaoshuo Li, Xuan Li, Tsung-Yi Lin, Ming-Yu Liu, Nic Ma, Kaichun Mo, Delin Qu, Shangkun Sun, Hongchi Xia, Fangyin Wei, Xiaohui Zeng

机构 * Openpi Comet

专题命中 机器人操作 :embodied AI(abstract);manipulation(abstract);分类 cs.RO

AI总结 Openpi Comet通过系统构建方法,在2025 BEHAVIOR挑战中取得优异成绩,展示了在长期移动操作任务中的高效解决方案

Comments Post-challenge bug fix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03139 2026-01-07 quant-ph 50%

Operational modes of a Raman-coupled two-qubit quantum thermal machine

拉曼耦合双量子比特量子热机的操作模式

Alonso Alcalá, Charlie Oncebay, Onofre Rojas, Moises Rojas

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了基于拉曼耦合双量子比特的量子热机在不同热力学循环中的操作模式,揭示了频率调制对热机性能和效率的影响。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03061 2026-01-07 cs.CY 50%

Vertical tacit collusion in AI-mediated markets

人工智能中介市场中的垂直默许 collusion

Felipe M. Affonso

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文研究了人工智能中介市场中平台与卖家利用AI认知偏见导致的垂直默许 collusion问题,揭示了这种无协调的市场失败对消费者造成的双重伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18805 2026-01-07 cs.GT cs.MA econ.TH 50%

It's Not All Black and White: Degree of Truthfulness for Risk-Avoiding Agents

并非非黑即白:风险规避代理的诚实度

Eden Hartman, Erel Segal-Halevi, Biaoshuai Tao

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文提出风险规避诚实性概念,定义机制的RAT度以衡量其安全操纵抵抗能力。

Comments Accepted to EC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03367 2026-01-07 physics.optics 50%

Light structuring via nonlinear total angular momentum addition with flat optics

通过非线性总角动量叠加实现光结构化

Evgenii Menshikov, Paolo Franceschini, Kristina Frizyuk, Ivan Fernandez-Corbaton, Andrea Tognazzi, Alfonso Carmelo Cino, Denis Garoli, Mihail Petrov, Domenico de Ceglia, Costantino De Angelis

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过非线性总角动量叠加,实现三阶谐波光的结构化,揭示其对泵浦偏振态的高度敏感性,为精确控制结构光提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19741 2026-01-07 cond-mat.mes-hall 50%

Domain wall skyrmion-based magnonic crystal

基于磁域壁Skyrmion的磁波晶体

Zhenyu Wang, Xingen Zheng, Zhixiong Li, Zhizhi Zhang, Xiansi Wang

专题命中 机器人操作 :manipulation(abstract)

AI总结 利用磁域壁Skyrmion链构建磁波晶体,实现对磁域壁中自旋波传播的调控,为设计高效磁波纳米电路提供新方法。

Comments 8 pages, 5figures

Journal ref Phys. Rev. B 113, 014402 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18546 2026-01-07 quant-ph 50%

Chiral Discrimination on Gate-Based Quantum Computers

基于门的量子计算机中的手性鉴别

Muhammad Arsalan Ali Akbar, Sabre Kais

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究提出了一种基于门的量子计算方法,用于手性鉴别,通过离散化STIRAP和STAP协议,实现了对1,2-丙二醇分子的实验验证。

Journal ref JCP25-AR-CAO2026-03732R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19512 2026-01-07 cond-mat.str-el cond-mat.mtrl-sci 50%

Magnetic anisotropy effect on stabilizing magnetization plateaus of kagome strip chain Heisenberg antiferromagnets

磁各向异性对kagome条链反铁磁Heisenberg模型磁化平台稳定性的效应

Chiara Bruzzi, Jian-Xin Zhu, Yixuan Huang

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过数值方法揭示了kagome条链反铁磁Heisenberg模型中磁各向异性对磁化平台稳定性的调控机制,并探讨了其在材料设计中的应用。

Comments 12 pages, 10 figures

Journal ref Phys. Rev. B 112, 045122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 12 篇

2601.02766 2026-01-07 cs.RO cs.AR 88%

Advancing Assistive Robotics: Multi-Modal Navigation and Biophysical Monitoring for Next-Generation Wheelchairs

推动辅助机器人:多模态导航与生物物理监测用于下一代轮椅

Md. Anowar Hossain, Mohd. Ehsanul Hoque

专题命中 具身导航 :robotics(title,abstract);navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种多模态轮椅控制系统,结合多种输入接口与生物物理监测,提升患者独立性并实现护理人员实时监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02798 2026-01-07 cs.RO 86%

Reinforcement Learning for Follow-the-Leader Robotic Endoscopic Navigation via Synthetic Data

基于合成数据的强化学习用于跟随领导者机器人内窥镜导航

Sicong Gao, Chen Qian, Laurence Xian, Liao Wu, Maurice Pagnucco, Yang Song

机构 * School of Computer Science and Engineering, The University of New South Wales(计算机科学与工程学院,新南威尔士大学) School of Mechanical and Manufacturing Engineering, The University of New South Wales(机械与制造工程学院,新南威尔士大学)

专题命中 具身导航 :navigation(title,abstract);robotic(title);分类 cs.RO

AI总结 本文提出了一种基于合成数据的强化学习方法,用于提高内窥镜机器人在狭窄管状环境中的自主导航能力,通过深度学习和几何感知机制提升了导航精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24851 2026-01-07 cs.CV cs.RO 84%

VLN-MME: Diagnosing MLLMs as Language-guided Visual Navigation agents

VLN-MME: 诊断MLLMs作为语言引导的视觉导航代理

Xunyi Zhao, Gengze Zhou, Qi Wu

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO、cs.CV

AI总结 VLN-MME通过统一评估框架揭示MLLMs在具身导航任务中的局限性,发现其3D空间推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18539 2026-01-07 cs.CV cs.RO 81%

AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans

AdaVLN: 向具有移动人类的连续室内环境中的视觉语言导航迈进

Dillon Loh, Tomasz Bednarz, Xinxing Xia, Frank Guan

机构 * Hiverlab Pte. Ltd.(Hiverlab公司) NVIDIA(NVIDIA公司) Shanghai University(上海大学) Singapore Institute of Technology(新加坡科技学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 AdaVLN通过引入动态人类障碍物和冻结时间机制,提升机器人在连续室内环境中的视觉语言导航能力,以缩小仿真与现实的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03251 2026-01-07 cs.SE 78%

NavAI: A Generalizable LLM Framework for Navigation Tasks in Virtual Reality Environments

NavAI: 一种适用于虚拟现实环境导航任务的通用大语言模型框架

Xue Qin, Matthew DiGiovanni

专题命中 具身导航 :navigation(title,abstract)

AI总结 NavAI是一种基于大语言模型的通用导航框架,能够有效支持虚拟现实环境中的基础动作和复杂目标导向任务,实验显示其在目标导向任务中达到89%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02382 2026-01-07 cs.NI cs.AI cs.IR cs.LG 62%

How to Discover Knowledge for FutureG: Contextual RAG and LLM Prompting for O-RAN

如何为未来G发现知识:面向O-RAN的上下文RAG和LLM提示

Nathan Conger, Nathan Scollar, Kemal Davaslioglu, Yalin E. Sagduyu, Sastry Kompella

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出上下文RAG方法,通过引导文档检索和上下文增强LLM性能,提升ORAN领域问答的准确性和效率,同时保持低运行时间和碳排放。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03159 2026-01-07 cs.RO cs.LG 62%

Systematic Evaluation of Initial States and Exploration-Exploitation Strategies in PID Auto-Tuning: A Framework-Driven Approach Applied on Mobile Robots

PID自整定初始状态与探索-利用策略的系统评估:一种框架驱动方法应用于移动机器人

Zaid Ghazal, Ali Al-Bustami, Khouloud Gaaloul, Jaerock Kwon

机构 * Department of Computer Information Systems, Collage of Engineering and Computer Science, University of Michigan-Dearborn(计算机信息系统系,工程与计算机科学学院,密歇根大学迪尔伯恩分校) Department of Electrical and Computer Engineering, Collage of Engineering and Computer Science, University of Michigan-Dearborn(电气与计算机工程系,工程与计算机科学学院,密歇根大学迪尔伯恩分校)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种框架驱动方法,系统评估PID自整定中初始状态和探索-利用策略的影响,通过移动机器人实验验证其对收敛性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03097 2026-01-07 cs.RO cs.SY eess.SY math.OC 57%

Dual-quaternion learning control for autonomous vehicle trajectory tracking with safety guarantees

双四元数学习控制用于具有安全保证的自动驾驶轨迹跟踪

Omayra Yago Nieto, Alexandre Anahory Simoes, Juan I. Giribet, Leonardo Colombo

机构 * Universidad Politécnica de Madrid(西班牙马德里理工大学) School of Science and Technology, IE University(IE大学科学与技术学院) Universidad de San Andrés (UdeSA) and CONICET(阿根廷圣安德烈斯大学(UdeSA)和CONICET) Centre for Automation and Robotics (CSIC-UPM)(自动化与机器人中心(CSIC-UPM))

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于双四元数的学习控制方法,用于自主机器人在存在扰动时实现鲁棒的轨迹跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02714 2026-01-07 cs.AI cs.CL 57%

Time-Scaling Is What Agents Need Now

现在智能体需要时间扩展

Zhi Liu, Guangzhi Wang

机构 * CareerInternational Research Team(CareerInternational研究团队)

专题命中 具身导航 :world model(abstract);分类 cs.AI

AI总结 本文提出时间扩展概念,旨在通过扩展时间路径提升智能体的深度推理和问题解决能力,无需增加静态参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02645 2026-01-07 cs.RO 57%

Making Infeasible Tasks Feasible: Planning to Reconfigure Disconnected 3D Environments with Movable Objects

使不可行的任务可行:通过可移动物体重新配置断开的3D环境进行规划

Samarth Kalluraya, Yiannis Kantaros

机构 * Department of Electrical and Systems Engineering, Washington University in St. Louis(华盛顿大学圣路易斯分校电子工程与系统工程系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出BRiDGE规划器,通过重新配置可移动物体解决断开3D环境中不可达目标区域的导航问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09111 2026-01-07 cs.CV 57%

DenseSplat: Densifying Gaussian Splatting SLAM with Neural Radiance Prior

DenseSplat: 基于神经辐射先验的高密度高斯喷射SLAM

Mingrui Li, Shuhong Liu, Tianchen Deng, Hongyu Wang

机构 * Department of Computer Science, Dalian University of Technology(大连理工大学计算机科学系) Department of Mechano-informatics, Information Science and Technology, The University of Tokyo(东京大学机械信息学系、信息科学与技术系) Institute of Medical Robotics and Department of Automation, Shanghai Jiao Tong University(上海交通大学医学机器人研究所、自动化系) Key Laboratory of System Control and Information Processing, Ministry of Education(教育部系统控制与信息处理重点实验室)

专题命中 具身导航 :robotic(abstract);分类 cs.CV

AI总结 DenseSplat结合NeRF和3DGS优势,通过稀疏关键帧和神经辐射先验实现高密度SLAM,提升地图完整性和跟踪精度。

Comments IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02363 2026-01-07 cs.HC cs.CY 50%

Acceptance of cybernetic avatars for capability enhancement: a large-scale survey

对能力增强的赛博格仿生人接受度的研究:一项大规模调查

Laura Aymerich-Franch, Tarek Taha, Hiroko Kamide, Takahiro Miyashita, Hiroshi Ishiguro, Paolo Dario

专题命中 具身导航 :robotic(abstract)

AI总结 本研究通过大规模调查探讨了赛博格仿生人在六个领域中对能力增强的接受度,发现多语言交流和学习能力最受支持,而永生场景支持率最低。

Comments 22 pages, 1 Table, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2601.03038 2026-01-07 cs.RO cs.AI 62%

Validating Generalist Robots with Situation Calculus and STL Falsification

用情况演算和STL反例检验通用机器人

Changwen Li, Rongjie Yan, Chih-Hong Cheng, Jian Zhang

机构 * Key Laboratory of Software System, ISCAS, China(软件系统重点实验室,中国) Carl von Ossietzky Universität Oldenburg, Germany(奥尔登堡卡尔·冯·奥西特齐大学,德国)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出结合情况演算和STL反例检验的两层框架,用于验证通用机器人,通过抽象推理和具体模拟揭示失败案例,提升机器人自主性验证效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03044 2026-01-07 cs.RO 57%

SOP: A Scalable Online Post-Training System for Vision-Language-Action Models

SOP:一种可扩展的在线后训练系统用于视觉-语言-动作模型

Mingjie Pan, Siyuan Feng, Qinglin Zhang, Xinchen Li, Jianheng Song, Chendi Qu, Yi Wang, Chuankang Li, Ziyu Xiong, Zhi Chen, Yi Liu, Jianlan Luo

机构 * Agibot Research(Agibot研究机构) Shanghai Innovation Institute(上海创新研究院)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 SOP系统通过在线分布式后训练提升视觉-语言-动作模型在现实世界中的性能,实现高效可靠的多任务适应。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 3 篇

2601.02378 2026-01-07 cs.RO 87%

Modeling the Mental World for Embodied AI: A Comprehensive Review

构建具身AI的内心世界:全面综述

Biyuan Liu, Daigang Xu, Lei Jiang, Wenjun Guo, Ping Chen

机构 * ZTE Corporation(中兴通讯公司)

专题命中 人机交互与遥操作 :embodied AI(title,abstract);embodied agent(abstract);world model(abstract);robotic(abstract)

AI总结 本文综述了具身AI中内心世界模型的研究,构建了理论框架,定义了关键组件,并分析了两种核心理论思维推理范式,以促进人机协作发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03070 2026-01-07 cs.RO 70%

HEXAR: a Hierarchical Explainability Architecture for Robots

HEXAR:机器人中的分层可解释性架构

Tamlin Love, Ferran Gebellí, Pradip Pramanick, Antonio Andriella, Guillem Alenyà, Anais Garrell, Raquel Ros, Silvia Rossi

机构 * Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人与信息工业研究所(CSIC-UPC)) PAL Robotics(PAL机器人技术公司) University of Naples Federico II(那不勒斯费德里科二世大学) Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究所(IIIA-CSIC))

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 HEXAR通过分层可解释性架构提升机器人系统的透明度和可解释性,有效提高根因识别和运行效率。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16853 2026-01-07 cs.CV 57%

ISCS: Parameter-Guided Feature Pruning for Resource-Constrained Embodied Perception

ISCS: 用于资源受限具身感知的参数引导特征剪枝

Jinhao Wang, Nam Ling, Wei Wang, Wei Jiang

机构 * Santa Clara University(圣克拉拉大学) Futurewei Technologies, Inc.(未来通信技术公司)

专题命中 人机交互与遥操作 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出ISCS方法,通过参数统计学识别关键通道,实现轻量级分步计算,提升资源受限具身感知系统的速度与精度。

Comments Significant revision: The focus has been pivoted from learned image compression to embodied perception tasks. Experimental results and downstream applications have been updated to demonstrate the method's efficiency in split computing

详情

展开后加载摘要…

URL PDF HTML 收藏