arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-02-16 至 2026-02-16 共收录 43 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2406.19391 2026-02-16 cs.CV 57%

Fibottention: Inceptive Visual Representation Learning with Diverse Attention Across Heads

Fibottention: 基于多头注意力的视觉表征学习

Ali K. Rahimian, Manish K. Govind, Subhajit Maity, Dominick Reilly, Christian Kümmerle, Srijan Das, Aritra Dutta

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Central Florida(佛罗里达大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 Fibottention通过引入稀疏自注意力机制,实现高效视觉表征学习,减少计算复杂度并提升表示多样性。

Comments The complete implementation, including source code and evaluation scripts, is publicly available at: https://github.com/Charlotte-CharMLab/Fibottention

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 8 篇

2602.13086 2026-02-16 cs.RO 88%

UniManip: General-Purpose Zero-Shot Robotic Manipulation with Agentic Operational Graph

UniManip: 通用目的零样本机器人操作的代理操作图

Haichao Liu, Yuanjiang Xue, Yuheng Zhou, Haoyuan Deng, Yinan Liang, Lihua Xie, Ziwei Wang

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(南洋理工大学电子与电气工程学院) Department of Automation, Tsinghua University, China(清华大学自动化系)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 UniManip通过双层代理操作图实现通用零样本机器人操作,结合高层任务协调与底层动态状态表示,提升无监督环境下的执行鲁棒性。

Comments 15 pages, 12 figures, 6 tables, project page: https://henryhcliu.github.io/unimanip

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12918 2026-02-16 cs.RO 79%

Adding internal audio sensing to internal vision enables human-like in-hand fabric recognition with soft robotic fingertips

添加内部音频感知至内部视觉可使软机器人指尖实现类人手持织物识别

Iris Andrussow, Jans Solano, Benjamin A. Richardson, Georg Martius, Katherine J. Kuchenbecker

机构 * Haptic Intelligence Department, Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所人机交互部门) Department for Distributed Intelligence / Autonomous Learning, University of Tübingen(图宾根大学分布式智能/自主学习部门)

专题命中 机器人操作 :robotic(title,abstract);分类 cs.RO

AI总结 本研究通过结合内部视觉和音频感知,使软机器人指尖实现类人织物识别,利用变压器方法在 20 种常见织物上达到 97% 分类准确率。

Journal ref 2025 IEEE-RAS 24th International Conference on Humanoid Robots (Humanoids)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12532 2026-02-16 cs.RO 79%

CRAFT: Adapting VLA Models to Contact-rich Manipulation via Force-aware Curriculum Fine-tuning

CRAFT: 通过力感知的课程微调适应接触密集的操纵

Yike Zhang, Yaonan Wang, Xinxin Sun, Kaizhen Huang, Zhiyuan Xu, Junjie Ji, Zhengping Che, Jian Tang, Jingtao Sun

机构 * National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 CRAFT通过力感知课程微调提升机器人在接触密集任务中的表现,实现稳健且可推广的操纵能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09600 2026-02-16 cs.CV 70%

Hand2World: Autoregressive Egocentric Interaction Generation via Free-Space Hand Gestures

Hand2World: 通过自由空间手势生成自主回归的视角交互

Yuxi Wang, Wenqi Ouyang, Tianyi Wei, Yi Dong, Zhiqi Shen, Xingang Pan

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 机器人操作 :embodied AI(abstract);world model(abstract);分类 cs.CV

AI总结 Hand2World通过自由空间手势生成视角交互,利用自回归框架解决遮挡、相机运动解耦和长视频生成问题,提升视觉生成的质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12108 2026-02-16 cs.SI cs.AI cs.CY cs.HC cs.LG 62%

Multimodal Coordinated Online Behavior: Trade-offs and Strategies

多模态协调在线行为:权衡与策略

Lorenzo Mannocci, Stefano Cresci, Matteo Magnani, Anna Monreale, Maurizio Tesconi

机构 * University of Pisa(比萨大学) Institute for Informatics and Telematics, National Research Council (IIT-CNR)(信息学与电信学研究院,国家研究理事会(IIT-CNR)) InfoLab, Department of Information Technology, Uppsala University(信息实验室,信息科技系,乌普萨拉大学)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本研究探讨多模态协调在线行为的权衡与策略,通过比较不同方法揭示多模态分析在捕捉协调行为结构方面的优势。

Comments Postprint of the article published in the Information Sciences journal. Please, cite accordingly

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12905 2026-02-16 cs.CV 57%

Adaptive Scaling with Geometric and Visual Continuity of completed 3D objects

具有几何和视觉连续性的自适应缩放完成3D对象

Jelle Vermandere, Maarten Bassier, Maarten Vergauwen

机构 * KU Leuven, Department of Civil Engineering(卢森堡大学土木工程系)

专题命中 机器人操作 :manipulation(abstract);分类 cs.CV

AI总结 本文提出一种部分感知的自适应缩放方法,通过自动分割和插值实现对完成3D对象的灵活、无伪影变形,提升复杂和重复结构的视觉效果。

Comments ISPRS Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10727 2026-02-16 cs.LG 57%

Rising Multi-Armed Bandits with Known Horizons

具有已知时间范围的多臂老虎机

Seockbean Song, Chenyu Gan, Youngsik Yoon, Siwei Wang, Wei Chen, Jungseul Ok

机构 * Department of CSE, POSTECH, Pohang, Republic of Korea(POSTECH 电子工程系) Graduate School of AI, POSTECH, Pohang, Republic of Korea(POSTECH 人工智能研究生院) Microsoft Research, Beijing, China(微软研究院) Qiuzhen College, Tsinghua University, Beijing, China(清华大学求真学院)

专题命中 机器人操作 :robotics(abstract);分类 cs.LG

AI总结 本文提出CURE-UCB算法,通过整合已知时间范围来提升多臂老虎机问题的性能,证明其在结构化环境中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13009 2026-02-16 eess.SY cs.SY 50%

Bayesian Optimization Based Grid Point Allocation for LPV and Robust Control

基于贝叶斯优化的网格点分配用于LPV和鲁棒控制

E. Javier Olucha, Arash Sadeghzadeh, Amritam Das, Roland Tóth

专题命中 机器人操作 :robotic(abstract)

AI总结 本文提出基于贝叶斯优化的网格点分配方法,用于高效设计LPV和鲁棒控制器,通过自动确定信息量足够的网格点,提升系统稳定性和性能。

Comments Manuscript submitted to International Journal of Robust and Nonlinear Control

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 11 篇

2602.13159 2026-02-16 cs.RO 83%

Temporally-Sampled Efficiently Adaptive State Lattices for Autonomous Ground Robot Navigation in Partially Observed Environments

时间采样的高效自适应状态格子用于部分观测环境中的自主地面机器人导航

Ashwin Satish Menon, Eric R. Damm, Eli S. Lancaster, Felix A. Sanchez, Jason M. Gregory, Thomas M. Howard

机构 * University of Rochester(罗切斯特大学) DEVCOM Army Research Lab(陆军研究实验室) Parsons Corporation(帕尔逊公司)

专题命中 具身导航 :navigation(title,abstract);robotics(abstract);分类 cs.RO

AI总结 本文提出TSEASL,一种用于部分观测环境的自主地面机器人导航方法,通过自适应状态格子提升规划稳定性,减少手动干预需求。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14978 2026-02-16 cs.RO 80%

PA-MPPI: Perception-Aware Model Predictive Path Integral Control for Quadrotor Navigation in Unknown Environments

PA-MPPI:感知-aware的模型预测路径积分控制用于未知环境中的四旋翼导航

Yifan Zhai, Rudolf Reiter, Davide Scaramuzza

机构 * University of Zurich(苏黎世大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO;robotics(journal_ref)

AI总结 PA-MPPI通过结合感知信息,提升了四旋翼在未知环境中的导航能力,能够有效探索未知区域并规划替代路径。

Journal ref IEEE Robotics and Automation Letters (RA-L), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12597 2026-02-16 cs.RO cs.HC 79%

PISHYAR: A Socially Intelligent Smart Cane for Indoor Social Navigation and Multimodal Human-Robot Interaction for Visually Impaired People

PISHYAR:一种具有社会智能的智能拐杖,用于室内社交导航和多模态人机交互,以支持视障人士

Mahdi Haghighat Joo, Maryam Karimi Jafari, Alireza Taheri

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 PISHYAR是一款结合社会智能导航与多模态交互的智能拐杖,通过多模态技术提升视障人士的移动辅助与社交互动能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12416 2026-02-16 cs.RO cs.SY eess.SY 79%

Control Barrier Functions with Audio Risk Awareness for Robot Safe Navigation on Construction Sites

具有音频风险意识的控制障碍函数用于建筑工地机器人安全导航

Johannes Mootz, Reza Akhavian

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于控制障碍函数的机器人安全导航方法,通过音频风险提示增强避障能力,有效提升建设工地环境下的自主导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19140 2026-02-16 cs.RO cs.SY eess.SY 79%

Dom, cars don't fly! -- Or do they? In-Air Vehicle Maneuver for High-Speed Off-Road Navigation

Dom, cars don't fly! -- Or do they? 高速越野导航中的空中车辆操控

Anuj Pokhrel, Aniket Datar, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于混合前向动力学模型的空中车辆操控方法,通过车辆控制实现高速越野导航中的精准空中 maneuver。

Comments 8 Pages, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12838 2026-02-16 cs.RO cs.SY eess.SY 57%

SKYSURF: A Self-learning Framework for Persistent Surveillance using Cooperative Aerial Gliders

SKYSURF:一种基于合作空中滑翔机的自学习框架用于持久监视

Houssem Eddine Mohamadi, Nadjia Kara

机构 * Department of Software and IT Engineering(软件与信息技术工程系) École de Technologie Supérieure(高级技术学院)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 SKYSURF提出了一种自学习框架,通过合作空中滑翔机实现持久监视,通过局部-全局行为管理提升路径规划和碰撞避免,减少能耗并提高目标检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11827 2026-02-16 cs.RO cs.HC 57%

Auditory-Tactile Congruence for Synthesis of Adaptive Pain Expressions in RoboPatients

听觉-触觉一致性用于罗波患者适应性疼痛表达的合成

Saitarun Nadipineni, Chapa Sirithunge, Yue Xie, Fumiya Iida, Thilina Dulantha Lalitharatne

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本研究提出通过调节音调和幅度实现听觉触觉一致性,以提高机器人患者模拟器中疼痛表达的感知一致性。

Comments 20 pages, 8 figures, journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12489 2026-02-16 cs.CV 57%

Insertion Network for Image Sequence Correspondence

图像序列对应性插入网络

Dingjie Su, Weixiang Hong, Benoit M. Dawant, Bennett A. Landman

机构 * Vanderbilt University(范德比大学) University of Portsmouth(波特兰大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 该研究提出了一种基于插入网络的图像序列对应方法,用于提高三维体积中切片定位的准确性,通过上下文信息建模实现比现有方法更精确的切片定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12421 2026-02-16 cs.RO math.OC 57%

An Autonomous, End-to-End, Convex-Based Framework for Close-Range Rendezvous Trajectory Design and Guidance with Hardware Testbed Validation

一种自主、端到端、基于凸优化的近程会合轨迹设计与引导框架,配有硬件测试台验证

Minduli C. Wijayatunga, Julian Guinane, Nathan D. Wallace, Xiaofeng Wu

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出CORTEX框架,结合深度学习感知与凸优化,实现近距离会合轨迹设计与引导,通过软件和硬件测试验证其鲁棒性和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12688 2026-02-16 eess.SP 50%

GNSS Jamming Detection with Automatic Gain Control (AGC) and Carrier-to-Noise Ratio Density (CNO) Observables from a COTS receiver

基于COTS接收机的自动增益控制(AGC)和载波噪声比密度(CNO)可观测量的GNSS干扰检测

Syed Ali Kazim, Anas Darwich, Juliette Marais

专题命中 具身导航 :navigation(abstract)

AI总结 本研究探讨了GNSS干扰检测中自动增益控制(AGC)和载波噪声比密度(CNO)可观测量在COTS接收机中的应用,重点分析了啁啾干扰对GPS L1接收机的影响。

Journal ref 7th SmartRacon scientific seminar, Oct 2025, Stuttgart, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12554 2026-02-16 astro-ph.EP astro-ph.IM 50%

Bundle adjustment of Hayabusa2's ONC images and controlled color mosaic map of Ryugu

Hayabusa2的ONC图像捆绑调整与瑞顾的受控彩色镶嵌图

Naoyuki Hirata, Eri Tatsumi, Mayumi Ichikawa, Kazuhiro Honda, Sayuri Tanaka

专题命中 具身导航 :navigation(abstract)

AI总结 Hayabusa2任务通过捆绑调整优化ONC图像几何,生成瑞顾的全球和区域彩色镶嵌图,为科学研究提供高精度图像和地图数据。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 1 篇

2602.12540 2026-02-16 cs.CV cs.RO 81%

Self-Supervised JEPA-based World Models for LiDAR Occupancy Completion and Forecasting

基于JEPA的世界模型的自监督LiDAR占用完成与预测

Haoran Zhu, Anna Choromanska

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出AD-LiST-JEPA,一种基于JEPA框架的自监督世界模型,用于自动驾驶中通过LiDAR数据预测未来时空演变,并在占用完成与预测任务中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人基础模型 1 篇

2412.14058 2026-02-16 cs.RO cs.CV 73%

What Matters in Building Vision-Language-Action Models for Generalist Robots

在通用机器人中构建视觉-语言-动作模型所关注的关键因素

Xinghang Li, Peiyan Li, Long Qian, Minghuan Liu, Dong Wang, Jirong Liu, Bingyi Kang, Xiao Ma, Xinlong Wang, Di Guo, Tao Kong, Hanbo Zhang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ByteDance Research(字节跳动研究院) CASIA MAIS-NLPR Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本研究揭示了构建通用机器人视觉-语言-动作模型的关键因素,开发了无需大量手动设计的RoboVLMs,实现了模拟和现实任务中的新状态-of-the-art性能。

Comments Project page: robovlms.github.io. Added limitations and future works. Fix categorization

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 模仿学习与强化学习 8 篇

2602.12351 2026-02-16 cs.RO cs.CV 82%

LongNav-R1: Horizon-Adaptive Multi-Turn RL for Long-Horizon VLA Navigation

LongNav-R1: 基于水平自适应的多轮强化学习用于长周期视觉语言导航

Yue Hu, Avery Xi, Qixin Xiao, Seth Isaacson, Henry X. Liu, Ram Vasudevan, Maani Ghaffari

机构 * University of Michigan(密歇根大学)

专题命中 模仿学习与强化学习 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 LongNav-R1通过多轮强化学习提升长周期视觉语言导航性能,实现高效样本利用和多样化导航行为。

Comments VLA, Navigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 81%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 模仿学习与强化学习 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12492 2026-02-16 cs.RO cs.LG 76%

Composable Model-Free RL for Navigation with Input-Affine Systems

可组合的无模型强化学习用于具有输入仿射系统的导航

Xinhuan Sang, Abdelrahman Abdelgawad, Roberto Tron

机构 * Boston University(波士顿大学)

专题命中 模仿学习与强化学习 :navigation(title);分类 cs.RO、cs.LG

AI总结 本文提出了一种可组合的无模型强化学习方法,用于具有输入仿射系统的导航,通过在线组合学习的价值函数和策略实现目标到达和碰撞避免。

Comments 17 pages, 8 figures. Submitted to WAFR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12846 2026-02-16 cs.LG cs.AI 62%

Amortized Reasoning Tree Search: Decoupling Proposal and Decision in Large Language Models

渐进推理树搜索:在大语言模型中解耦提案与决策

Zesheng Hong, Jiadong Yu, Hui Pan

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 ARTS通过解耦生成与验证,有效解决大语言模型中推理路径被压制的问题,实现74.6%的性能,优于完全微调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12636 2026-02-16 cs.LG cs.RO 62%

Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL

双粒度对比奖励 via 生成 episodic 引导 为高效 embodied RL

Xin Liu, Yixuan Li, Yuhui Chen, Yuxing Qin, Haoran Li, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出DEG方法,通过生成episodic引导实现高效具身RL,无需人工标注,提升样本效率和任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13016 2026-02-16 cs.RO 57%

How Swarms Differ: Challenges in Collective Behaviour Comparison

群集行为的差异:集体行为比较中的挑战

André Fialho Jesus, Jonas Kuckling

机构 * Department of Computer and Information Science(计算机与信息科学系) Centre for the Advanced Study of Collective Behaviour(集体行为高级研究中心) Zukunftskolleg(未来学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO

AI总结 本文研究了群集行为比较中的挑战,提出了一种基于自组织映射的方法来识别特征空间中难以区分行为的区域。

Comments Accepted for publication in the proceeding of ANTS 2026 - 15th International Conference on Swarm Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12734 2026-02-16 cs.RO 57%

Scaling Single Human Demonstrations for Imitation Learning using Generative Foundational Models

通过生成基础模型扩展单人示范用于模仿学习

Nick Heppert, Minh Quang Nguyen, Abhinav Valada

机构 * Computer Science, University of Freiburg(弗赖堡大学计算机科学系) Zuse School ELIZA(泽乌斯学校ELIZA)

专题命中 模仿学习与强化学习 :manipulation(abstract);分类 cs.RO

AI总结 通过生成基础模型扩展单人示范用于模仿学习,实现从单人示范到机器人任务的高效训练与泛化

Comments ICRA 2026, 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12520 2026-02-16 cs.LG cs.MA 57%

Multi-Agent Model-Based Reinforcement Learning with Joint State-Action Learned Embeddings

基于联合状态-动作学习嵌入的多智能体模型驱动强化学习

Zhizun Wang, David Meger

机构 * McGill University(麦吉尔大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.LG

AI总结 本文提出了一种基于联合状态-动作学习嵌入的多智能体模型驱动强化学习框架,通过统一表示学习与想象式回放,提升智能体在动态环境中协调能力与长期规划效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏