arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-16 至 2025-12-16 共收录 89 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 28 篇

2509.18734 2025-12-16 cs.RO 79%

Learning Obstacle Avoidance using Double DQN for Quadcopter Navigation

使用双DQN学习避障以实现四旋翼导航

Nishant Doshi, Amey Sutavani, Sanket Gujar

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出使用双DQN算法,通过深度相机实现四旋翼机器人在模拟城市环境中的避障导航学习。

Comments Fixed typo in second author's name throughout the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10082 2025-12-16 cs.RO eess.SP 79%

Unscented Kalman Filter with a Nonlinear Propagation Model for Navigation Applications

用于导航应用的非线性传播模型无迹卡尔曼滤波器

Amit Levy, Itzik Klein

机构 * Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa(海法大学海洋科技学院查内海洋科学学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种基于非线性动态模型的无迹卡尔曼滤波器,以提升导航应用中的估计精度和性能。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07697 2025-12-16 cs.RO 79%

Transformer-Based Robust Underwater Inertial Navigation in Prolonged Doppler Velocity Log Outages

基于Transformer的长时间多普勒速度计故障下的水下惯性导航

Zeev Yampolsky, Nadav Cohen, Itzik Klein

机构 * The Hatter Department of Marine Technologies(哈特尔海洋技术系) Charney School of Marine Sciences(查纳耶海洋科学学院) University of Haifa(海法大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种基于Transformer的深度学习方法,用于解决长时间多普勒速度计故障下的水下导航问题,显著提升了速度估计精度和位置准确性。

Comments Eight pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23445 2025-12-16 cs.RO cs.IR 79%

Design and Experimental Validation of an Autonomous USV for Sensor Fusion-Based Navigation in GNSS-Denied Environments

面向GNSS拒止环境的自主水下无人艇设计与实验验证

Samuel Cohen-Salmon, Itzik Klein

机构 * The Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa, Israel(海洋技术系、海洋科学学院、海法大学,以色列)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出了一种面向GNSS拒止环境的自主无人艇,通过模块化设计和传感器融合技术实现导航算法的实测验证。

Comments submitted to IEEE OCEANS 2025 Brest

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21727 2025-12-16 cs.RO 79%

Enhancing Underwater Navigation through Cross-Correlation-Aware Deep INS/DVL Fusion

通过交叉相关感知的深度INS/DVL融合增强水下导航

Nadav Cohen, Itzik Klein

机构 * The Hatter Department of Marine Technologies, Charney School of Marine Sciences, University of Haifa Haifa, Israel(海洋技术系、海洋科学学院、海法大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 本文提出一种交叉相关感知的深度INS/DVL融合框架,通过改进滤波器一致性提升水下导航精度,实验证明其在状态不确定性方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08809 2025-12-16 cs.RO cs.AI 79%

DCNet: A Data-Driven Framework for DVL Calibration

DCNet:一种数据驱动的DVL校准框架

Zeev Yampolsky, Itzik Klein

机构 * Hatter Department of Marine Technologies(海洋技术系) Charney School of Marine Sciences(海洋科学学院) University of Haifa(海法大学)

专题命中 具身导航 :robotics(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 DCNet通过数据驱动框架实现快速DVL校准,提升AUV导航精度与效率

Comments 10 Pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10363 2025-12-16 cs.RO 70%

BEASST: Behavioral Entropic Gradient based Adaptive Source Seeking for Mobile Robots

基于行为熵梯度的自适应源寻找移动机器人框架

Donipolo Ghimire, Aamodh Suresh, Carlos Nieto-Granda, Solmaz S. Kia

机构 * Department of Mechanical and Aerospace Engineering, University of California, Irvine(加州大学尔湾分校机械与航空航天工程系) U.S. DEVCOM Army Research Laboratory (ARL)(美国陆军研究实验室)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 BEASST通过行为熵梯度和自适应策略,提升移动机器人在复杂环境中的源寻找效率,实现路径优化与快速定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21350 2025-12-16 cs.RO cs.SE 70%

A Data-Driven Method for INS/DVL Alignment

一种数据驱动的惯性导航系统/多普勒速度计对齐方法

Guy Damari, Itzik Klein

机构 * The Hatter Department of Marine Technologies(海洋技术系) Charney School of Marine Sciences, University of Haifa(海洋科学学院,海法大学)

专题命中 具身导航 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种端到端深度学习框架,用于提高自主水下机器人中惯性导航系统与多普勒速度计的对齐精度和收敛效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12945 2025-12-16 cs.RO cs.CV 62%

SLIM-VDB: A Real-Time 3D Probabilistic Semantic Mapping Framework

SLIM-VDB:一种实时三维概率语义映射框架

Anja Sheppard, Parker Ewen, Joey Wilson, Advaith V. Sethuraman, Benard Adewole, Anran Li, Yuzhen Chen, Ram Vasudevan, Katherine A. Skinner

专题命中 具身导航 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 SLIM-VDB是一种基于OpenVDB数据结构的实时三维概率语义映射框架,实现了内存和整合时间的显著减少,同时保持了较高的映射精度。

Comments Accepted into R-AL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12692 2025-12-16 cs.AI cs.CL cs.LG 62%

WebOperator: Action-Aware Tree Search for Autonomous Agents in Web Environment

WebOperator: 基于动作意识的树搜索用于网络环境中的自主代理

Mahir Labib Dihan, Tanzima Hashem, Mohammed Eunus Ali, Md Rizwan Parvez

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bangladesh University of Engineering and Technology (BUET)(孟加拉工程与技术大学) Faculty of Information Technology(信息技术学院) Monash University(莫纳什大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 WebOperator通过引入树搜索框架,实现可靠的回溯和战略探索,提升自主代理在网页环境中的任务成功率。

Comments Under review at ICLR 2026. Project page: https://kagnlp.github.io/WebOperator/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15315 2025-12-16 cs.LG cs.AI 62%

Diffusion-Driven Inertial Generated Data for Smartphone Location Classification

基于扩散的惯性生成数据用于智能手机位置分类

Noa Cohen, Rotem Dror, Itzik Klein

机构 * The Hatter Department of Marine Technologies, University of Haifa, Israel(海洋技术系,海法大学,以色列) The Department of Information Systems, University of Haifa, Israel(信息系统系,海法大学,以色列)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于扩散模型的惯性生成数据方法,用于提升智能手机位置识别的训练数据质量,通过合成数据减少实际数据收集的负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16573 2025-12-16 cs.RO cs.AI 62%

AUV Acceleration Prediction Using DVL and Deep Learning

基于DVL和深度学习的AUV加速度预测

Yair Stolero, Itzik Klein

机构 * The Hatter Department of Marine Technologies(海洋技术系) Charney School of Marine Sciences(海洋科学学院) University of Haifa(海法大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于DVL和深度学习的AUV加速度预测方法,通过数据驱动技术提升加速度估计精度,从而提高水下导航的准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13438 2025-12-16 cs.SE cs.AI 57%

From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents

从用户界面到代理界面:UI表示的效率优化以提升LLM代理性能

Dezhi Ran, Zhi Gong, Yuzhe Guo, Mengzhou Wu, Yuan Cao, Haochuan Lu, Hengyu Zhang, Xia Zeng, Gang Cao, Liangchao Yao, Yuetang Deng, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU),教育部) SCS, Peking University(SCS,北京大学) Tencent Inc.(腾讯公司) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 UIFormer通过约束优化和结构分解,优化LLM代理的UI表示效率,实现令牌减少与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12993 2025-12-16 cs.RO 57%

Learning Terrain Aware Bipedal Locomotion via Reduced Dimensional Perceptual Representations

通过降维感知表示学习地形感知双足运动

Guillermo A. Castillo, Himanshu Lodha, Ayonga Hereid

机构 * Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) Mechanical and Aerospace Engineering, The Ohio State University(机械与航空航天工程系,俄亥俄州立大学)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 通过降维感知表示学习地形感知双足运动,提升实时步态生成的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06486 2025-12-16 cs.RO 57%

Entropy-Controlled Intrinsic Motivation Reinforcement Learning for Quadruped Robot Locomotion in Complex Terrains

基于熵控制的内在动机强化学习用于复杂地形四足机器人运动

Wanru Gong, Xinyi Zheng, Yuan Hui, Zhongjun Li, Weiqiang Wang, Xiaoqing Zhu

机构 * Faculty of Information Technology, Beijing University of Technology(信息技术学院,北京理工大学) Faculty Nuclear Industry X Intelligence Laboratory, Beijing University of Technology(核工业X智能实验室,北京理工大学) Department of Computer Science, University of Bristol(计算机科学系,布里斯托大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本文提出基于熵控制的内在动机强化学习算法ECIM,用于提升四足机器人在复杂地形中的运动稳定性与能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16809 2025-12-16 cs.CV 57%

GeoTexDensifier: Geometry-Texture-Aware Densification for High-Quality Photorealistic 3D Gaussian Splatting

GeoTexDensifier: 基于几何-纹理的高密度重建用于高质量光实3D高斯点云渲染

Hanqing Jiang, Xiaojun Xiang, Han Sun, Hongjie Li, Liyang Zhou, Xiaoyu Zhang, Guofeng Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 GeoTexDensifier通过结合几何和纹理感知策略,实现高质量的3D高斯点云重建,提升渲染质量。

Comments 14 pages, 9 figures, 2 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17430 2025-12-16 cs.RO eess.SP 57%

Snake-Inspired Mobile Robot Positioning with Hybrid Learning

受蛇启发的混合学习移动机器人定位

Aviad Etzion, Nadav Cohen, Orzion Levy, Zeev Yampolsky, Itzik Klein

机构 * Hatter Department of Marine Technologies, University of Haifa(海法大学海洋技术系)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出MoRPINet框架,通过蛇形滑行运动引导机器人非线性行为,利用神经网络回归行驶距离,以减少惯性导航中的定位误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12228 2025-12-16 cs.RO 57%

Semantic Zone based 3D Map Management for Mobile Robot

基于语义区域的移动机器人3D地图管理

Huichang Yun, Seungho Yoo

机构 * Dept. of computer Engineering, Pukyong National University(计算机工程系,浦兴国立大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出基于语义区域的3D地图管理方法,通过动态加载与任务相关的区域到工作内存,有效减少内存使用并提升移动机器人导航效率。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21180 2025-12-16 cs.RO 57%

STITCHER: Real-Time Trajectory Planning with Motion Primitive Search

STITCHER:基于运动片段搜索的实时轨迹规划

Helene J. Levy, Brett T. Lopez

机构 * VECTR Laboratory, University of California, Los Angeles(UC洛杉矶大学VECTR实验室)

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 STITCHER通过实时拼接短轨迹段实现高效无碰撞轨迹规划,克服传统优化方法在计算时间和稳定性上的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11300 2025-12-16 quant-ph 50%

Distributed Quantum Magnetic Sensing for Infrastructure-free Geo-localization

分布式量子磁传感用于无基础设施的地理定位

Thinh Le, Shiqian Guo, Jianqing Liu

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出利用量子磁传感技术实现无基础设施的地理定位,通过分布式传感协议和马氏距离搜索,提高定位精度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12164 2025-12-16 cond-mat.mtrl-sci 50%

Random Combinatorial Libraries and Automated Nanoindentation for High-Throughput Structural Materials Discovery

随机组合库与自动化纳米压痕用于高通量结构材料发现

Vivek Chawla, Dayakar Penumadu, Sergei Kalinin

专题命中 具身导航 :navigation(abstract)

AI总结 本研究提出利用随机组合库与自动化纳米压痕技术,实现高通量结构材料的快速表征与发现。

Comments 26 pages, 10 figures (7 main, 3 supplemental)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 5 篇

2503.02904 2025-12-16 eess.IV cs.CV cs.LG 81%

Surgical Vision World Model

手术视觉世界模型

Saurabh Koju, Saurav Bastola, Prashant Shrestha, Sanskar Amgain, Yash Raj Shrestha, Rudra P. K. Poudel, Binod Bhattarai

机构 * University of Aberdeen, UK(阿伯丁大学,英国) Cambridge Research Laboratory, Toshiba Europe Ltd, UK(剑桥研究实验室,东芝欧洲有限公司,英国) Nepal Applied Mathematics and Informatics Institute for research (Naamii), Nepal(尼泊尔应用数学与信息学研究所(Naamii),尼泊尔) University of Lausanne, Switzerland(洛桑大学,瑞士)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文提出首个手术视觉世界模型,通过生成动作可控的手术数据,提升自主手术代理训练的现实感与交互性。

Comments This paper has been accepted at the Data Engineering in Medical Imaging Workshop, MICCAI 2025

Journal ref MICCAI Workshop on Data Engineering in Medical Imaging (2025) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13604 2025-12-16 cs.CV 79%

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

LongVie 2: 多模态可控超长视频世界模型

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu

机构 * FDU(福建大学) NJU(南京大学) NTU(National University of Taiwan) NVIDIA(英伟达) THU(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 LongVie 2通过多模态引导、退化感知训练和历史-上下文引导,实现了超长视频的可控生成,支持连续视频生成长达五分钟,推动视频世界建模的统一发展。

Comments Project Page: https://vchitect.github.io/LongVie2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 79%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19773 2025-12-16 gr-qc hep-th 78%

On the uplift of 4D wormholes in Braneworld models and their 5D structure

关于Braneworld模型中4D虫洞的提升及其5D结构

Thomas D. Pappas, Theodoros Nakas

专题命中 具身推理 :world model(title,abstract)

AI总结 本文研究了Braneworld模型中4D虫洞的提升及其5D结构,推导了通用条件并首次提出flare-out条件,揭示了扭曲额外维度对5D虫洞结构的影响。

Comments 37 pages, 11 figures. v2: Significantly enriched and extended analysis in preparation for journal submission; method generalized to arbitrary radial coordinates; further examples added, including thick-brane models and non-isometric wormholes

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 62%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2512.13080 2025-12-16 cs.RO 77%

Spatial-Aware VLA Pretraining through Visual-Physical Alignment from Human Videos

通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练

Yicheng Feng, Wanpeng Zhang, Ye Wang, Hao Luo, Haoqi Yuan, Sipeng Zheng, Zongqing Lu

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) BeingBeyond

专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);robotic(abstract);分类 cs.RO

AI总结 通过人类视频中的视觉-物理对齐实现空间感知的VLA预训练,提升机器人任务的稳健性和通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11921 2025-12-16 cs.RO cs.AI 73%

Towards Accessible Physical AI: LoRA-Based Fine-Tuning of VLA Models for Real-World Robot Control

迈向可及的物理AI:基于LoRA的VLA模型在现实机器人控制中的微调

Abdullah Yahya Abdullah Omaisan, Ibrahim Sheikh Mohamed

机构 * Independent Researchers(独立研究者)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出基于LoRA的VLA模型微调方法,使大规模VLA模型能在消费级GPU上高效运行,实现在低成本机器人平台上的现实部署。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 5 篇

2501.10100 2025-12-16 cs.RO cs.AI cs.LG 91%

Robotic World Model: A Neural Network Simulator for Robust Policy Optimization in Robotics

机器人世界模型:一种用于机器人鲁棒策略优化的神经网络模拟器

Chenhao Li, Andreas Krause, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 模仿学习与强化学习 :world model(title,abstract);robotic(title,abstract);robotics(title);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出了一种基于神经网络的机器人世界模型,通过双自回归机制和自监督训练实现鲁棒的长周期预测,从而提升机器人策略优化的效率和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21127 2025-12-16 cs.LG cs.AI 62%

Meta Policy Switching for Secure UAV Deconfliction in Adversarial Airspace

元策略切换用于对抗性空域中的安全无人机脱困

Deepak Kumar Panda, Weisi Guo

机构 * Faculty of Engineering and Applied Sciences, Cranfield University(工程与应用科学学院,克兰菲尔德大学)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出元策略切换框架,通过动态选择稳健策略提升无人机在对抗性空域中的安全导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏