arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-09 至 2025-12-09 共收录 86 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 20 篇

2409.14985 2025-12-09 cs.CV cs.AI 62%

Image-Guided Semantic Pseudo-LiDAR Point Generation for 3D Object Detection

基于图像的语义伪LiDAR点生成用于3D目标检测

Minseung Lee, Seokha Moon, Seung Joon Lee, Reza Mahjourian, Jinkyu Kim

机构 * CSE, Korea University(韩国大学计算机科学与工程系) LG Innotek Waymo Research(Waymo研究院)

专题命中 具身导航 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 ImagePG通过利用图像特征生成密集且语义丰富的3D点,提升自动驾驶中对小目标和远距离目标的检测性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06154 2025-12-09 cs.RO 61%

Exploring Adversarial Obstacle Attacks in Search-based Path Planning for Autonomous Mobile Robots

探索基于搜索的路径规划中对抗性障碍攻击

Adrian Szvoren, Jianwei Liu, Dimitrios Kanoulas, Nilufer Tuptuk

机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院)

专题命中 具身导航 :robotics(abstract,journal_ref);分类 cs.RO

AI总结 研究针对自主移动机器人路径规划中对抗性障碍攻击的鲁棒性,通过模拟和现实实验验证攻击对路径规划的影响,揭示环境因素对算法鲁棒性的重要性。

Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA), Atlanta, GA, USA, 2025, pp. 14843-14849

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07807 2025-12-09 cs.CV cs.GR 57%

Lang3D-XL: Language Embedded 3D Gaussians for Large-scale Scenes

Lang3D-XL: 语言嵌入的3D高斯用于大规模场景

Shai Krakovsky, Gal Fiebelman, Sagie Benaim, Hadar Averbuch-Elor

机构 * Tel Aviv University(特拉维夫大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Cornell University(康奈尔大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 Lang3D-XL通过引入语言嵌入的3D高斯表示,提升大规模场景的语义理解和交互效率,优于现有方法。

Comments Accepted to SIGGRAPH Asia 2025. Project webpage: https://tau-vailab.github.io/Lang3D-XL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07574 2025-12-09 eess.IV cs.CR cs.CV 57%

Precise Liver Tumor Segmentation in CT Using a Hybrid Deep Learning-Radiomics Framework

使用混合深度学习-放射组学框架进行CT中肝肿瘤的精确分割

Xuecheng Li, Weikuan Jia, Komildzhon Sharipov, Alimov Ruslan, Lutfuloev Mazbutdzhon, Ismoilov Shuhratjon, Yuanjie Zheng

机构 * School of Information Science & Engineering, Shandong Normal University(信息科学与工程学院,山东师范大学) Tajik State University of Law, Business and Politics(塔吉克国立法律、商业与政治大学)

专题命中 具身导航 :navigation(abstract);分类 cs.CV

AI总结 本文提出混合深度学习-放射组学框架,用于CT中肝肿瘤的精确分割,结合注意力增强的U-Net与放射组学特征筛选,提升分割精度与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07114 2025-12-09 cs.RO cs.SY eess.SY 57%

Surrogate compliance modeling enables reinforcement learned locomotion gaits for soft robots

代理合规建模使软机器人能够通过强化学习获得运动步态

Jue Wang, Mingsong Jiang, Luis A. Ramirez, Bilige Yang, Mujun Zhang, Esteban Figueroa, Wenzhong Yan, Rebecca Kramer-Bottiglio

机构 * Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 本研究提出了一种代理合规建模方法,通过刚体模拟器实现软机器人运动步态的强化学习,从而在仿真中获得高保真度的现实迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06207 2025-12-09 cs.RO 57%

Where to Fly, What to Send: Communication-Aware Aerial Support for Ground Robots

在哪里飞行,什么要发送:面向地面机器人的通信感知支持

Harshil Suthar, Dipankar Maity

专题命中 具身导航 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种通信感知支持框架,通过信息价值和效用评分策略,优化空中机器人在未知环境中的信息传输与探索任务。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07512 2025-12-09 eess.SP 50%

Dictionary-Based Contrastive Learning for GNSS Jamming Detection

基于字典的对比学习用于GNSS干扰检测

Zawar Hussain, Arslan Majal, Aamir Hussain Chughtai, Talha Nadeem

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出基于字典的对比学习框架,用于在资源受限的嵌入式系统中实现高效、准确的GNSS干扰检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07483 2025-12-09 cs.HC 50%

SemanticTours: A Conceptual Framework for Non-Linear, Knowledge Graph-Driven Data Tours

SemanticTours: 一个非线性、基于知识图谱的数据游览概念框架

Daniel Fürst, Matthijs Jansen op de Haar, Mennatallah El-Assady, Daniel A Keim, Maximilian T. Fischer

专题命中 具身导航 :navigation(abstract)

AI总结 SemanticTours通过构建领域特定的知识图谱,提供非线性导航支持法律案例分析中的分析推理。

Comments 14 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07043 2025-12-09 math.OC 50%

Set-based Optimal, Robust, and Resilient Control with Applications to Autonomous Precision Landing

基于集合的最优、鲁棒和容错控制及其在自主精确着陆中的应用

Abhinav G. Kamath, Abraham P. Vinod, Purnanand Elango, Stefano Di Cairano, Avishai Weiss

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种基于集合的最优、鲁棒和容错控制方法,用于自主系统精确着陆,通过无终点时间优化、扰动集构造和可达集计算实现全局最优和鲁棒性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06934 2025-12-09 q-bio.NC q-bio.QM 50%

Visual Function Profiles via Multi-Path Aggregation Reveal Neuron-Level Responses in the Drosophila Brain

通过多路径聚合的视觉功能谱揭示果蝇大脑神经元级响应

Jiangping Xie, Ruohan Ren, Xiao Zhou, Ao Zheng, Jiasong Zhu, Wenyu Jiang, Ziran Zhao

专题命中 具身导航 :navigation(abstract)

AI总结 本研究提出多路径聚合框架,通过全脑视觉功能谱预测果蝇神经元响应,实现导航与避障,为脑启发智能提供神经元级指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.17500 2025-12-09 stat.AP cs.CE 50%

Using iterated local alignment to aggregate trajectory data into a traffic flow map

利用迭代局部对齐来汇总轨迹数据生成交通流地图

Tarn Duong

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出利用迭代局部对齐算法,通过推断道路段并对其附近道路段进行对齐,以提高多尺度交通流地图的准确性和空间分辨率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06133 2025-12-09 eess.SY cs.SY 50%

A Nonlinear Observer for Air-Velocity and Attitude Estimation Using Pitot and Barometric Measurements

基于皮托和气压测量的无人机空气速度与姿态非线性观测器

Melone Nyoba Tchonkeu, Soulaimane Berkane, Tarek Hamel

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出了一种基于皮托和气压测量的非线性观测器,用于在GPS拒止环境下估计无人机的空气速度和姿态。

Comments 8 pages, 4 figures, submitted to IFAC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05974 2025-12-09 physics.bio-ph quant-ph 50%

The rationality of radical pair mechanism in real biological systems

理性 radical pair 机制在真实生物系统中的合理性

Xiaoyu Chen, Haibin Liu, Jianming Cai

专题命中 具身导航 :navigation(abstract)

AI总结 本文比较了RPM模型与Ramsey-like模型在实验室和体内条件下的表现,发现RPM在信息不可用时更具实用性,但精度较低。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 6 篇

2512.07472 2025-12-09 cs.RO cs.LG 88%

Affordance Field Intervention: Enabling VLAs to Escape Memory Traps in Robotic Manipulation

可及场干预:使VLAs在机器人操作中摆脱记忆陷阱

Siyu Xu, Zijian Wang, Yunke Wang, Chenghao Xia, Tao Huang, Chang Xu

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) John Hopcropt Center for Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学中心)

专题命中 具身推理 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 本研究提出可及场干预(AFI)方法,通过引入3D空间可及场提升VLA在机器人操作中对分布变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07437 2025-12-09 cs.LG cs.AI cs.CV cs.NE cs.RO 83%

KAN-Dreamer: Benchmarking Kolmogorov-Arnold Networks as Function Approximators in World Models

KAN-Dreamer:基于Kolmogorov-Arnold网络作为函数近似器的世界模型基准测试

Chenwei Shi, Xueyu Luan

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 KAN-Dreamer将Kolmogorov-Arnold网络整合到DreamerV3中,通过替代MLP和卷积组件,实现了样本效率和训练速度与原始架构相当的性能。

Comments 23 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06983 2025-12-09 cs.AI cs.LG 81%

On Memory: A comparison of memory mechanisms in world models

关于记忆:世界模型中记忆机制的比较

Eli J. Laird, Corey Clark

机构 * Department of Computer Science Southern Methodist University(计算机科学系南方 Methodist 大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过分析几种记忆增强机制,探讨了世界模型中记忆跨度的限制,并提出了一种分类方法以提升模型在长时规划中的能力。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01821 2025-12-09 cs.CV 79%

Seeing through Imagination: Learning Scene Geometry via Implicit Spatial World Modeling

通过想象看见:通过隐式空间世界建模学习场景几何

Meng Cao, Haokun Lin, Haoyuan Li, Haoran Tang, Rongtao Xu, Dong An, Xue Liu, Ian Reid, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) PKU(北京大学) Spatialtemporal AI(时空人工智能)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 本文提出MILO和RePE,通过隐式空间世界建模提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07733 2025-12-09 cs.CV 57%

SpatialDreamer: Incentivizing Spatial Reasoning via Active Mental Imagery

SpatialDreamer: 通过主动心理意象激励空间推理

Meng Cao, Xingyu Li, Xue Liu, Ian Reid, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) Sun Yat-sen University(孙中山大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23008 2025-12-09 cs.CV 57%

ARSS: Taming Decoder-only Autoregressive Visual Generation for View Synthesis From Single View

ARSS: 通过单视角生成视图的解码器-only 自回归视觉生成的控制

Wenbin Teng, Gonglin Chen, Haiwei Chen, Yajie Zhao

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV

AI总结 ARSS通过单视角生成视图,利用自回归模型和相机轨迹指导提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 3 篇

2512.07582 2025-12-09 cs.RO 77%

See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations

一次观看,随后行动:基于单次视频示范的任务学习视觉-语言-行动模型

Guangyan Chen, Meiling Wang, Qi Shao, Zichen Zhou, Weixin Mao, Te Cui, Minzhao Zhu, Yinan Deng, Luojie Yang, Zhanqi Zhang, Yi Yang, Hua Chen, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) LimX Dynamics

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ViVLA通过单次视频示范高效学习机器人操控任务,实现跨任务和跨身体的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03724 2025-12-09 cs.CV cs.RO 73%

PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention

PosA-VLA: 通过姿态条件化锚点注意力增强动作生成

Ziwen Li, Xin Wang, Hanlue Zhang, Runnan Chen, Runqi Lin, Xiao He, Han Huang, Yandong Guo, Fakhri Karray, Tongliang Liu, Mingming Gong

机构 * MBZUAI AI2 Robotics The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 PosA-VLA通过姿态条件化锚点注意力机制提升动作生成的精度和效率,适用于多样化的机器人任务和复杂环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 67%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 模仿学习与强化学习 5 篇

2503.14259 2025-12-09 cs.LG cs.RO 62%

Quantization-Free Autoregressive Action Transformer

无量化自回归动作变压器

Ziyad Sheebaelhamd, Michael Tschannen, Michael Muehlebach, Claire Vernade

机构 * University of Tübingen(图宾根大学) Google DeepMind(谷歌DeepMind) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 无量化自回归动作变压器通过生成无限词汇变换器直接参数化连续策略,简化流程并提升在模拟机器人任务中的性能。

Journal ref 39th Conference on Neural Information Processing Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06250 2025-12-09 cs.LG 57%

Learning When to Switch: Adaptive Policy Selection via Reinforcement Learning

学习何时切换:通过强化学习实现自适应策略选择

Chris Tava

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.LG

AI总结 该研究通过强化学习实现自主代理在不同导航策略间的自适应切换,提升复杂任务性能。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07783 2025-12-09 cs.CL 50%

On the Interplay of Pre-Training, Mid-Training, and RL on Reasoning Language Models

在预训练、中训练和强化学习对推理语言模型的相互作用中

Charlie Zhang, Graham Neubig, Xiang Yue

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

专题命中 模仿学习与强化学习 :manipulation(abstract)

AI总结 研究探讨了预训练、中训练和强化学习在推理语言模型中的相互作用,发现RL需预训练留有余地才能提升能力,中训练提升性能,过程级奖励提高推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06645 2025-12-09 cs.MA 50%

Analyzing Collision Rates in Large-Scale Mixed Traffic Control via Multi-Agent Reinforcement Learning

通过多智能体强化学习分析大规模混合交通控制中的碰撞率

Muyang Fan

专题命中 模仿学习与强化学习 :robotic(abstract)

AI总结 本研究通过多智能体强化学习分析大规模混合交通控制中的碰撞率影响因素,探讨交通密度、信号协调和转向策略对碰撞风险的作用,为提升交通系统安全性和效率提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06095 2025-12-09 cond-mat.str-el 50%

Comparative Analysis of Autonomous and Systematic Control Strategies for Hole-Doped Hubbard Clusters: Reinforcement Learning versus Physics-Guided Design

自适应与系统化控制策略在掺空Hubbard簇中的比较分析:强化学习与物理引导设计

Shivanshu Dwivedi, Kalum Palandage

专题命中 模仿学习与强化学习 :navigation(abstract)

AI总结 本文比较了自主强化学习与物理引导设计在掺空Hubbard簇中的表现,证明自主RL在优化和策略发现中具有高效性和竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 人机交互与遥操作 1 篇

2510.16692 2025-12-09 cs.RO 70%

First Responders' Perceptions of Semantic Information for Situational Awareness in Robot-Assisted Emergency Response

第一响应者对机器人辅助应急响应中语义信息的情景意识的认知

Tianshu Ruan, Zoe Betta, Georgios Tzoumas, Rustam Stolkin, Manolis Chiou

机构 * Extreme Robotics Lab (ERL) and National Center for Nuclear Robotics (NCNR), University of Birmingham, UK(极端机器人实验室(ERL)和核机器人国家中心(NCNR)、伯明翰大学) Department of Computer Science, Bioengineering, Robotics and Systems Engineering, University of Genova, Italy(计算机科学、生物工程、机器人学和系统工程系、热那亚大学) School of Engineering Mathematics and Technology, University of Bristol, UK(工程数学与技术学院、布里斯托尔大学) School of Electronic Engineering and Computer Science, Queen Mary University of London, UK(电子工程与计算机科学学院、伦敦女王大学)

专题命中 人机交互与遥操作 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 研究探讨第一响应者对机器人辅助应急响应中语义信息的情景意识认知,发现其对语义信息的积极态度及使用需求,揭示了语义信息在应急响应中的重要价值。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 机器人数据与评测 19 篇

2511.22505 2025-12-09 cs.RO cs.CV 84%

RealD$^2$iff: Bridging Real-World Gap in Robot Manipulation via Depth Diffusion

RealD$^2$iff: 通过深度扩散弥合机器人操作中的现实差距

Xiujian Liang, Jiacheng Liu, Mingyang Sun, Qichen He, Cewu Lu, Jianhua Sun

专题命中 机器人数据与评测 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 RealD$^2$iff通过深度扩散模型弥合现实与模拟之间的差距,实现无需额外微调的零样本机器人操作,并生成现实世界般的深度数据集。

Comments We are the author team of the paper "RealD$^2$iff: Bridging Real-World Gap in Robot Manipulation via Depth Diffusion". After self-examination, our team discovered inappropriate wording in the citation of related work, the introduction, and the contribution statement, which may affect the contribution of other related works. Therefore, we have decided to revise the paper and request its withdrawal

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22634 2025-12-09 cs.RO cs.SE 83%

LabUtopia: High-Fidelity Simulation and Hierarchical Benchmark for Scientific Embodied Agents

LabUtopia:高保真模拟与分层基准用于科学具身智能体

Rui Li, Zixuan Hu, Wenxi Qu, Jinouwen Zhang, Zhenfei Yin, Sha Zhang, Xuantuo Huang, Hanqing Wang, Tai Wang, Jiangmiao Pang, Wanli Ouyang, Lei Bai, Wangmeng Zuo, Ling-Yu Duan, Dongzhan Zhou, Shixiang Tang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Oxford(牛津大学) The Chinese University of Hong Kong(香港中文大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 机器人数据与评测 :embodied agent(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 LabUtopia通过高保真模拟和分层基准推动实验室环境中具身智能的发展。

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏