arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8699 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8699 篇

2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 67%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01111 2026-07-02 cs.RO cs.AI cs.LG 新提交 67%

FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement

FAR: 面向测试时恢复与持续策略改进的失败感知重试

Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出FAR框架,通过失败对比偏好适应和轻量动作扰动,使机器人从测试时失败中学习并自主恢复,结合成功轨迹持续改进策略,在仿真和真实任务中成功率分别提升17.6%和11.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31694 2026-07-01 cs.RO cs.AI cs.CL cs.CV 新提交 67%

RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization

RCT:用于触觉泛化的机器人采集触觉-视觉-语言数据集

Jingbo He, Michael Färber, Roberto Calandra

机构 * ScaDS.AI, TU Dresden(德累斯顿工业大学ScaDS.AI) LASR Lab, TU Dresden(德累斯顿工业大学LASR实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出RCT数据集,包含机器人按压122种工业材料采集的触觉数据,通过接触序列划分暴露了材料泛化难题,为触觉感知提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19809 2026-06-30 cs.LG cs.AI cs.RO 67%

Representation Learning for Equivariant Inference with Guarantees

具有保证的等价推理表示学习

Daniel Ordoñez-Apraez, Vladimir Kostić, Alek Fröhlich, Vivien Brandt, Karim Lounici, Massimiliano Pontil

机构 * CSML, Italian Institute of Technology(意大利技术研究院 CSML) University College London(伦敦大学学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种等价表示学习框架,同时解决回归、条件概率估计和不确定性量化,并提供非渐近的统计学习保证。

Comments 67 pages, 22 figures, accepted to International Conference on Machine Learning (ICML-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02469 2026-06-23 cs.RO cs.AI cs.CL cs.CV 版本更新 67%

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang

机构 * Purdue University(普渡大学) University of California, Berkeley(加州大学伯克利分校) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-06-17 cs.CV cs.AI cs.RO 版本更新 67%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00241 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

Mordal: Automated Pretrained Model Selection for Vision Language Models

Mordal: 面向视觉语言模型的自动化预训练模型选择

Shiqi He, Insu Jang, Mosharaf Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16996 2026-06-16 cs.CV cs.AI cs.LG 新提交 67%

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

ActiveSAM: 图像条件类别剪枝实现快速准确的开放词汇分割

Tran Dinh Tien, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(VILA实验室,穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出ActiveSAM,一种无需训练、零样本的推理框架,通过图像条件类别剪枝和低分辨率预览,将SAM 3转化为主动词汇分割器,在8个基准上平均提升1.4 mIoU,速度提升最高5.5倍。

Comments Preprint. Code is available at https://github.com/VILA-Lab/ActiveSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15251 2026-06-16 cs.RO cs.AI cs.LG 新提交 67%

Driving, Fast or Slow? Neuro-Symbolic Guidance for Motion Prediction in Multi-Modal Ground Mobility

驾驶,快或慢?多模态地面移动中运动预测的神经符号引导

Simon Kohaut, Felix Divo, Julius Hahnewald, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami

机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(达姆施塔特工业大学人工智能与机器学习实验室) Honda Research Institute(本田研究所) Hessian Center for AI (hessian.AI)(黑森州人工智能中心) Centre for Cognitive Science(认知科学中心) German Center for AI (DFKI)(德国人工智能研究中心) Uncertainty in Artificial Intelligence Lab, TU Eindhoven(埃因霍温理工大学人工智能不确定性实验室)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出TraCS框架,通过神经符号方法将交通规则编码为概率一阶逻辑,增强黑盒运动预测模型的可解释性和合规性,在Argoverse 2上持续提升SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15117 2026-06-16 cs.MM cs.AI cs.CV cs.LG cs.SD 新提交 67%

Teacher-Student Structure for Domain Adaptation in Ensemble Audio-Visual Video Deepfake Detection

用于集成视听视频深度伪造检测中领域适应的师生结构

Elham Abolhasani, Maryam Ramezani, Hamid R. Rabiee

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工学院计算机工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出EAV-DFD方法,结合师生框架的领域适应机制,提升模型在未见领域上的泛化能力,在三个数据集上AUC分别提升4.09%、17.94%和0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新 67%

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13515 2026-06-12 cs.CV cs.LG cs.RO 新提交 67%

MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models

MaskWAM:统一掩码提示与预测的世界-动作模型

Hanyang Yu, Haitao Lin, Jingbo Zhang, Wenyao Zhang, Chenghao Gu, Heng Li, Ping Tan

机构 * The Hong Kong University of Science and Technology(香港科技大学) Tencent Robotics X(腾讯机器人X实验室) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出MaskWAM,通过统一掩码输入与预测的混合Transformer架构,解决世界-动作模型的空间瓶颈,提升策略泛化能力,在LIBERO等任务上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05709 2026-06-05 eess.SY cs.SY 67%

Tracking Control for a Dynamic Model of an Underwater Submersible

水下潜水器动力学模型的跟踪控制

Matthew Hampsey, Pieter van Goor, Ravi Banavar, Robert Mahony

专题命中 机器人数据与评测 :robotics(abstract,abstract_cn)

AI总结 针对水下潜水器在SE(3)上的刚体动力学模型,提出一种基于能量的跟踪控制方法,通过新型误差函数使误差系统具有哈密顿结构,并证明渐近收敛性,在BlueROV2上仿真验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05254 2026-06-05 cs.LG cs.CV cs.RO 67%

Flash-WAM: Modality-Aware Distillation for World Action Models

Flash-WAM:面向世界动作模型的模态感知蒸馏

Arman Akbari, Ci Zhang, Arash Akbari, Lin Zhao, Yixiao Chen, Weiwei Chen, Xuan Zhang, Geng Yuan, Yanzhi Wang

机构 * Northeastern University(东北大学) University of Georgia(佐治亚大学) EmbodyX Inc.(EmbodyX公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 针对世界动作模型联合生成视频和机器人动作时因多模态噪声分布不对称导致蒸馏失效的问题,提出模态感知步蒸馏框架Flash-WAM,通过为不同模态选择匹配噪声机制的参数化方法,实现单步推理并大幅加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.03518 2026-06-04 cs.RO cs.AI cs.LG cs.SY eess.SY 67%

Transfer from Simulation to Real World through Learning Deep Inverse Dynamics Model

通过学习深度逆动力学模型实现仿真到现实世界的迁移

Paul Christiano, Zain Shah, Igor Mordatch, Jonas Schneider, Trevor Blackwell, Joshua Tobin, Pieter Abbeel, Wojciech Zaremba

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出通过学习深度逆动力学模型,在仿真与现实世界之间实现控制策略的迁移,解决仿真与现实差异导致的性能下降问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02956 2026-06-03 cs.CV cs.LG cs.RO 67%

The Road Ahead in Autonomous Driving: The KITScenes Multimodal Dataset

自动驾驶的未来之路:KITScenes多模态数据集

Richard Schwarzkopf, Fabian Immel, Alexander Blumberg, Jonas Merkert, Nils Rack, Kaiwen Wang, Fabian Konstantinidis, Julian Truetsch, Carlos Fernandez, Annika Bätz, Kevin Rösch, Marlon Steiner, Willi Poh, Yinzhe Shen, Royden Wagner, Felix Hauser, Dominik Strutz, Jaime Villa, Gleb Stepanov, Holger Caesar, Ömer Şahin Taş, Frank Bieder, Jan-Hendrik Pauls, Christoph Stiller

机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University Charles III of Madrid(马德里第三大学) Delft University of Technology(代尔夫特理工大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出KITScenes多模态数据集,通过高保真传感器和完整HD地图,解决现有数据集在传感器精度、地图完整性和地理多样性上的不足,并引入四个基准推动空间学习。

Comments 28 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02951 2026-06-03 cs.RO cs.AI cs.CL cs.CV cs.HC 67%

SCOPE: Real-Time Natural Language Camera Agent at the Edge

SCOPE:边缘实时自然语言相机代理

Nikolaj Hindsbo, Sina Ehsani, Pragyana Mishra

机构 * Armada AI

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出SCOPE模块化代理,用于自然语言控制的PTZ相机,在边缘部署实现实时感知、规划与控制,并通过仿真和物理实验评估延迟、准确性和错误模式。

Comments 9 pages, 4 figures, 6 tables. Accepted at HRI '26 (21st ACM/IEEE International Conference on Human-Robot Interaction), Edinburgh, Scotland, March 16--19, 2026. Code: https://github.com/HindsboNikolaj/SCOPE

Journal ref Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24965 2026-05-26 cs.CV cs.AI cs.LG 67%

Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection

视觉基础模型在面部深度伪造检测中的跨域泛化极限

Ibrahim Delibasoglu

机构 * Department of Software Engineering, Faculty of Computer and Information Sciences(软件工程系,计算机与信息科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文通过系统评估三种视觉基础模型(RoPE-ViT、DINOv3、NVIDIA C-RADIOv4-H)在DF40基准上的线性探测性能,揭示了它们在面部深度伪造检测中的跨域泛化极限,发现基础模型对全脸合成保持高判别力,但对局部编辑技术存在根本性边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22493 2026-05-22 cs.LG cs.AI cs.RO 67%

Understanding Multimodal Failure in Action-Chunking Behavioral Cloning

理解动作分块行为克隆中的多模态失败

Lorenzo Mazza, Massimiliano Datres, Ariel Rodriguez, Sebastian Bodenstedt, Gitta Kutyniok, Stefanie Speidel

机构 * NCT-Dresden(NCT-德累斯顿)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究行为克隆在多模态情况下失败的机制,分析不同多模态参数化在动作分块策略中的不同失效方式,并提出通过调整正则化程度和改进生成策略来提升鲁棒性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20856 2026-05-21 cs.RO cs.AI cs.LG 67%

DISC: Decoupling Instruction from State-Conditioned Control via Policy Generation

DISC: 通过策略生成解耦指令与状态条件控制

Hanxiang Ren, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) TranscEngram

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 DISC通过策略生成解耦指令与状态条件控制,解决了任务状态耦合导致的观察泄漏问题,并在多个基准测试中表现出色,证明了语言生成的策略参数驱动行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 67%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22801 2026-05-19 cs.RO cs.AI cs.LG 67%

Unleashing the Potential of Diffusion Models for End-to-End Autonomous Driving

释放扩散模型在端到端自动驾驶中的潜力

Yinan Zheng, Tianyi Tan, Bin Huang, Enguang Liu, Ruiming Liang, Jianlin Zhang, Jianwei Cui, Guang Chen, Kun Ma, Hangjun Ye, Long Chen, Ya-Qin Zhang, Xianyuan Zhan, Jingjing Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文通过大规模实车数据和道路测试,系统研究了扩散模型在端到端自动驾驶中的规划能力,提出Hyper Diffusion Planner框架,实现10倍性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11265 2026-05-13 cs.CV cs.AI cs.LG 67%

DenseTRF: Texture-Aware Unsupervised Representation Adaptation for Surgical Scene Dense Prediction

DenseTRF: 基于纹理的无监督表示适应用于外科场景密集预测

Guiqiu Liao, Matjaž Jogan, Daniel A. Hashimoto

机构 * GRASP Laboratory, University of Pennsylvania(宾夕法尼亚大学GRASP实验室) PCASO Laboratory, Department of Surgery, University of Pennsylvania(宾夕法尼亚大学外科PCASO实验室) Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出DenseTRF框架,通过基于纹理的关注机制学习纹理感知的表示,提升外科场景密集预测的跨分布泛化能力。

Comments Accepted to 29th International Conference on Medical Image Computing and Computer Assisted Intervention (MICCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23629 2026-05-12 cs.GR 67%

From Visual Synthesis to Interactive Worlds: Toward Production-Ready 3D Asset Generation

从视觉合成到交互世界:迈向可生产3D资产生成

Jiafeng Wu, Zhuofan Lou, Jian Liu, Dazhao Du, Chunchao Guo, Song Guo

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract)

AI总结 本文探讨了从孤立视觉形状到可部署的结构化资产的3D内容生成进展,分析了游戏开发、AI、世界模拟等对3D资产的需求,提出基于资产生产流程的分类方法,评估现有方法的生成质量和可用性,并指出数据质量、生成可控性等挑战。

Comments Preprint. Jiafeng Wu and Zhuofan Lou contributed equally. Project page: https://christinebobby.github.io/production-ready-3d-survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08136 2026-05-12 cs.CV cs.AI cs.RO 67%

Benchmarking ResNet Backbones in RT-DETR: Impact of Depth and Regularization under environmental conditions

在RT-DETR中评估ResNet主干:环境条件下深度和正则化的影响

Pamela Barboza, Víctor Castelli, Belén Pereira, Ricardo Grando, Bruna de Vargas, Augusto Calfani

机构 * Robotics and Artificial Intelligence Laboratory, Technological University of Uruguay(机器人与人工智能实验室,乌拉圭技术大学) Artificial Intelligence Laboratory, Technological University of Uruguay(人工智能实验室,乌拉圭技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文评估RT-DETR在环境和超参数变化下的圆物体检测性能,比较了四种ResNet主干在不同丢弃率下的置信度和准确率,发现ResNet50在光照变化中表现最佳,ResNet34在背景变化中表现最佳。

Comments Accepted at the International Conference on Data Science, Technology and Applications (DATA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20349 2026-04-23 eess.SP 67%

Descriptor: A Hybrid Indoor and Indoor-Outdoor Positioning Multi-Technology Dataset (HYMN)

描述:一种混合室内外定位多技术数据集(HYMN)

Muhammad Ammad, Albrecht Michler, Paul Schwarzbach, Jonas Ninnemann, Hagen Ußler, Oliver Michler

专题命中 机器人数据与评测 :navigation(abstract,abstract_cn)

AI总结 HYMN数据集结合五种定位技术,涵盖室内外过渡场景,支持多传感器融合和无缝定位研究,克服单一技术限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18468 2026-04-21 cs.CV cs.AI cs.GR cs.LG 67%

Asset Harvester: Extracting 3D Assets from Autonomous Driving Logs for Simulation

资产收割者:从自动驾驶日志中提取3D资产用于模拟

Tianshi Cao, Jiawei Ren, Yuxuan Zhang, Jaewoo Seo, Jiahui Huang, Shikhar Solanki, Haotian Zhang, Mingfei Guo, Haithem Turki, Muxingzi Li, Yue Zhu, Sipeng Zhang, Zan Gojcic, Sanja Fidler, Kangxue Yin

机构 * NVIDIA

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出Asset Harvester,通过图像到3D模型的端到端流程,将稀疏的现实日志中物体观测转换为完整的模拟资产,结合大规模数据整理、几何感知预处理和鲁棒训练方案,解决自动驾驶数据中的稀疏视角等挑战。

Comments NVIDIA white paper. The project page: https://research.nvidia.com/labs/sil/projects/asset-harvester/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO 67%

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07826 2026-04-21 cs.CV cs.LG cs.RO 67%

R3D2: Realistic 3D Asset Insertion via Diffusion for Autonomous Driving Simulation

R3D2:通过扩散实现自动驾驶模拟中的真实3D资产插入

William Ljungbergh, Bernardo Taveira, Wenzhao Zheng, Adam Tonderski, Chensheng Peng, Fredrik Kahl, Christoffer Petersson, Michael Felsberg, Kurt Keutzer, Masayoshi Tomizuka, Wei Zhan

机构 * Zenseact Linköping University(林哈尔大学) Chalmers University(查尔姆斯理工大学) UC Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 R3D2是一种轻量级单步扩散模型,用于在现有场景中实时生成真实3D资产,通过训练学习真实集成,提升自动驾驶模拟的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11757 2026-04-14 cs.RO cs.AI cs.CV 67%

StarVLA-$α$: Reducing Complexity in Vision-Language-Action Systems

StarVLA-$α$:降低视觉-语言-动作系统复杂度

Jinhui Ye, Ning Gao, Senqiao Yang, Jinliang Zheng, Zixuan Wang, Yuxin Chen, Pengguang Chen, Yilun Chen, Shu Liu, Jiaya Jia

机构 * HKUST(香港科技大学) XJTU(西安交通大学) CUHK(香港中文大学) THU(清华大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SmartMore Ltd.(SmartMore有限公司)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出StarVLA-$α$,通过简化架构与流程降低实验干扰,系统分析VLA设计关键因素,在多个基准测试中表现优异,优于现有模型20%。

详情

展开后加载摘要…

URL PDF HTML 收藏