arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-01 至 2025-12-01 共收录 14 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 14 篇

2511.22904 2025-12-01 cs.CL cs.LG 80%

Language-conditioned world model improves policy generalization by reading environmental descriptions

语言引导的世界模型通过阅读环境描述提升策略泛化能力

Anh Nguyen, Stefan Lee

机构 * Oregon State University(俄勒冈州立大学)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.LG

AI总结 本文提出LED-WM,通过语言引导的世界模型提升策略泛化能力,无需依赖假设,有效应对新动态和语言描述的未见过游戏。

Comments NeuRIPS 2025. Workshop: LAW 2025: Bridging Language, Agent, and World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15200 2025-12-01 cs.RO 79%

VIRAL: Visual Sim-to-Real at Scale for Humanoid Loco-Manipulation

VIRAL:大规模视觉仿真到现实用于双足机器人类地交互

Tairan He, Zi Wang, Haoru Xue, Qingwei Ben, Zhengyi Luo, Wenli Xiao, Ye Yuan, Xingye Da, Fernando Castañeda, Shankar Sastry, Changliu Liu, Guanya Shi, Linxi Fan, Yuke Zhu

机构 * NVIDIA CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) CUHK(香港中文大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);分类 cs.RO

AI总结 VIRAL通过大规模仿真训练并零样本部署,实现双足机器人在现实中的自主移动- manipulation能力,无需现实微调。

Comments Project website: https://viral-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22773 2025-12-01 cs.RO cs.AI 73%

CAPE: Context-Aware Diffusion Policy Via Proximal Mode Expansion for Collision Avoidance

CAPE:通过近端模式扩展实现上下文感知的扩散策略用于避障

Rui Heng Yang, Xuan Zhao, Leo Maxime Brunswic, Montgomery Alban, Mateo Clemente, Tongtong Cao, Jun Jin, Amir Rasouli

机构 * Huawei Technologies Canada(华为加拿大技术有限公司) Huawei(华为) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 CAPE通过近端模式扩展实现上下文感知的扩散策略,提升避障任务中轨迹生成的泛化能力与碰撞规避性能。

Comments 4 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23377 2025-12-01 cs.CV 57%

DEAL-300K: Diffusion-based Editing Area Localization with a 300K-Scale Dataset and Frequency-Prompted Baseline

DEAL-300K:基于扩散的编辑区域定位与30万规模数据集及频率提示基线

Rui Zhang, Hongxia Wang, Hangqing Liu, Yang Zhou, Qiang Zeng

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学计算机科学与工程学院) Key Laboratory of Data Protection and Intelligent Management, Ministry of Education, Sichuan University(教育部数据保护与智能管理重点实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 DEAL-300K通过多模态大语言模型生成编辑指令,结合频率提示微调方法,实现了基于扩散的图像编辑区域定位,提供高精度的基线和研究基础。

Comments 13pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23241 2025-12-01 cs.CV 57%

Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods

合成工业目标检测:GenAI与基于特征的方法

Jose Moises Araya-Martinez, Adrián Sanchis Reig, Gautham Mohan, Sarvenaz Sardari, Jens Lambrecht, Jörg Krüger

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本研究比较了GenAI与基于特征的方法在合成工业目标检测中的效果,发现简单方法在准确性和效率上优于复杂GenAI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 57%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12465 2025-12-01 cs.CV 57%

PhysX-3D: Physical-Grounded 3D Asset Generation

PhysX-3D:基于物理的3D资产生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 PhysX-3D提出一种基于物理的3D资产生成方法,通过构建物理标注数据集和双分支框架,提升生成资产的物理合理性和几何质量。

Comments Accepted by NeurIPS 2025, Spotlight Project page: https://physx-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09082 2025-12-01 cs.CV 57%

Taming generative video models for zero-shot optical flow extraction

驯服生成视频模型以实现零样本光流提取

Seungwoo Kim, Khai Loong Aw, Klemen Kotar, Cristobal Eyzaguirre, Wanhee Lee, Yunong Liu, Jared Watrous, Stefan Stojanov, Juan Carlos Niebles, Jiajun Wu, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出KL-tracing方法,通过反事实提示实现生成视频模型的零样本光流提取,无需微调即可在现实和合成数据集上竞争现有最佳模型。

Comments Project webpage: https://neuroailab.github.io/projects/kl_tracing

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13322 2025-12-01 cs.RO 57%

Arc-Length-Based Warping for Robot Skill Synthesis from Multiple Demonstrations

基于弧长的变形用于多示教机器人技能合成

Giovanni Braglia, Davide Tebaldi, André Eugenio Lazzaretti, Luigi Biagiotti

机构 * Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(代尔夫特理工大学电子工程、数学和计算机科学学院) Department of Electrical Engineering, Wright State University(威斯汀豪斯大学电气工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出基于弧长的变形方法,用于提升多示教机器人技能合成的轨迹同步和技能提取质量。

Comments 8 pages, 7 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21887 2025-12-01 cs.CV 57%

UniArt: Unified 3D Representation for Generating 3D Articulated Objects with Open-Set Articulation

UniArt: 一种统一的3D表示方法,用于从单张图像生成具有开集关节的3D可动物体

Bu Jin, Weize Li, Songen Gu, Yupeng Zheng, Yuhang Zheng, Zhengyi Zhou, Yao Yao

机构 * Hong Kong University of Science and Technology(香港理工大学) Tsinghua University(清华大学) Nanjing University(南京大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 UniArt通过统一的潜在表示和开集关节预测方法,实现了从单张图像生成高质量可动3D物体的端到端合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21784 2025-12-01 cs.LG 57%

Physics-Informed Spiking Neural Networks via Conservative Flux Quantization

基于保守通量量子化的物理指导脉冲神经网络

Chi Zhang, Lin Wang

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.LG

AI总结 本文提出了一种基于保守通量量子化的物理指导脉冲神经网络框架,通过设计保守泄漏积分-放电神经元和保守通量量子化策略,实现了严格的物理守恒和稳健的时间泛化,解决了传统PINNs在物理守恒和长期泛化上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21757 2025-12-01 cs.CY cs.AI cs.CL cs.CR 57%

Medical Malice: A Dataset for Context-Aware Safety in Healthcare LLMs

医疗恶意:用于医疗LLM中情境感知安全的数据库

Andrew Maranhão Ventura D'addario

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 Medical Malice提出一个情境感知安全的医疗数据库,通过对抗性提示和伦理推理提升医疗LLM的安全性,以应对医疗领域复杂且系统性的威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18773 2025-12-01 cs.CV 57%

Spacewalk-18: A Benchmark for Multimodal and Long-form Procedural Video Understanding in Novel Domains

Spacewalk-18:多模态和长形式程序视频理解的基准测试,用于新领域

Zitian Tang, Rohan Myer Krishnan, Zhiqiu Yu, Chen Sun

机构 * Brown University(布朗大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV

AI总结 Spacewalk-18是一个用于多模态和长形式程序视频理解的新领域基准测试,通过步骤识别和视频问答任务评估模型在新领域和长时序上下文中的泛化能力。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17379 2025-12-01 cs.RO cs.HC 57%

What Could a Social Mediator Robot Do? Lessons from Real-World Mediation Scenarios

社交调解机器人能做什么?来自真实世界调解场景的启示

Thomas H. Weisswange, Hifza Javed, Manuel Dietrich, Tuan Vu Pham, Maria Teresa Parreira, Michael Sack, Nawid Jamali

机构 * Honda Research Institute Europe GmbH(本田欧洲研究院) Honda Research Institute USA, Inc.(本田美国研究院) University of Siegen(锡根大学) Cornell University(康奈尔大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO

AI总结 本文探讨了社交调解机器人在真实场景中的六种潜在角色,并提出评估其调解效果的方法,旨在推动机器人辅助社会调解的研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏