arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-06-04 至 2026-06-04 共收录 16
2606.05160 2026-06-04 cs.RO

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

GRAIL: 从3D资产和视频先验生成人形机器人全身操作

Tianyi Xie, Haotian Zhang, Jinhyung Park, Zi Wang, Bowen Wen, Jiefeng Li, Xueting Li, Qingwei Ben, Haoyang Weng, Yufei Ye, David Minor, Tingwu Wang, Chenfanfu Jiang, Sanja Fidler, Jan Kautz, Linxi Fan, Yuke Zhu, Zhengyi Luo, Umar Iqbal, Ye Yuan

机构 * NVIDIA UCLA(加州大学洛杉矶分校)

AI总结 提出GRAIL全虚拟生成管线,利用3D资产和视频基础模型先验合成人机交互演示,无需物理搭建或遥操作,实现人形机器人全身操作策略的模拟到现实迁移。

Comments Project page: https://research.nvidia.com/labs/dair/grail/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05159 2026-06-04 cs.RO

X4Val: Learning Neural Surrogates for Variance-Reduced Policy Evaluation

X4Val: 学习方差缩减策略评估的神经代理模型

Rachel Luo, Michael Watson, Apoorva Sharma, Heng Yang, Han Qi, Edward Schmerling, Sushant Veer, Boris Ivanovic, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究院) Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 提出X4Val框架,通过嵌入多域数据并学习可迁移预测器,结合控制变量估计器实现无配对样本下的方差缩减,在自动驾驶和机器人操作任务中方差降低达38.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04992 2026-06-04 cs.CV cs.HC

Multi-Camera AR Guidance System for Surgical Instrument Handling and Assembly: Investigating Workload and Efficiency

用于手术器械操作与组装的 multi-camera AR 引导系统:工作量和效率研究

Shiyu Li, Julian Kreimeier, Hannah Schieber, Dirk Müller, Bernhard Kainz, Rüdiger von Eisenhart-Rothe, Daniel Roth

机构 * NVIDIA Deep Learning Data Synthesizer(NVIDIA深度学习数据合成器) NVIDIA Scene Imaging Interface(NVIDIA场景成像接口)

AI总结 提出一种无标记的多摄像头增强现实引导系统,结合6D位姿估计和头戴显示,显著降低手术器械操作的工作量并提高效率。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04925 2026-06-04 cs.CV

Scene-Centric Unsupervised Video Panoptic Segmentation

以场景为中心的无监督视频全景分割

Christoph Reich, Oliver Hahn, Nikita Araslanov, Laura Leal-Taixé, Christian Rupprecht, Daniel Cremers, Stefan Roth

机构 * TU Munich(慕尼黑技术大学) TU Darmstadt(达姆施塔特技术大学) NVIDIA(英伟达) University of Oxford(牛津大学) MCML ELIZA

AI总结 提出无监督视频全景分割任务及首个方法VideoCUPS,利用深度、运动和视觉线索生成伪标签,并通过Video DropLoss训练,在无监督条件下实现准确分割。

Comments CVPR 2026. Oliver Hahn and Christoph Reich - both authors contributed equally. Code: https://github.com/visinf/cups/tree/main/videocups Project page: https://visinf.github.io/videocups/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04511 2026-06-04 cs.CL cs.LG

SparDA: Sparse Decoupled Attention for Efficient Long-Context LLM Inference

SparDA: 用于高效长上下文LLM推理的稀疏解耦注意力

Yaosheng Fu, Guangxuan Xiao, Xin Dong, Song Han, Oreste Villa

机构 * NVIDIA Thinking Machines Lab ByteDance Seed MIT

AI总结 提出SparDA架构,通过引入第四投影Forecast实现KV缓存预取与注意力解耦,减少稀疏选择开销,在长上下文推理中实现1.25倍预填充加速和1.7倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04100 2026-06-04 cs.LG physics.comp-ph

Stein Kernelized Molecular Dynamics for Active Learning of Interatomic Potentials

Stein核化分子动力学用于原子间势的主动学习

Joanna Zou, Fraser Birks, Dallas Foster, Youssef Marzouk

机构 * Center for Computational Science & Engineering, Schwarzman College of Computing, MIT(计算科学与工程中心,计算机科学学院,麻省理工学院) Warwick Centre for Predictive Modelling, School of Engineering, University of Warwick(预测建模中心,工程学院,沃里克大学) NVIDIA

AI总结 提出Stein核化分子动力学(SKMD),一种通过相互作用粒子动力学获取信息性训练配置的增强采样方法,用于主动学习和微调机器学习原子间势,保持玻尔兹曼分布作为渐近分布,并采用自适应停止准则高效在线获取非冗余数据,在Müller-Brown势和丙氨酸二肽的MACE势上展示了优于基线的模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01961 2026-06-04 cs.AI

AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

AutoMedBench: 迈向基于智能体AI模型的医学自动研究

Junqi Liu, Selena Song, Yuhan Wang, Jiawei Mao, Hardy Chen, Xiaoke Huang, Tianhao Qi, Pengfei Guo, Yucheng Tang, Yufan He, Can Zhao, Andriy Myronenko, Dong Yang, Daguang Xu, Yuyin Zhou

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA

AI总结 提出AutoMedBench,一个工作流感知的基准,通过五阶段工作流(计划、设置、验证、推理、提交)评估自主智能体在医学AI研究中的行为,发现验证阶段最弱而设置阶段最强,验证和提交失败占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21446 2026-06-04 cs.RO cs.AI

Lost in Fog: Sensor Perturbations Expose Reasoning Fragility in Driving VLAs

迷失在雾中:传感器扰动暴露驾驶VLA的推理脆弱性

Abhinaw Priyadershi, Jelena Frtunikj

机构 * NVIDIA Corporation, USA(NVIDIA公司,美国) NVIDIA GmbH, Germany(NVIDIA德国公司)

AI总结 通过受控传感器扰动实验,发现因果链解释的一致性可作为轨迹可靠性的高保真指标,并证明启用因果链生成可提升轨迹精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05722 2026-06-04 cs.CL cs.AI

OckBench: Measuring the Efficiency of LLM Reasoning

OckBench:衡量LLM推理效率

Zheng Du, Hao Kang, Song Han, Tushar Krishna, Ligeng Zhu

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

AI总结 提出OckBench基准,联合评估推理和编码任务中的准确性与token效率,揭示当前模型token利用率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04493 2026-06-04 cs.RO

Continuum Robot State Estimation with Actuation Uncertainty

具有驱动不确定性的连续体机器人状态估计

James M. Ferguson, Alan Kuntz, Tucker Hermans

机构 * Department of Electrical and Computer Engineering and Department of Computer Science, Vanderbilt University(电气与计算机工程系和计算机科学系,范德比尔特大学) Kahlert School of Computing and Robotics Center, University of Utah(计算与机器人中心,犹他大学) NVIDIA(英伟达)

AI总结 针对连续体机器人在未知交互力和模型不确定性下的形状估计问题,提出一种基于机械原理的驱动先验的离散Cosserat杆模型,联合估计机器人形状、外部载荷和驱动输入,并通过稀疏因子图实现高效非线性优化。

Comments Public preprint for IEEE RAL. Accepted May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12215 2026-06-04 cs.RO

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01083 2026-06-04 cs.LG

On the Expressive Power of Permutation-Equivariant Weight-Space Networks

关于置换等变权重空间网络的表达能力

Adir Dayan, Yam Eitan, Haggai Maron

机构 * Technion -- Israel Institute of Technology(技术ion-以色列理工学院) NVIDIA Research(NVIDIA研究)

AI总结 本文系统研究置换等变权重空间网络的表达能力,证明主流网络表达能力等价,并在温和假设下建立权重空间和函数空间的普适性,指导模型改进实现34%性能提升。

Comments Accepted as a spotlight paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.07049 2026-06-04 cs.RO cs.SY eess.SY

RMPflow: A Computational Graph for Automatic Motion Policy Generation

RMPflow:一种用于自动运动策略生成的计算图

Ching-An Cheng, Mustafa Mukadam, Jan Issac, Stan Birchfield, Dieter Fox, Byron Boots, Nathan Ratliff

机构 * NVIDIA, Seattle Robotics Lab(NVIDIA西雅图机器人实验室) Georgia Institute of Technology, Robot Learning Lab(佐治亚理工学院机器人学习实验室) University of Washington, Robotics and State Estimation Lab(华盛顿大学机器人与状态估计实验室)

AI总结 本文提出了一种基于Riemannian Motion Policies几何一致变换的新型策略合成算法RMPflow,通过结合局部策略生成全局策略并利用稀疏结构提高计算效率,同时研究了其几何性质并验证了在高自由度 manipulation 系统中通过障碍物规划的简化效果。

Comments WAFR 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1810.03749 2026-06-04 cs.RO cs.SY eess.SY

Balancing Global Exploration and Local-connectivity Exploitation with Rapidly-exploring Random disjointed-Trees

在快速探索随机断树中平衡全局探索与局部连通性利用

Tin Lai, Fabio Ramos, Gilad Francis

机构 * NVIDIA, USA(美国NVIDIA公司)

AI总结 本文提出了一种名为RRdT*的增量最优多查询规划器,通过使用多个断树来利用空间的局部连通性,通过马尔可夫链随机采样,并在局部连通性利用失败时主动探索全局空间,将局部利用与全局探索的平衡转化为多臂老虎机问题,从而提高采样效率。

Comments Submitted to IEEE International Conference on Robotics and Automation (ICRA) 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1712.06577 2026-06-04 cs.LG cs.AI cs.NA math.NA

Parallel Complexity of Forward and Backward Propagation

前向和反向传播的并行复杂度

Maxim Naumov

机构 * NVIDIA

AI总结 研究前向和反向传播作为三角方程组解的并行计算复杂度,提出直接和迭代并行算法,并展示FNN和RNN的反向传播可并行处理。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏