arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-07-07 至 2026-07-07 共收录 18
2607.05369 2026-07-07 cs.RO cs.AI cs.CL cs.LG 新提交

GaP: A Graph-as-Policy Multi-Agent Self-Learning Harness For Variational Automation Tasks

GaP:面向变分自动化任务的图即策略多智能体自学习框架

Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg

机构 * University of California, Berkeley(加利福尼亚大学伯克利分校) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Bosch(博世)

AI总结 针对变分自动化任务无模型策略可靠性不足问题,提出图即策略多智能体编码框架GaP,通过生成计算图并行迭代优化,在虚实8项基准上表现远超基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05272 2026-07-07 cs.LG cs.AI cs.DC cs.PF 新提交

Adaptive Inference Batching using Policy Gradients

基于策略梯度的自适应推理批处理

Ruslan Sharifullin

机构 * NVIDIA Corporation(英伟达公司)

AI总结 针对突发异构负载下推理服务的调度难题,采用强化学习学习自适应批处理路由策略,在多GPU场景下消除队头阻塞,性能远超传统启发式方法。

Comments 5 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04681 2026-07-07 cs.RO cs.AI 新提交

Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning

视觉语言动作模型所言即所指?论忠实性在具身推理中的作用

Matthew Foutter, Matteo Cercola, Lena Wild, Yunshan Wang, Michelle Li, Daniele Gammelli, Marco Pavone

机构 * Stanford University(斯坦福大学) Politecnico di Milano(米兰理工大学) KTH Royal Institute of Technology(皇家理工学院) Italian Institute of Artificial Intelligence (AI4I)(意大利人工智能研究所) NVIDIA Research(英伟达研究院)

AI总结 研究视觉语言动作模型中具身思维链是否真实反映决策过程。区分功能推理与忠实推理,指出当前对齐策略不足,通过人类评估揭示差距,用学习的评论家操作具身忠实性的行为替代物,强化学习后训练策略提升了忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04616 2026-07-07 cs.RO cs.AI 新提交

SILO: Simulation-in-the-Loop Sim-to-Real Transfer for Multi-Stage Cable Routing

SILO:用于多阶段电缆布线的回路内仿真的仿真到现实转移

Stone Tao, Jie Xu, Hesam Rabeti, Yashraj Narang, Yijie Guo, Iretiayo Akinola

机构 * NVIDIA Corporation(英伟达公司) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

AI总结 针对电缆等物体复杂变形导致的线性可变形操纵难题,提出基于GPU并行仿真的强化学习框架及新部署策略,实现多阶段电缆布线的仿真到现实转移,提升成功率并减少周期时间。

Comments Website: https://silo-cable-routing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04341 2026-07-07 cs.GR cs.CL cs.CV eess.IV 新提交

How to Build Digital Humans? From Priors to Photorealistic Avatars

如何构建数字人?从先验知识到逼真的虚拟形象

Wojciech Zielonka, Tobias Kirschstein, Timo Bolkart, Simon Giebenhain, Vanessa Sklyarova, Xiang Deng, Donglai Xiang, Shunsuke Saito, Yebin Liu, Matthias Niessner, Justus Thies

机构 * Meta Technical University of Munich(慕尼黑技术大学) Google(谷歌) Tsinghua University(清华大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) NVIDIA Technical University of Darmstadt(达姆施塔特技术大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 概述可控3D人类虚拟形象创建,聚焦先验学习和形象创建阶段,定义现有虚拟形象表示并分类,回顾全身和头部虚拟形象等方法,概述原则、推荐文献并讨论挑战与方向。

Comments Eurographics 2026 State-of-the-Art Report (STAR). Project page: https://wojciechzielonka.com/how-to-build-digital-humans/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03870 2026-07-07 cs.AI cs.CL cs.LG 新提交

Evaluating LLM Uncertainty in Long-Form Generation Using Deterministic Ground Truth

使用确定性真实数据评估长文本生成中语言模型的不确定性

Ido Amit, Ido Galil, Ran El-Yaniv

机构 * Technion(技术学院) Nvidia(英伟达)

AI总结 研究针对长文本生成中语言模型不确定性评估难题,引入含单一确定性长文本真值的SALT基准,通过对50多个模型分析揭示关键见解,如置信函数作用、错误驱动因素及推理影响等,为风险关键应用提供参考。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code available at https://github.com/IdoAmit198/SALT

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03751 2026-07-07 cs.RO 新提交

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

三思而后行:将树搜索提炼为冻结视觉语言动作模型的动作评估

Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nvidia(英伟达)

AI总结 研究发现视觉语言动作(VLA)模型泛化能力差的关键瓶颈在于动作评估。提出SVA框架,通过蒙特卡洛树搜索探索输出分布,将知识提炼到轻量级Q值模型,提升任务成功率,且保持泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03624 2026-07-07 cs.CV cs.AI cs.LG 新提交

RADIO1D: Elastic Representations for Condensed Vision Modeling

RADIO1D:用于压缩视觉建模的弹性表示

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

机构 * NVIDIA(英伟达)

AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。

Comments Published as main conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03595 2026-07-07 cs.CV cs.AI cs.RO 新提交

Token-Based Affordance Grounding with Large Vision-Language Models

基于令牌的大型视觉语言模型的可供性基础

Seung Il Lee, Qinqian Lei, Daguang Xu, Dong Yang, Robby T. Tan, Yixin Chen, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) NVIDIA(英伟达)

AI总结 研究旨在解决现有视觉语言模型在行动定位上的问题,提出TokAG零样本可供性基础框架,利用令牌级语义空间信号定位相关区域,引入空间感知令牌选择机制,在多基准测试中优于先前方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03509 2026-07-07 cs.CV 新提交

Flex-Forcing: Towards a Unified Autoregressive and Bidirectional Video Diffusion Model

Flex-Forcing:迈向统一的自回归和双向视频扩散模型

Xinyin Ma, Julius Berner, Chao Liu, Arash Vahdat, Weili Nie, Xinchao Wang

机构 * NVIDIA(英伟达)

AI总结 研究针对现有视频生成方法推理范式僵化的问题,提出Flex-Forcing框架。核心是灵活分块机制,可依设备预算灵活分块,跨块双向推理与块内自回归生成,实验表明该框架提升了视频质量、稳定性并加快推理速度。

Comments Project page: https://research.nvidia.com/labs/genair/flex-forcing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01012 2026-07-07 cs.LG 新提交

Generative Model Proposal based Particle Filtering for Data Assimilation

基于生成模型提议的数据同化粒子滤波

Chandni Nagda, Mayank Shrivastava, Gudrun Thorkelsdottir, Gan Zhang, Morteza Mardani, Arindam Banerjee

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

AI总结 提出流提议粒子滤波(FPPF),通过学习条件生成模型作为提议分布,逼近方差最小化最优提议,结合贝叶斯更新和局部化策略,在非线性、非高斯和高维系统中优于统计基线和生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27243 2026-07-07 cs.CV 版本更新

Can Retrieval Heads See Images? Multimodal Retrieval Heads in Long-Context Vision-Language Models

检索头能看见图像吗?长上下文视觉语言模型中的多模态检索头

Aaron Branson Cigres Li, Zhaowei Wang, Yu Zhao, Yiming Du, Haobo Li, Xiyu Ren, Ginny Wong, Simon See, Lishu Luo, Haodong Duan, Pasquale Minervini, Yangqiu Song

机构 * HKUST(香港科技大学) University of Edinburgh(爱丁堡大学) CUHK(香港中文大学) NVAITC, NVIDIA, Santa Clara, USA(NVIDIA Santa Clara 分公司) Tsinghua University(清华大学)

AI总结 本文提出一种多模态检索头检测方法,发现视觉语言模型中仅有4.4-10.2%的注意力头贡献了50%的正检索分数,这些头对长上下文推理至关重要,且可直接用于文档检索提升性能。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06358 2026-07-07 cs.CL cs.AI 版本更新

SHINE: A Scalable In-Context Hypernetwork for Mapping Context to LoRA in a Single Pass

SHINE:一种可扩展的上下文超网络,用于在单次传递中将上下文映射到LoRA

Yewei Liu, Xiyuan Wang, Yansheng Mao, Yoav Gelbery, Haggai Maron, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Technion, NVIDIA(技术学院与NVIDIA) University of Oxford(牛津大学) School of Electronics Engineering(电子工程学院) Computer Science, Peking University(计算机科学,北京大学)

AI总结 本文提出SHINE,一种可扩展的上下文超网络,用于在单次传递中将多样且有意义的上下文映射到高质量的LoRA适配器,通过重用冻结LLM的自身参数和引入架构创新,克服了先前超网络的关键限制,以较少的参数实现了强大的表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26946 2026-07-07 cs.CV cs.RO 版本更新

Three-Step Nav: A Hierarchical Global-Local Planner for Zero-Shot Vision-and-Language Navigation

三步导航:一种用于零样本视觉-语言导航的分层全局-局部规划器

Wanrong Zheng, Yunhao Ge, Laurent Itti

机构 * University of Southern California(南加州大学) NVIDIA Research(NVIDIA研究)

AI总结 本文提出三步导航方法,通过全局-局部分层规划解决零样本视觉-语言导航中的漂移和低成功率问题,无需梯度更新或微调,实现最先进的性能。

Comments Accepted to AISTATS 2026. Code: https://github.com/ZoeyZheng0/3-step-Nav

Journal ref Proceedings of the 29th International Conference on Artificial Intelligence and Statistics (AISTATS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17248 2026-07-07 eess.AS cs.CL cs.SD 版本更新

VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

VIBE:通过真实世界语音进行大型音频-语言模型生成偏见评估的语音诱导开放式偏见评估

Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通信工程研究所) NVIDIA, Taiwan(台湾NVIDIA) Artificial Intelligence Center of Research Excellence, National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

AI总结 VIBE通过真实世界语音的开放式任务评估大型音频-语言模型的生成偏见,揭示了性别线索比口音线索更易引发分布偏移,表明当前模型复现了社会刻板印象。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08828 2026-07-07 cs.CV cs.AI cs.LG cs.MM cs.RO 版本更新

Motion Attribution for Video Generation

视频生成中的运动归因

Xindi Wu, Despoina Paschalidou, Jun Gao, Antonio Torralba, Laura Leal-Taixé, Olga Russakovsky, Sanja Fidler, Jonathan Lorraine

机构 * NVIDIA Princeton University(普林斯顿大学) MIT(麻省理工学院) University of Michigan(密歇根大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 研究视频生成模型中数据对运动影响,提出基于梯度的运动归因框架Motive,通过运动加权损失掩码分离静态外观和时间动态,用于研究微调剪辑对时间动态的影响及指导数据策划,提升视频运动质量。

Comments See the project website at https://research.nvidia.com/labs/sil/projects/MOTIVE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24380 2026-07-07 cs.LG 版本更新

APEX: Approximate-but-exhaustive search for ultra-large combinatorial synthesis libraries

APEX:针对超大组合合成库的近似但详尽搜索

Aryan Pedawi, Jordi Silvestre-Ryan, Bradley Worley, Darren J Hsu, Kushal S Shah, Elias Stehle, Jingrong Zhang, Izhar Wallach

机构 * Numerion Labs(Numerion实验室) NVIDIA(英伟达)

AI总结 研究超大组合合成库虚拟筛选难题,提出APEX方法,利用神经网络代理,能在一分钟内在消费级GPU上实现完全枚举,可精确检索近似top-k集,性能优于其他方法。

Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16663 2026-07-07 cs.RO cs.CV cs.LG cs.SY eess.SY 版本更新

Mitigating Covariate Shift in Imitation Learning for Autonomous Vehicles Using Latent Space Generative World Models

使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移

Alexander Popov, Alperen Degirmenci, David Wehr, Shashank Hegde, Ryan Oldja, Alexey Kamenev, Bertrand Douillard, David Nistér, Urs Muller, Ruchi Bhargava, Stan Birchfield, Nikolai Smolyanskiy

机构 * NVIDIA

AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。

Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU

详情

展开后加载摘要…

URL PDF HTML 收藏