arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-05-29 至 2026-05-29 共收录 11
2605.30339 2026-05-29 cs.CV cs.MM cs.SD eess.AS

Benchmarking Single-Factor Physical Video-to-Audio Generation

单因素物理视频到音频生成的基准测试

Tingle Li, Siddharth Gururani, Kevin J. Shih, Gantavya Bhatt, Sang-gil Lee, Zhifeng Kong, Arushi Goel, Gopala Anumanchipalli, Ming-Yu Liu

机构 * UC Berkeley(伯克利大学) NVIDIA(英伟达) University of Washington(华盛顿大学)

AI总结 提出FlatSounds基准,通过控制反事实对和单视频模式测试评估视频到音频模型的物理推理能力,发现模型依赖文本描述而非视觉流,且物理准确性与时序对齐存在权衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30307 2026-05-29 cs.CV

Grounded 3D-Aware Spatial Vision-Language Modeling

基于三维感知的空间视觉语言建模

An-Chieh Cheng, Yang Fu, Yatai Ji, Ligeng Zhu, Guanqi Zhan, Zhuoyang Zhang, Zhaojing Yang, Song Han, Yao Lu, Pavlo Molchanov, Vidya Nariyambut Murali, Jan Kautz, Xiaolong Wang, Hongxu Yin, Sifei Liu

机构 * UCSD(加州大学圣迭戈分校) MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 提出GR3D模型,通过显式2D定位、隐式2D定位和单目3D定位三种互补定位能力,在单一框架内实现空间链式推理,并在定位与非定位空间基准上取得一致提升。

Comments CVPR 2026 https://www.anjiecheng.me/gr3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30161 2026-05-29 cs.CV

Why Far Looks Up: Probing Spatial Representation in Vision-Language Models

为什么远处看起来在上方:探究视觉-语言模型中的空间表征

Cheolhong Min, Jaeyun Jung, Daeun Lee, Hyeonseong Jeon, Yu Su, Jonathan Tremblay, Chan Hee Song, Jaesik Park

机构 * Seoul National University(首尔国立大学) The Ohio State University(俄亥俄州立大学) NVIDIA(英伟达)

AI总结 通过最小对比对分析,发现视觉-语言模型存在垂直-距离纠缠(将图像垂直位置与距离混淆),这种透视偏差导致性能差距,并随数据规模扩大而加剧,而具有良好分离空间轴的模型更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29891 2026-05-29 cs.CV

DVSM: Decoder-only View Synthesis Model Done Right

DVSM: 正确的仅解码器视图合成模型

Cheng Sun, Jaesung Choe, Min-Hung Chen, Ryo Hachiuma, Yu-Chiang Frank Wang

机构 * NVIDIA National Taiwan University(国立台湾大学)

AI总结 提出仅解码器架构DVSM,通过隐式KV-cache表示场景,在相同渲染复杂度下以更少参数超越编码器-解码器变体,并利用共享权重、基础模型先验和分阶段块大小优化效率与质量,在多个基准上实现新视点合成的最优结果。

Comments Code at https://github.com/NVLabs/dvsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29622 2026-05-29 cs.LG physics.chem-ph

MōLe-Λ: Learning the Coupled-Cluster Response State for Energies, Gradients, and Properties

MōLe-Λ: 学习耦合簇响应态以获取能量、梯度和性质

Andreas Burger, Luca Thiede, Abdulrahman Aldossary, Jorge A. Campos-Gonzalez-Angulo, Alex Zook, Jérôme Florian Gonthier, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(人工智能向量研究所) NVIDIA(英伟达) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究研究院)

AI总结 提出MōLe-Λ模型,通过联合学习左右手振幅预测耦合簇响应态,高效计算能量、梯度及多类分子性质。

Comments ICML 2026 AI4Physics

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25975 2026-05-29 cs.GR cs.CV

F-RNG: Feed-Forward Relightable Neural Gaussians

F-RNG: 前馈可重光照神经高斯

Guangming Fu, Jiahui Fan, Jian Yang, Miloš Hašan, Beibei Wang

机构 * Nankai University(南开大学) Nanjing University(南京大学) NVIDIA

AI总结 提出前馈框架F-RNG,利用现有大型重建模型和内在分解模型先验,从稀疏视图直接生成可重光照的3D高斯资产,实现快速高质量重光照。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09557 2026-05-29 cs.DC cs.AI

SPEED-Bench: A Unified and Diverse Benchmark for Speculative Decoding

SPEED-Bench:一个统一且多样化的推测解码基准

Talor Abramovich, Maor Ashkenazi, Izzy Putterman, Benjamin Chislett, Tiyasa Mitra, Bita Darvish Rouhani, Ran Zilberstein, Yonatan Geifman

机构 * NVIDIA

AI总结 针对推测解码(SD)评估中任务多样性不足、吞吐量评估支持不够及实现不贴近生产环境的问题,提出SPEED-Bench基准,包含多样化语义领域和真实服务场景的数据集,集成vLLM和TensorRT-LLM引擎,以标准化SD评估并揭示系统行为。

Comments ICML 2026; Our data is available on https://huggingface.co/datasets/nvidia/SPEED-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04758 2026-05-29 cs.RO cs.AI cs.MA

ScheduleStream: Temporal Planning with Samplers for GPU-Accelerated Multi-Arm Task and Motion Planning & Scheduling

ScheduleStream: 基于采样器的时序规划用于GPU加速的多臂任务与运动规划及调度

Caelan Garrett, Fabio Ramos

机构 * NVIDIA Research Seattle Robotics Lab (SRL)(NVIDIA西雅图机器人实验室) University of Sydney(悉尼大学)

AI总结 提出ScheduleStream,首个通用框架,通过混合持续动作和领域无关算法,结合GPU加速采样器,实现多臂并行任务与运动规划及调度。

Comments Project website: https://schedulestream.github.io

Journal ref 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29318 2026-05-29 cs.GR cs.CV

FreeForm: Reduced-Order Deformable Simulation from Particle-Based Skinning Eigenmodes

FreeForm: 基于粒子蒙皮特征模态的降阶可变形仿真

Donglai Xiang, Vismay Modi, Rishit Dagli, Ty Trusty, Gilles Daviet, Anka He Chen, Nicholas Sharp, David I. W. Levin

机构 * NVIDIA University of Toronto(多伦多大学)

AI总结 提出一种基于再生核粒子法的无网格降阶超弹性物体仿真方法,通过求解弹性能量Hessian矩阵的广义特征系统构建降阶蒙皮权重,实现40倍训练加速并降低仿真误差。

Comments CVPR 2026, project website: https://research.nvidia.com/labs/sil/projects/freeform/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28909 2026-05-29 cs.LG

Sequential Physics-Constrained Neural Operator Forward Modeling for the $\textit{Norne}$ Reservoir System

面向Norne油藏系统的序贯物理约束神经算子正演建模

Clement Etienam, Juntao Yang, Oleg Ovcharenko, Nick Luiken, Tsubasa Onishi, Nefeli Moridis, Issam Said

机构 * NVIDIA Corporation(NVIDIA公司)

AI总结 针对Norne油藏基准问题,提出基于傅里叶神经算子(FNO)及其物理信息变体(PINO)的序贯代理模型,通过理论分析(函数空间公式、协变量偏移量化、物理约束谱稳定性、K步TBPTT梯度分析)和实验验证,实现全3298天时间跨度上油、气、压力和水的高精度预测,并在单GPU上获得约10^4倍加速。

Comments 22 pages, 2 figures, 2 tables. Code available at https://github.com/clementetienam/physicsnemo/tree/801a85bc08aa9caa0d54027a145b88c68e5e5f36/examples/reservoir_simulation/norne

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07977 2026-05-29 cs.CV

Gaga: Group Any Gaussians via 3D-aware Memory Bank

Gaga: 通过3D感知记忆库分组任意高斯体

Weijie Lyu, Xueting Li, Abhijit Kundu, Yi-Hsuan Tsai, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) NVIDIA Research(英伟达研究) Google DeepMind(谷歌DeepMind) Atmanity Inc.(Atmanity公司)

AI总结 提出Gaga框架,利用零样本类别无关分割模型预测的不一致2D掩码,通过3D感知记忆库关联不同视角下的物体掩码,实现开放世界3D场景的重建与分割。

Comments TMLR Camera-Ready Version. Project Page: https://weijielyu.github.io/Gaga

详情

展开后加载摘要…

URL PDF HTML 收藏