arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

NVIDIA(英伟达)

2026-04-21 至 2026-04-21 共收录 11
2511.14846 2026-04-21 cs.LG cs.AI cs.CL

Empowering Multi-Turn Tool-Integrated Agentic Reasoning with Group Turn Policy Optimization

通过群体回合策略优化增强多轮工具集成代理推理

Yifeng Ding, Hung Le, Songyang Han, Kangrui Ruan, Zhenghui Jin, Varun Kumar, Zijian Wang, Anoop Deoras

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AWS AI Labs(AWS人工智能实验室) NVIDIA Meta

AI总结 本文提出GTPO算法,通过细粒度奖励、优势估计和自监督奖励塑造,提升大语言模型在多轮工具推理任务中的性能,优于GRPO并在常识推理和程序合成任务中表现更佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18468 2026-04-21 cs.CV cs.AI cs.GR cs.LG

Asset Harvester: Extracting 3D Assets from Autonomous Driving Logs for Simulation

资产收割者:从自动驾驶日志中提取3D资产用于模拟

Tianshi Cao, Jiawei Ren, Yuxuan Zhang, Jaewoo Seo, Jiahui Huang, Shikhar Solanki, Haotian Zhang, Mingfei Guo, Haithem Turki, Muxingzi Li, Yue Zhu, Sipeng Zhang, Zan Gojcic, Sanja Fidler, Kangxue Yin

机构 * NVIDIA

AI总结 本文提出Asset Harvester,通过图像到3D模型的端到端流程,将稀疏的现实日志中物体观测转换为完整的模拟资产,结合大规模数据整理、几何感知预处理和鲁棒训练方案,解决自动驾驶数据中的稀疏视角等挑战。

Comments NVIDIA white paper. The project page: https://research.nvidia.com/labs/sil/projects/asset-harvester/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06987 2026-04-21 cs.LG cond-mat.mtrl-sci

OXtal: An All-Atom Diffusion Model for Organic Crystal Structure Prediction

OXtal:一种用于有机晶体结构预测的全原子扩散模型

Emily Jin, Andrei Cristian Nica, Mikhail Galkin, Jarrid Rector-Brooks, Kin Long Kelvin Lee, Santiago Miret, Frances H. Arnold, Michael Bronstein, Avishek Joey Bose, Alexander Tong, Cheng-Hao Liu

机构 * University of Oxford(牛津大学) Synteny Google(谷歌) Mila Université de Montréal(蒙特利尔大学) Caltech(加州理工学院) NVIDIA(英伟达) Lila AITHYRA FutureHouse Imperial College London(伦敦帝国学院)

AI总结 OXtal通过全原子扩散模型直接学习分子构象与周期性排列的联合分布,利用数据增强策略提升效率,实现对晶体结构的高精度预测,显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02111 2026-04-21 cs.CV

NOOUGAT: Towards Unified Online and Offline Multi-Object Tracking

NOOUGAT:迈向统一的在线和离线多目标跟踪

Benjamin Missaoui, Orcun Cetintas, Guillem Brasó, Tim Meinhardt, Laura Leal-Taixé

机构 * NVIDIA Technical University of Munich(慕尼黑技术大学)

AI总结 NOOUGAT提出一种统一的多目标跟踪框架,通过图神经网络和自回归长时跟踪层处理非重叠子片段,实现灵活的时间范围,提升在线和离线跟踪性能。

Comments Accepted to International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17773 2026-04-21 cs.CV

Structure-Adaptive Sparse Diffusion in Voxel Space for 3D Medical Image Enhancement

针对体素空间的结构自适应稀疏扩散用于3D医学图像增强

Hongxu Jiang, Fei Li, Boxiao Yu, Ying Zhang, Kaleb Smith, Kuang Gong, Wei Shao

机构 * Department of Electrical and Computer Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学电气与计算机工程系) Department of Medicine, University of Florida, Gainesville, FL, USA(佛罗里达大学医学系) Department of Biomedical Engineering, University of Florida, Gainesville, FL, USA(佛罗里达大学生物医学工程系) Research Computing, University of Florida, Gainesville, FL, USA(佛罗里达大学研究计算中心) NVIDIA, Santa Clara, CA, USA(英伟达)

AI总结 本文提出一种稀疏体素空间扩散框架,通过结构感知轨迹调制模块实现结构自适应去噪,提升3D医学图像的去噪和超分辨率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17476 2026-04-21 cs.CR cs.AR cs.CV cs.SY eess.SY

Privatar: Scalable Privacy-preserving Multi-user VR via Secure Offloading

Privatar: 通过安全卸载实现可扩展的隐私保护多用户VR

Jianming Tong, Hanshen Xiao, Krishna Kumar Nair, Hao Kang, Ashish Sirasao, Ziqi Zhang, G. Edward Suh, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Massachusetts Institute of Technology(麻省理工学院) Google(谷歌) Purdue University/NVIDIA(普渡大学/NVIDIA) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

AI总结 Privatar通过安全卸载实现多用户VR的可扩展隐私保护,利用领域知识在本地设备保留高能量频率组件,减少信息泄露,同时采用分布感知最小扰动技术提升隐私保障与效用。

Comments Proceedings of the 7th Machine Learning and System Conference (MLSys)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17435 2026-04-21 cs.CL cs.AI cs.SD eess.AS

MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation

MoVE:通过混合声音专家翻译笑声和泪水的语音到语音翻译

Szu-Chi Chen, I-Ning Tsai, Yi-Cheng Lin, Sung-Feng Huang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NVIDIA

AI总结 本文提出MoVE模型,通过混合语音专家捕捉混合表达状态,提升语音到语音翻译中非言语声音的还原能力,实现更高的自然度和情感忠实度。

Comments Submitted to Interspeech. Audio Demo and Dataset: https://47zzz.github.io/MoVE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11988 2026-04-21 cs.CV

CARI4D: Category Agnostic 4D Reconstruction of Human-Object Interaction

CARI4D:类别无关的人-物体交互4D重建

Xianghui Xie, Bowen Wen, Yan Chang, Hesam Rabeti, Jiefeng Li, Ye Yuan, Gerard Pons-Moll, Stan Birchfield

机构 * NVIDIA University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

AI总结 CARI4D提出了一种无需假设物体类别即可从单目RGB视频中重建人-物体交互的4D模型,通过姿态假设选择算法和渲染-比较方法提升重建精度与物理一致性。

Comments CVPR2026 camera ready version. Project page: https://nvlabs.github.io/CARI4D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16857 2026-04-21 cs.CV cs.RO

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03122 2026-04-21 cond-mat.mtrl-sci cs.AI cs.LG

EGMOF: Efficient Generation of Metal-Organic Frameworks Using a Hybrid Diffusion-Transformer Architecture

EGMOF:一种高效生成金属有机框架的混合扩散-Transformer架构

Seunghee Han, Yeonghun Kang, Taeun Bae, Junho Kim, Younghun Kim, Varinia Bernales, Alan Aspuru-Guzik, Jihan Kim

机构 * Department of Chemical and Biomolecular Engineering, Korea Advanced Institute of Science and Technology(韩国科学技术院化学与生物分子工程系) Department of Chemistry, University of Toronto(多伦多大学化学系) Vector Institute for Artificial Intelligence(人工智能矢量研究所) Department of Chemistry, Sungkyunkwan University(成均馆大学化学系) Acceleration Consortium(加速联盟) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Materials Science & Engineering, University of Toronto(多伦多大学材料科学与工程系) Department of Chemical Engineering & Applied Chemistry, University of Toronto(多伦多大学化学工程与应用化学系) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute (CIFAR)) NVIDIA

AI总结 EGMOF通过模块化流程实现高效MOF逆向设计,利用扩散模型与Transformer模型生成结构,仅需1000个训练样本即取得显著提升,适用于多种属性数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16090 2026-04-21 physics.ao-ph cs.LG

Examining Fast Radiatively Driven Responses Using Machine-Learning Weather Emulators

利用机器学习天气模拟器研究快速辐射驱动响应

Ankur Mahesh, William D. Collins, Travis A. O'Brien, Paul B. Goddard, Sinclaire Zebaze, Shashank Subramanian, James P. C. Duncan, Oliver Watt-Meyer, Boris Bonev, Thorsten Kurth, Karthik Kashinath, Michael S. Pritchard, Da Yang

机构 * Allen Institute for Artificial Intelligence (Ai2)(人工智能研究所(Ai2)) NVIDIA Corporation(NVIDIA公司)

AI总结 本文利用历史训练的机器学习天气模拟器研究了辐射-对流平衡对二氧化碳等温室气体扰动的快速降水响应,验证了其与全物理地球系统模型结果的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏