arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-03-03 至 2026-03-03 共收录 17
2602.17616 2026-03-03 cs.LG cs.AI

Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs

稳定异步性:用于大语言模型的方差控制的非策略强化学习

Luke J. Huang, Zhuoyang Zhang, Qinghao Hu, Shang Yang, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14960 2026-03-03 cs.LG cs.DC

MoE Parallel Folding: Heterogeneous Parallelism Mappings for Efficient Large-Scale MoE Model Training with Megatron Core

MoE并行折叠:面向高效大规模MoE模型训练的异构并行映射

Dennis Liu, Zijie Yan, Xin Yao, Tong Liu, Vijay Korthikanti, Evan Wu, Shiqing Fan, Gao Deng, Hongxiao Bai, Jianbin Chang, Ashwath Aithal, Michael Andersch, Mohammad Shoeybi, Jiajie Yao, Chandler Zhou, David Wu, Xipeng Li, June Yang

机构 * NVIDIA

AI总结 本文提出MoE并行折叠方法,通过解耦注意力层和MoE层的并行化,提升大规模MoE模型训练的效率与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12267 2026-03-03 cs.LG

Self-Supervised Learning via Flow-Guided Neural Operator on Time-Series Data

通过流引导神经算子实现自监督学习(时间序列数据)

Duy Nguyen, Jiachen Yao, Jiayun Wang, Julius Berner, Animashree Anandkumar

机构 * Department of Computing and Mathematical Sciences, Caltech(计算与数学科学部,Caltech) NVIDIA

AI总结 本文提出流引导神经算子(FGNO)框架,通过结合算子学习与流匹配,实现更灵活的自监督学习,提升时间序列数据表示学习的性能和鲁棒性。

Comments Accepted to NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22975 2026-03-03 cs.CV cs.GR cs.LG

VoMP: Predicting Volumetric Mechanical Property Fields

VoMP:预测体积机械属性场

Rishit Dagli, Donglai Xiang, Vismay Modi, Charles Loop, Clement Fuji Tsang, Anka He Chen, Anita Hu, Gavriel State, David I. W. Levin, Maria Shugrina

机构 * NVIDIA University of Toronto(多伦多大学)

AI总结 VoMP通过训练几何变换器预测3D物体的体积机械属性场,结合多视角特征和现实世界数据集,实现高精度和高速度的属性估计。

Comments Project Page and hi-res paper: https://research.nvidia.com/labs/sil/projects/vomp

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01265 2026-03-03 cs.LG cs.AI cs.CL

RLP: Reinforcement as a Pretraining Objective

RLP:将强化学习作为预训练目标

Ali Hatamizadeh, Syeda Nahida Akter, Shrimai Prabhumoye, Jan Kautz, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro, Yejin Choi

机构 * NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Stanford University(斯坦福大学)

AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。

Comments ICLR 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23365 2026-03-03 cs.LG

Emergence of Superposition: Unveiling the Training Dynamics of Chain of Continuous Thought

连续思维的涌现:揭示连续思维链的训练动态

Hanlin Zhu, Shibo Hao, Zhiting Hu, Jiantao Jiao, Stuart Russell, Yuandong Tian

机构 * UC Berkeley(加州大学伯克利分校) UCSD(加州大学圣地亚哥分校) Nvidia(英伟达) Meta AI

AI总结 本文通过分析两层Transformer在有向图可达性问题上的训练动态,揭示了连续思维链中叠加机制如何在训练过程中通过自回归扩展思维和预测阶段自然产生。

Comments 32 pages, 9 figures, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03113 2026-03-03 cs.CV cs.CL

Mitigating Multimodal Hallucinations via Gradient-based Self-Reflection

通过基于梯度的自我反思缓解多模态幻觉

Shan Wang, Maying Shen, Nadine Chang, Chuong Nguyen, Hongdong Li, Jose M. Alvarez

机构 * NVIDIA Australian National University(澳大利亚国立大学) Data61, CSIRO(Data61,CSIRO)

AI总结 本文提出GACD方法,通过梯度分析缓解多模态模型的幻觉问题,提升输出的视觉基础性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18116 2026-03-03 cs.LG cs.CL

NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning

NFT:在数学推理中连接监督学习与强化学习

Huayu Chen, Kaiwen Zheng, Qinsheng Zhang, Ganqu Cui, Lifan Yuan, Yin Cui, Haotian Ye, Tsung-Yi Lin, Ming-Yu Liu, Jun Zhu, Haoxiang Wang

机构 * Tsinghua(清华大学) NVIDIA UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学)

AI总结 NFT通过监督学习方法实现LLM自主改进,无需外部教师,在数学推理任务中超越传统RL算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13648 2026-03-03 cs.CL cs.AI

SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs

SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距

Yuling Gu, Oyvind Tafjord, Hyunwoo Kim, Jared Moore, Ronan Le Bras, Peter Clark, Yejin Choi

机构 * Allen Institute for AI(艾伦人工智能研究所) NVIDIA(英伟达) Stanford University(斯坦福大学)

AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00842 2026-03-03 cs.CL

MedGPT-oss: Training a General-Purpose Vision-Language Model for Biomedicine

MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型

Kai Zhang, Zhengqing Yuan, Cheng Peng, Songlin Zhao, Mengxian Lyu, Ziyi Chen, Yanfang Ye, Wei Liu, Ying Zhang, Kaleb E Smith, Lifang He, Lichao Sun, Yonghui Wu

机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) Research Computing, University of Florida(佛罗里达大学研究计算中心) AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)

AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。

Comments Technical report, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00720 2026-03-03 cs.LG

MARS: Harmonizing Multimodal Convergence via Adaptive Rank Search

MARS: 通过自适应排名搜索实现多模态收敛的统一

Minkyoung Cho, Insu Jang, Shuowei Jin, Zesen Zhao, Adityan Jothi, Ethem F. Can, Min-Hung Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。

Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00530 2026-03-03 cs.LG

Bridge Matching Sampler: Scalable Sampling via Generalized Fixed-Point Diffusion Matching

桥梁匹配采样器:通过广义固定点扩散匹配实现可扩展采样

Denis Blessing, Lorenz Richter, Julius Berner, Egor Malitskiy, Gerhard Neumann

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) NVIDIA(英伟达) Zuse Institute Berlin(柏林泽尼克研究所)

AI总结 桥梁匹配采样器通过广义固定点扩散匹配方法,实现了在保持模式多样性的同时可扩展的高质量采样。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00492 2026-03-03 cs.CV cs.AI cs.GR cs.LG

ArtiFixer: Enhancing and Extending 3D Reconstruction with Auto-Regressive Diffusion Models

ArtiFixer:利用自回归扩散模型增强和扩展3D重建

Riccardo de Lutio, Tobias Fischer, Yen-Yu Chang, Yuxuan Zhang, Jay Zhangjie Wu, Xuanchi Ren, Tianchang Shen, Katarina Tothova, Zan Gojcic, Haithem Turki

机构 * NVIDIA NVIDIA Santa Clara USA(NVIDIA) NVIDIA Zurich Switzerland(NVIDIA) Cornell University(康奈尔大学) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 ArtiFixer通过自回归扩散模型提升3D重建质量,解决现有方法在未观测区域的外推问题。

Comments Video results: https://artifixer2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00404 2026-03-03 cs.LG cs.AI

USE: Uncertainty Structure Estimation for Robust Semi-Supervised Learning

USE:用于鲁棒半监督学习的不确定性结构估计

Tsao-Lun Chen, Chien-Liang Liu, Tzu-Ming Harry Hsu, Tai-Hsien Wu, Chi-Cheng Fu, Han-Yi E. Chou, Shun-Feng Su

机构 * National Taiwan University of Science and Technology(台湾科技大学) Chang Gung University(长庚大学) Massachusetts Institute of Technology(麻省理工学院) The Ohio State University(俄亥俄州立大学) NVIDIA(NVIDIA公司) National Taiwan University(台湾大学)

AI总结 USE通过评估未标记数据质量提升半监督学习的鲁棒性和准确性。

Comments Revised mathematical derivations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00382 2026-03-03 cs.CV

DiffSOS: Acoustic Conditional Diffusion Model for Speed-of-Sound Reconstruction in Ultrasound Computed Tomography

DiffSOS:用于超声计算断层成像中声速重建的声学条件扩散模型

Yujia Wu, Shuoqi Chen, Shiru Wang, Yucheng Tang, Petr Bruza, Geoffrey P. Luke

机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院工程学院) NVIDIA Corp(NVIDIA公司)

AI总结 DiffSOS通过条件扩散模型实现超声计算断层成像中声速的高精度重建,结合物理波测量与混合损失函数,提升重建质量和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11769 2026-03-03 cs.LG cs.AI

GAR: Generative Adversarial Reinforcement Learning for Formal Theorem Proving

GAR:用于形式定理证明的生成对抗强化学习

Ruida Wang, Jiarui Yao, Rui Pan, Shizhe Diao, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达)

AI总结 GAR通过生成对抗强化学习框架提升形式定理证明的效率和性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22603 2026-03-03 cs.AI cs.LG

SideQuest: Model-Driven KV Cache Management for Long-Horizon Agentic Reasoning

SideQuest: 为长时间范围代理推理的模型驱动KV缓存管理

Sanjay Kariyappa, G. Edward Suh

机构 * NVIDIA

AI总结 SideQuest通过利用大型推理模型自身进行KV缓存压缩,有效减少代理任务中的内存使用,同时保持较高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏