Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMs
稳定异步性:用于大语言模型的方差控制的非策略强化学习
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。
大厂专区
稳定异步性:用于大语言模型的方差控制的非策略强化学习
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
AI总结 VCPO通过动态调整学习率和最小方差基线,提升大语言模型异步训练的稳定性与效率。
MoE并行折叠:面向高效大规模MoE模型训练的异构并行映射
机构 * NVIDIA
AI总结 本文提出MoE并行折叠方法,通过解耦注意力层和MoE层的并行化,提升大规模MoE模型训练的效率与可扩展性。
通过流引导神经算子实现自监督学习(时间序列数据)
机构 * Department of Computing and Mathematical Sciences, Caltech(计算与数学科学部,Caltech) ; NVIDIA
AI总结 本文提出流引导神经算子(FGNO)框架,通过结合算子学习与流匹配,实现更灵活的自监督学习,提升时间序列数据表示学习的性能和鲁棒性。
Comments Accepted to NeurIPS 2025 Workshop
VoMP:预测体积机械属性场
机构 * NVIDIA ; University of Toronto(多伦多大学)
AI总结 VoMP通过训练几何变换器预测3D物体的体积机械属性场,结合多视角特征和现实世界数据集,实现高精度和高速度的属性估计。
Comments Project Page and hi-res paper: https://research.nvidia.com/labs/sil/projects/vomp
RLP:将强化学习作为预训练目标
机构 * NVIDIA(英伟达) ; Carnegie Mellon University(卡内基梅隆大学) ; Boston University(波士顿大学) ; Stanford University(斯坦福大学)
AI总结 RLP通过将强化学习的探索精神引入预训练阶段,提升模型在数学和科学任务中的推理能力。
Comments ICLR 2026 camera ready
连续思维的涌现:揭示连续思维链的训练动态
机构 * UC Berkeley(加州大学伯克利分校) ; UCSD(加州大学圣地亚哥分校) ; Nvidia(英伟达) ; Meta AI
AI总结 本文通过分析两层Transformer在有向图可达性问题上的训练动态,揭示了连续思维链中叠加机制如何在训练过程中通过自回归扩展思维和预测阶段自然产生。
Comments 32 pages, 9 figures, accepted by ICLR 2026
通过基于梯度的自我反思缓解多模态幻觉
机构 * NVIDIA ; Australian National University(澳大利亚国立大学) ; Data61, CSIRO(Data61,CSIRO)
AI总结 本文提出GACD方法,通过梯度分析缓解多模态模型的幻觉问题,提升输出的视觉基础性。
Comments CVPR 2026
NFT:在数学推理中连接监督学习与强化学习
机构 * Tsinghua(清华大学) ; NVIDIA ; UIUC(伊利诺伊大学香槟分校) ; Stanford(斯坦福大学)
AI总结 NFT通过监督学习方法实现LLM自主改进,无需外部教师,在数学推理任务中超越传统RL算法。
SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距
机构 * Allen Institute for AI(艾伦人工智能研究所) ; NVIDIA(英伟达) ; Stanford University(斯坦福大学)
AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。
Comments ICLR 2026
MedGPT-oss: 为生物医学训练一个通用的视觉-语言模型
机构 * Department of Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) ; Department of Computer Science and Engineering, University of Notre Dame(圣母大学计算机科学与工程系) ; Department of Health Outcomes & Biomedical Informatics, University of Florida(佛罗里达大学健康结果与生物医学信息学系) ; Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) ; Research Computing, University of Florida(佛罗里达大学研究计算中心) ; AI Technology Center, NVIDIA(NVIDIA人工智能技术中心)
AI总结 MEDGPT-oss是一款开放式权重的200亿参数视觉-语言模型,通过优化训练课程实现多模态和文本推理能力,适用于隐私保护的临床AI研究。
Comments Technical report, work in progress
MARS: 通过自适应排名搜索实现多模态收敛的统一
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达)
AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。
Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/
桥梁匹配采样器:通过广义固定点扩散匹配实现可扩展采样
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; NVIDIA(英伟达) ; Zuse Institute Berlin(柏林泽尼克研究所)
AI总结 桥梁匹配采样器通过广义固定点扩散匹配方法,实现了在保持模式多样性的同时可扩展的高质量采样。
Comments Preprint
ArtiFixer:利用自回归扩散模型增强和扩展3D重建
机构 * NVIDIA ; NVIDIA Santa Clara USA(NVIDIA) ; NVIDIA Zurich Switzerland(NVIDIA) ; Cornell University(康奈尔大学) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
AI总结 ArtiFixer通过自回归扩散模型提升3D重建质量,解决现有方法在未观测区域的外推问题。
Comments Video results: https://artifixer2026.github.io/
USE:用于鲁棒半监督学习的不确定性结构估计
机构 * National Taiwan University of Science and Technology(台湾科技大学) ; Chang Gung University(长庚大学) ; Massachusetts Institute of Technology(麻省理工学院) ; The Ohio State University(俄亥俄州立大学) ; NVIDIA(NVIDIA公司) ; National Taiwan University(台湾大学)
AI总结 USE通过评估未标记数据质量提升半监督学习的鲁棒性和准确性。
Comments Revised mathematical derivations
DiffSOS:用于超声计算断层成像中声速重建的声学条件扩散模型
机构 * Thayer School of Engineering, Dartmouth College(达特茅斯学院工程学院) ; NVIDIA Corp(NVIDIA公司)
AI总结 DiffSOS通过条件扩散模型实现超声计算断层成像中声速的高精度重建,结合物理波测量与混合损失函数,提升重建质量和可靠性。
GAR:用于形式定理证明的生成对抗强化学习
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; NVIDIA(英伟达)
AI总结 GAR通过生成对抗强化学习框架提升形式定理证明的效率和性能
SideQuest: 为长时间范围代理推理的模型驱动KV缓存管理
机构 * NVIDIA
AI总结 SideQuest通过利用大型推理模型自身进行KV缓存压缩,有效减少代理任务中的内存使用,同时保持较高的准确性。