Runtime-Orchestrated Second-Order Optimization for Scalable LLM Training
面向可扩展大语言模型训练的运行时优化
机构 * Nvidia(英伟达)
AI总结 本文提出Asteria系统,通过分离二次优化逻辑与GPU训练路径,解决大规模矩阵优化器状态维护的系统成本问题,实现在内存受限和分布式训练中提升大语言模型的训练效率。
大厂专区
面向可扩展大语言模型训练的运行时优化
机构 * Nvidia(英伟达)
AI总结 本文提出Asteria系统,通过分离二次优化逻辑与GPU训练路径,解决大规模矩阵优化器状态维护的系统成本问题,实现在内存受限和分布式训练中提升大语言模型的训练效率。
熵跨桥梁:用于流和薛定谔采样的条件-边缘离散化
机构 * NVIDIA Corporation(NVIDIA公司) ; University of Oxford(牛津大学) ; Donders Institute for Brain, Cognition, and Behaviour(大脑与行为研究所) ; AITHYRA, Research Institute for Biomedical AI(生物医学人工智能研究所)
AI总结 本文提出一种基于熵率的目标,用于桥-aware的离散化,通过分离端点条件桥几何和边缘流演变,提升低预算下的高维桥和流采样性能。
神经点形
机构 * NVIDIA ; University of Oxford(牛津大学) ; Max Planck Institute for Mathematics in the Sciences(马克斯·普朗克数学研究所) ; Department of Mathematical Sciences(数学科学系) ; Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学和哥德堡大学) ; School of Engineering and Applied Sciences(工程与应用科学学院) ; Max Planck Institute of Molecular Cell Biology and Genetics(马克斯·普朗克分子细胞生物学与遗传学研究所)
AI总结 本文提出神经点形(NPFs),通过扩散几何中的拉普拉斯技术,构建点云的可学习几何特征,用于比较微分形式,并在合成和生物相关实验中展示其在处理采样密度、流形结构和群体几何时的优势。
HIVE:用于扩散大语言模型中幻觉检测的隐藏证据验证
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; NVIDIA Corporation(英伟达公司)
AI总结 HIVE通过提取去噪轨迹中的压缩隐藏证据,结合语言模型前缀嵌入进行验证,提升幻觉检测性能,优于多个基线模型。
Comments 5 figures, appendix included