arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-07-31 至 2026-07-31 共收录 4
2607.28449 2026-07-31 cs.CL 新提交

Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models

Lightning OPD 2.0:缓解大型推理模型跨教师在线策略蒸馏中的风格偏差

Yecheng Wu, Song Han, Han Cai

机构 * NVIDIA(英伟达)

AI总结 Lightning OPD 2.0通过交叉拟合风格残差化缓解大型推理模型跨教师在线策略蒸馏的风格偏差,在数学推理与代码生成基准中优于原方法,实现了跨教师设置下的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27787 2026-07-31 cs.LG cs.AI 新提交

LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

LoRA 支架策略优化(LSPO):零奖励悬崖提示下恢复强化学习梯度的采样时低秩支架

Ken Ding

机构 * NVIDIA(英伟达)

AI总结 针对数学推理 RLVR 的悬崖提示梯度丢失问题,提出 LSPO 采样时机制,通过 LoRA 适配器恢复梯度,在 DeepMath-103K 数据集上 16 项基准指标均优于 DAPO,平均提升 3.8 分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22932 2026-07-31 cs.LG 版本更新

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE: 融合寄存器梯度消除以实现内存高效的大语言模型训练

Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

机构 * Puch AI Singapore Institute of Technology(新加坡理工大学) Nanyang Technological University(南洋理工大学) NVIDIA(英伟达) IIIT-Delhi(德里印度理工学院)

AI总结 提出FORGE方法,将优化器步骤融合到反向传播中,逐块在寄存器中应用,消除梯度张量,减少内存占用并加速训练,在微调和持续预训练中速度提升约1.5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04319 2026-07-31 cs.GR cs.CV 版本更新

PureLight: Learning Complex Luminaires with Light Tracing

PureLight: 使用光线追踪学习复杂光源

Pedro Figueiredo, Zixuan Li, Beibei Wang, Miloš Hašan, Nima Khademi Kalantari

机构 * Texas A&M University(德克萨斯大学) Nankai University(南开大学) Nanjing University of Science and Technology(南京理工大学) NVIDIA(NVIDIA公司)

AI总结 提出一种基于神经网络的公式,通过光线追踪和归一化流网络学习复杂光源的辐射分布,并蒸馏为轻量级MLP以实现高效渲染。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏