arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Baidu(百度)

2026-07-21 至 2026-07-21 共收录 3
2607.17979 2026-07-21 cs.LG cs.AI 新提交

Harness Engineering for LLM-Driven GPU Kernel Generation

用于大语言模型驱动的GPU内核生成的工具工程

Yue Shui, Chenyu Ma, Hangfei Xu, Shengzhao Wen, Yanpeng Wang

机构 * Baidu, Inc.(百度公司)

AI总结 在MLSys 2026 FlashInfer竞赛中,针对NVIDIA Blackwell B200 GPU,提出以工具为中心的大语言模型驱动的GPU内核优化系统,分离评估工具与优化控制器,利用Codex等生成候选内核,实验显示优化后平均延迟加速显著,且代理辅助内核效果更佳。

Comments 24 pages, 6 figures. Extended technical report on our submission to the MLSys 2026 FlashInfer AI Kernel Generation Contest. Code: https://github.com/syhya/mlsys26-flashinfer-contest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16246 2026-07-21 cs.LG cs.AI 新提交

Let the Data Decide: Supervision Analysis, Capability Trade-offs, and Adaptive Objective Routing in Continued Pre-Training via Off-Policy Distillation

让数据决定:通过离策略蒸馏进行持续预训练中的监督分析、能力权衡和自适应目标路由

Jiangan Yuan, Zhixuan Li, Han Xu

机构 * Baidu Inc.(百度公司)

AI总结 研究离策略蒸馏中训练数据、目标参数化和模型能力的相互作用,通过分解问题进行“目标到能力”和“数据到目标”分析,引入诊断指标量化张力,探讨自适应目标路由,表明有效路由取决于信号质量,将持续预训练重构为监督设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16205 2026-07-21 cs.AI 新提交

It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches

需要8个令牌:通过辅助分支实现从弱到强的离策略强化学习

Dayu Wang, Jiaye Yang, Weikang Li, Jiahui Liang, Liwei Qian, Xin Pei, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanyang Technological University(南洋理工大学)

AI总结 研究针对可验证奖励强化学习中目标模型样本语义冗余问题,提出从弱到强学习范式,引入W2SPO方法,通过注入短辅助段指导策略探索,实验表明该方法在数学推理基准测试中性能优异,能提升训练速度和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏