arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-03 至 2026-07-03 共收录 3
2607.02390 2026-07-03 cs.LG 新提交

DecompRL: Solving Harder Problems by Learning Modular Code Generation

DecompRL: 通过学习模块化代码生成解决更难的问题

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve

机构 * FAIR at Meta Inria, \'Ecole Normale Sup\'erieure

AI总结 提出DecompRL算法,通过强化学习将问题分解为可复用的子函数,重组模块生成候选解,将GPU瓶颈转移至CPU评估,在LiveCodeBench和CodeContests上超越标准RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01490 2026-07-03 cs.LG cs.AI 新提交

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

不要让收益消失:解析强化学习中的策略梯度权重

Juliette Decugis, Sean O'Brien, Francis Bach, Gabriel Synnaeve, Taco Cohen

机构 * FAIR at Meta(Meta FAIR) Inria, Ecole Normale Supérieure(法国国家信息与自动化研究所,巴黎高等师范学院) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 提出FADE方法,通过动态调整优势函数的正负和难度权重,解决RL训练不稳定和多样性崩溃问题,在7B和32B模型上分别提前20k和2k步达到最佳pass@1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31432 2026-07-03 cs.CL 新提交

Clinically Structured Rank-Gated LoRA for Cross-Benchmark Medical Question Answering

临床结构化的秩门控LoRA用于跨基准医学问答

Hao Gong, Ruilin Gong, Yining Huang

机构 * Meta Emergence Laboratory(Meta Emergence 实验室)

AI总结 提出BiRG-LoRA,一种单适配器秩门控LoRA方法,通过双轴门控选择稀疏秩子集并控制注入强度,在四个医学基准上平均准确率达69.31%,优于MoELoRA且参数减少28.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏