arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-07-03 至 2026-07-03 共收录 5
2607.02390 2026-07-03 cs.LG 新提交

DecompRL: Solving Harder Problems by Learning Modular Code Generation

DecompRL: 通过学习模块化代码生成解决更难的问题

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve

机构 * FAIR at Meta Inria, \'Ecole Normale Sup\'erieure

AI总结 提出DecompRL算法,通过强化学习将问题分解为可复用的子函数,重组模块生成候选解,将GPU瓶颈转移至CPU评估,在LiveCodeBench和CodeContests上超越标准RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01490 2026-07-03 cs.LG cs.AI 新提交

Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL

不要让收益消失:解析强化学习中的策略梯度权重

Juliette Decugis, Sean O'Brien, Francis Bach, Gabriel Synnaeve, Taco Cohen

机构 * FAIR at Meta(Meta FAIR) Inria, Ecole Normale Supérieure(法国国家信息与自动化研究所,巴黎高等师范学院) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 提出FADE方法,通过动态调整优势函数的正负和难度权重,解决RL训练不稳定和多样性崩溃问题,在7B和32B模型上分别提前20k和2k步达到最佳pass@1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31432 2026-07-03 cs.CL 新提交

Clinically Structured Rank-Gated LoRA for Cross-Benchmark Medical Question Answering

临床结构化的秩门控LoRA用于跨基准医学问答

Hao Gong, Ruilin Gong, Yining Huang

机构 * Meta Emergence Laboratory(Meta Emergence 实验室)

AI总结 提出BiRG-LoRA,一种单适配器秩门控LoRA方法,通过双轴门控选择稀疏秩子集并控制注入强度,在四个医学基准上平均准确率达69.31%,优于MoELoRA且参数减少28.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02509 2026-07-03 cs.CV 版本更新

Rapidly deploying on-device eye tracking by distilling visual foundation models

通过蒸馏视觉基础模型快速部署设备端眼动追踪

Cheng Jiang, Jogendra Kundu, David Colmenares, Fengting Yang, Joseph P Robinson, Ali Behrooz, Yatong An

机构 * Meta Reality Labs(Meta现实实验室) University of Michigan(密歇根大学)

AI总结 本文提出DistillGaze框架,通过合成数据和真实数据蒸馏视觉基础模型,实现高精度设备端眼动追踪,减少58.62%的中位眼动误差,模型轻量适合实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03001 2026-07-03 cs.LG cs.AI 版本更新

Adaptive Batch Sizes Using Non-Euclidean Gradient Noise Scales for Stochastic Sign and Spectral Descent

基于非欧几里得梯度噪声尺度的自适应批大小用于随机符号和谱下降

Hiroki Naganuma, Shagun Gupta, Youssef Briki, Ioannis Mitliagkas, Irina Rish, Parameswaran Raman, Hao-Jun Michael Shi

机构 * Mila, Montreal, Canada(Mila,加拿大蒙特利尔) Meta Platforms, Menlo Park, California, USA(Meta平台,美国Menlo Park,加利福尼亚州)

AI总结 针对符号下降和谱下降优化器,推导了非欧几里得梯度噪声尺度,并提出高效方差估计方法,实现自适应批大小,在Llama模型上减少高达66%训练步数。

Comments 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏