arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Apple(苹果)

2026-05-19 至 2026-05-19 共收录 4
2510.00304 2026-05-19 cs.LG cs.AI

Barriers for Learning in an Evolving World: Mathematical Understanding of Loss of Plasticity

在不断变化的世界中学习的障碍:对学习能力丧失的数学理解

Amir Joudaki, Giulia Lanzillotta, Mohammad Samragh Razlighi, Iman Mirzadeh, Keivan Alizadeh, Thomas Hofmann, Mehrdad Farajtabar, Fartash Faghri

机构 * ETH Zürich(苏黎世联邦理工学院) Apple(苹果公司)

AI总结 本文研究了在非平稳环境中深度学习模型因学习能力丧失(LoP)而失效的问题,通过动力系统理论分析了LoP的两个主要机制,并探讨了缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16941 2026-05-19 cs.CL

Roll Out and Roll Back: Diffusion LLMs are Their Own Efficiency Teachers

展开与回退:扩散大语言模型是它们自己的效率教师

Fanqin Zeng, Feng Hong, Geng Yu, Huangjie Zheng, Xiaofeng Cao, Ya Zhang, Bo Han, Yanfeng Wang, Jiangchao Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Apple MLR Tongji University(同济大学) Hong Kong Baptist University(香港 Baptist 大学) RIKEN(日本理化学研究所)

AI总结 本文提出了一种基于可撤销解码的扩散大语言模型(DLLM)方法,通过发现可靠的去噪顺序来提升生成质量和效率,WINO和WINO+在多个数据集上展示了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01705 2026-05-19 cs.LG cs.AI

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

机构 * UC San Diego(斯克利普斯海洋研究所) Apple(苹果公司)

AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16342 2026-05-19 cs.LG cs.AI cs.CL

DACA-GRPO: Denoising-Aware Credit Assignment for Reinforcement Learning in Diffusion Language Models

DACA-GRPO:去噪感知的信用分配用于扩散语言模型中的强化学习

Amin Karimi Monsefi, Dominic Culver, Nikhil Bhendawade, Lokesh Boominathan, Manuel R. Ciosici, Yizhe Zhang, Irina Belousova

机构 * The Ohio State University(俄亥俄州立大学) Apple(苹果公司)

AI总结 本文提出DACA-GRPO,通过引入去噪进度评分和分层掩码似然,改进扩散语言模型中强化学习的信用分配,提升数学推理、代码生成等任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏