Scaling Muon for Diffusion Transformers
针对扩散Transformer的Muon优化器的缩放研究
机构 * University of Southern California(南加州大学) ; Meta
AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。
大厂专区
针对扩散Transformer的Muon优化器的缩放研究
机构 * University of Southern California(南加州大学) ; Meta
AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。
面向生成式推荐的难度感知语义-ID优化
机构 * Meta ; The Pennsylvania State University(宾夕法尼亚州立大学)
AI总结 针对生成式推荐中标准GRPO与树结构任务适配差的问题,提出DASO方法,通过前缀匹配深度分配部署组,在公开及内部推荐任务上均取得优于对比方法的性能。
检测代码语言模型中的功能记忆
机构 * Meta ; Imperial College London(伦敦帝国学院)
AI总结 研究代码语言模型的功能记忆现象,通过反事实设置对比暴露目标代码的模型与未暴露的参考模型,使用文本和功能相似性度量,发现功能记忆超出文本重叠的检测范围。
LLMs 与停机问题:程序终止推理的特征化
机构 * FAIR Team, Meta AI(Meta AI FAIR 团队) ; The Hebrew University of Jerusalem, Israel(耶路撒冷希伯来大学) ; Bloomberg, New York, USA(彭博社,纽约,美国) ; Imperial College London, UK(伦敦帝国理工学院,英国) ; University College London, UK(伦敦大学学院,英国)
AI总结 本文评估了前沿LLMs在程序终止推理上的能力,发现GPT-5和Claude Sonnet 4.5在C程序终止判断上达到顶级验证工具水平,但无法生成形式化证明,并引入分歧前置条件形式化描述非终止条件。