Scaling Muon for Diffusion Transformers
针对扩散Transformer的Muon优化器的缩放研究
机构 * University of Southern California(南加州大学) ; Meta
AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。
高校专区
针对扩散Transformer的Muon优化器的缩放研究
机构 * University of Southern California(南加州大学) ; Meta
AI总结 该研究针对大型扩散Transformer的Muon优化器,提出周期性行级Muon,在保留其生成质量优势的同时,大幅降低训练的计算、通信开销与时间。
开放权重掩码内省:测量语言模型可报告自身计算的能力
机构 * University of Southern California(南加州大学)
AI总结 本研究构建OWMI框架检验8个开放权重模型的内省能力,发现其无法区分真实干预与虚假运行,仅内部存在相关信息,失败源于内部状态到文本报告的路径,需对照内部参考验证模型证词。
Comments We release OWMI as a library so that this emerging ability can be measured as it develops. Hugging Face OWMI library: this https URL (https://huggingface.co/emilioferrara/owmi)
Logic-VLA:一种时序逻辑条件下的视觉-语言-动作模型
机构 * University of Southern California(南加州大学)
AI总结 Logic-VLA是感知形式化需求的VLA模型,以STL规约为条件,经两阶段适配后,在四旋翼导航仿真中大幅提升STL满足率,仅小幅降低常规NL任务成功率,可适配不同形式化需求。
ProtoFlow: 通过低曲率原型流缓解类别增量遥感分割中的遗忘
机构 * Faculty of Health Data Science, Juntendo University(静冈大学健康数据科学学院) ; The Institute of Collaborative Innovation, University of Macau(澳门大学协同创新研究所) ; Department of Information and Computing Sciences, Faculty of Science, Utrecht University(乌得勒支大学科学学院信息与计算科学系) ; Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) ; School of Computer Science, University of Chinese Academy of Sciences(中国科学院大学计算机科学学院) ; Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) ; Department of Computer Science, Juniata College(朱尼塔学院计算机科学系) ; National Engineering Research Center for Beijing Biochip Technology(北京生物芯片工程技术研究中心) ; CapitalBio Corporation(资本生物公司) ; Faculty of Engineering & Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) ; University Research and Innovation Center (EKIK), Obuda University(布达佩斯大学研究与创新中心(EKIK)) ; Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院) ; Department of Mathematics, University of Southern California(南加州大学数学系)
AI总结 本文提出ProtoFlow,一种时间感知的原型动态框架,通过将类别原型建模为轨迹并学习其演变,以缓解遥感分割中的遗忘问题,实验表明其在多个基准上取得了显著提升。
深度模型,浅层对齐:揭示神经解码中的粒度不匹配
机构 * Dept. of Electrical & Computer Engineering, University of Pittsburgh, USA(宾夕法尼亚大学电气与计算机工程系) ; Dept. of Biomedical Engineering, Tsinghua University, China(清华大学生物医学工程系) ; Dept. of Neurology, University of Southern California, USA(美国南加州大学神经病学系) ; Dept. of Computer Science, University of Texas Rio Grande Valley, USA(德克萨斯理工大学里奥格兰德谷分校计算机科学系)
AI总结 本文提出浅层对齐方法,通过对比学习策略解决神经解码中的粒度不匹配问题,显著提升解码性能。
Comments 33 pages, 16 figures