arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

2026-02-03 至 2026-02-03 共收录 4
2601.16979 2026-02-03 cs.LG cond-mat.dis-nn cs.AI stat.ML

A Scalable Measure of Loss Landscape Curvature for Analyzing the Training Dynamics of LLMs

用于分析大语言模型训练动态的可扩展损失景观曲率度量

Dayal Singh Kalra, Jean-Christophe Gagnon-Audet, Andrey Gromov, Ishita Mediratta, Kelvin Niu, Alexander H Miller, Michael Shvartsman

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of Maryland, College Park(马里兰大学哥伦比亚分校)

AI总结 本文提出了一种可扩展的损失景观曲率度量,用于分析大语言模型的训练动态,展示了大规模下的尖锐度现象,并指导数据混合策略。

Comments Improved Appendix D proofs, text for clarity, added more related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01247 2026-02-03 cs.LG cs.AI

Mechanistic Interpretability of Brain-to-Speech Models Across Speech Modes

跨语音模式的脑-语音模型机制可解释性

Maryam Maghsoudi, Ayushi Mishra

机构 * Department of Computer Science, University of Maryland, College Park, United States(计算机科学系,马里兰大学,College Park,美国) Department of Electrical and Computer Engineering, University of Maryland, College Park, United States(电气与计算机工程系,马里兰大学,College Park,美国)

AI总结 本研究通过机制可解释性方法揭示了脑-语音解码模型中语音模态信息的组织与利用机制,发现语音模态位于共享的连续因果流形上,跨模态转移由紧凑的层特定子空间介导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00453 2026-02-03 cs.LG cs.DC

FedMOA: Federated GRPO for Personalized Reasoning LLMs under Heterogeneous Rewards

FedMOA: 基于异质奖励的联邦GRPO用于个性化推理大语言模型

Ziyao Wang, Daeun Jung, Yexiao He, Guoheng Sun, Zheyu Shen, Myungjin Lee, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Cisco Research(思科研究)

AI总结 FedMOA是一种联邦GRPO框架,用于在异质奖励下实现个性化推理大语言模型的多目标对齐,通过自适应加权机制和任务感知聚合策略提升性能和个性化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00446 2026-02-03 cs.LG cs.CR

Towards Building Non-Fine-Tunable Foundation Models

构建不可微调的基础模型

Ziyao Wang, Nizhang Li, Pingzhi Li, Guoheng Sun, Tianlong Chen, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Macau University of Science and Technology(澳门科学技术大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

AI总结 本文提出PMP框架,通过构建不可微调的基础模型,限制未经授权微调的适应性提升,从而提高模型的安全性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏