arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

2026-02-04 至 2026-02-04 共收录 4
2602.02924 2026-02-04 cs.LG cs.SY eess.SY

How Does the Lagrangian Guide Safe Reinforcement Learning through Diffusion Models?

如何通过扩散模型使拉格朗日量引导安全强化学习?

Xiaoyuan Cheng, Wenxuan Yuan, Boyang Li, Yuanchao Xu, Yiming Yang, Hao Liang, Bei Peng, Robert Loftin, Zhuo Sun, Yukun Hu

机构 * University College London(伦敦大学学院) Imperial College London(伦敦帝国学院) University of California, San Diego(加州大学圣地亚哥分校) Kyoto University(京都大学) King's College London(伦敦国王学院) University of Sheffield(谢菲尔德大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 本文提出ALGD算法,通过增强拉格朗日方法解决安全强化学习中的稳定性问题,实现稳定有效的政策生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02859 2026-02-04 cs.LG

Late-Stage Generalization Collapse in Grokking: Detecting anti-grokking with Weightwatcher

在Grokking后期阶段的泛化崩溃:用Weightwatcher检测anti-grokking

Hari K Prakash, Charles H Martin

机构 * University of California San Diego, Data Science and Engineering(加州大学圣地亚哥分校数据科学与工程)

AI总结 本文研究了Grokking后期阶段的泛化崩溃现象,通过WeightWatcher工具检测anti-grokking,并揭示了相关陷阱对泛化能力的影响。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02725 2026-02-04 cs.LG cs.SD eess.AS eess.SP

Automated Dysphagia Screening Using Noninvasive Neck Acoustic Sensing

非侵入式颈部声学传感用于自动吞咽障碍筛查

Jade Chng, Rong Xing, Yunfei Luo, Kristen Linnemeyer-Risser, Tauhidur Rahman, Andrew Yousef, Philip A Weissbrod

机构 * Jacobs School of Engineering, University of California San Diego(加州大学圣地亚哥分校 Jacobs 工程学院) Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Halıcıoğlu Data Science Institute, University of California San Diego(加州大学圣地亚哥分校 Halıcıoğlu 数据科学研究所) Department of Otolaryngology-Head and Neck Surgery, University of California San Diego(加州大学圣地亚哥分校耳鼻喉科与头颈外科系)

AI总结 本文提出利用非侵入式颈部声学传感与机器学习,实现吞咽障碍的自动化筛查,实验结果显示AUC-ROC达到0.904。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22975 2026-02-04 cs.AI

Golden Goose: A Simple Trick to Synthesize Unlimited RLVR Tasks from Unverifiable Internet Text

金 Goose:从不可验证的互联网文本中合成无限 RLVR 任务的简单技巧

Ximing Lu, David Acuna, Jaehun Jung, Jian Hu, Di Zhang, Shizhe Diao, Yunheng Zou, Shaokun Zhang, Brandon Cui, Mingjie Liu, Hyunwoo Kim, Prithviraj Ammanabrolu, Jan Kautz, Yi Dong, Yejin Choi

机构 * NVIDIA(NVIDIA公司) University of Washington(华盛顿大学) University of California San Diego(圣地亚哥大学)

AI总结 Golden Goose 通过从不可验证的互联网文本中合成无限 RLVR 任务,提升大型语言模型在复杂推理和网络安全领域的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏