arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-01-22 至 2026-01-22 共收录 2
2601.14599 2026-01-22 cs.LG cs.AI

Rethinking Reinforcement fine-tuning of LLMs: A Multi-armed Bandit Learning Perspective

重新思考大语言模型的强化微调:多臂老虎机学习视角

Xiao Hu, Hong Xie, Tao Tan, Defu Lian, Jianyu Han

机构 * University of Science and Technology of China(中国科学技术大学) IFlyTek (China)(iFlytek(中国))

AI总结 本文从多臂老虎机学习视角重新思考大语言模型的强化微调,通过极简实验流程揭示优化选择的作用及瓶颈问题,为该领域提供新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08705 2026-01-22 cs.IR cs.LG

RMBRec: Robust Multi-Behavior Recommendation towards Target Behaviors

RMBRec: 面向目标行为的鲁棒多行为推荐

Miaomiao Cai, Zhijie Zhang, Junfeng Fang, Zhiyong Cheng, Xiang Wang, Meng Wang

机构 * National University of Singapore(新加坡国立大学) Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学)

AI总结 RMBRec通过信息论鲁棒性原则,结合表示鲁棒性模块和优化鲁棒性模块,提升多行为推荐的鲁棒性和稳定性。

Journal ref WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏