LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits
LoRAQuant:将LoRA混合精度量化至超低比特
Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou
机构
*
Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学)
;
RBC Borealis
;
Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)
AI Assistance Reduces Persistence and Hurts Independent Performance
人工智能辅助降低坚持性并损害独立表现
Grace Liu, Brian Christian, Tsvetomira Dumbalska, Michiel A. Bakker, Rachit Dubey
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
University of Oxford(牛津大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
University of California, Los Angeles(加州大学洛杉矶分校)
From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement
从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励
Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao
机构
*
Duke University(杜克大学)
;
Adobe Inc.(奥多比公司)
;
Oregon State University(俄勒冈州立大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
National University of Singapore(新加坡国立大学)
;
Amazon(亚马逊)