机构
*
CAS Key Lab of Network Data Science and Technology, ICT, CAS, Beijing, China(中国科学院信息科技研究所网络数据科学与技术重点实验室)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学北京校区)
;
Zhongguancun Laboratory, Beijing, China(中关村实验室)
;
University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学)
专题命中
预训练与数据
:large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
The Fine Line: Navigating Large Language Model Pretraining with Down-streaming Capability Analysis
Chen Yang, Junzhuo Li, Xinyao Niu, Xinrun Du, Songyang Gao, Haoran Zhang, Zhaoliang Chen, Xingwei Qu, Ruibin Yuan, Yizhi Li, Jiaheng Liu, Stephen W. Huang, Shawn Yue, Ge Zhang
机构
*
Peking University(北京大学)
;
Tianjin University(天津大学)
;
University of Melbourne(墨尔本大学)
;
Multimodal Art Projection Research Community(多模态艺术投影研究社区)
;
Fudan University(复旦大学)
;
University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Emory University(埃默里大学)
;
HKUST(香港科技大学)
;
University of Manchester(曼彻斯特大学)
;
University of Waterloo(滑铁卢大学)
;
Vector Institute(矢量研究所)
专题命中
预训练与数据
:large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)
EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training
EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力
Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts
机构
*
Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院)
;
Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系)
;
Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院)
;
School of Humanities, Tallinn University(塔林大学人文学院)
专题命中
预训练与数据
:pretraining(title,abstract);post-training(title,abstract);LLM(abstract_cn);large language model(abstract)
Payoff scaling shapes cooperation in LLM agents across languages
收益规模塑造跨语言LLM代理的合作行为
Trung-Kiet Huynh, Dao-Sy Duy-Minh, Thanh-Bang Cao, Phong-Hao Le, Hong-Dan Nguyen, Phu-Quy Nguyen-Lam, Minh-Luan Nguyen-Vo, Hong-Phat Pham, Phu-Hoa Pham, Thien-Kim Than, Chi-Nguyen Tran, Huy Tran, Gia-Thoai Tran-Le, Alessio Buscemi, Le Hong Trang, The Anh Han
机构
*
Faculty of Information Technology, University of Science (HCMUS), Ho Chi Minh City, Vietnam(信息技术学院,科学大学(HCMUS),胡志明市,越南)
;
Faculty of Computer Science and Engineering, Ho Chi Minh City University of Technology (HCMUT), Ho Chi Minh City, Vietnam(计算机科学与工程学院,胡志明市技术大学(HCMUT),胡志明市,越南)
;
Vietnam National University – Ho Chi Minh City (VNU-HCM), Ho Chi Minh City, Vietnam(越南国家大学——胡志明市(VNU-HCM),胡志明市,越南)
;
Luxembourg Institute of Science and Technology (LIST), Luxembourg(卢森堡科学与技术研究所(LIST),卢森堡)
;
School of Computing, Engineering and Digital Technologies, Teesside University, Middlesbrough, United Kingdom(计算、工程与数字技术学院,泰赛德大学,米德尔斯布罗,英国)
专题命中
预训练与数据
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Task-Stratified Knowledge Scaling Laws for Post-Training Quantized Large Language Models
任务分层的知识扩展规律用于训练后量化的大语言模型
Chenxi Zhou, Pengfei Cao, Jiang Li, Bohan Yu, Jinyu Ye, Jun Zhao, Kang Liu
机构
*
School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院)
;
The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室)
;
School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)
;
College of Computer Science, Inner Mongolia University(内蒙古大学计算机学院)
专题命中
预训练与数据
:large language model(title,abstract);language model(title,abstract);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG