机构
*
Shanghai AI Laboratory(上海人工智能实验室)
;
Tsinghua University(清华大学)
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Institute of Automation(自动化研究所)
;
Fudan University(复旦大学)
;
High School Affiliated to Fudan University(复旦大学附属高中)
;
Renmin University of China(中国人民大学)
;
University of Washington(华盛顿大学)
专题命中
效率与部署
:large language model(abstract);language model(abstract);分类 cs.LG
Transformers as Unsupervised Learning Algorithms: A study on Gaussian Mixtures
Transformer作为无监督学习算法:对高斯混合模型的研究
Zhiheng Chen, Ruofan Wu, Guanhua Fang
机构
*
Shanghai Center for Mathematical Sciences, Fudan University(复旦大学上海数学中心)
;
Department of Statistics and Data Science, School of Management, Fudan University(复旦大学管理学院统计与数据科学系)
专题命中
效率与部署
:large language model(abstract);language model(abstract);分类 cs.LG
机构
*
Department of Electrical and Computer Engineering, Duke University, Durham, US(电子工程系,杜克大学,达勒姆,美国)
;
Department of Computer Science, Duke University, Durham, US(计算机科学系,杜克大学,达勒姆,美国)
;
Department of Biostatistics and Bioinformatics, Duke University, Durham, US(生物统计学与生物信息学系,杜克大学,达勒姆,美国)
;
Department of Statistics and Data Science, Yale University, New Haven, US(统计学与数据科学系,耶鲁大学,纽 Haven,美国)
Efficient Attention via Pre-Scoring: Prioritizing Informative Keys in Transformers
通过预评分实现高效的注意力机制:在Transformer中优先选择信息量大的键
Zhexiang Li, Haoyu Wang, Yutong Bao, David Woodruff
机构
*
Carnegie Mellon University, Pittsburgh, USA
;
University of Southern California, Los Angeles, CA, USA
;
University of California, San Diego, Department of Mathematics, La Jolla, CA, USA
;
University of California, Davis, Applied Mathematics \& Statistics, Davis, CA, USA
;
Carnegie Mellon University, Pittsburgh, PA, USA