Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference
在参加之前侦察:Sketch-and-Walk稀疏注意力用于高效的LLM推理
Hoang Anh Duy Le, Sahil Joshi, Zeyu Yang, Zhaozhuo Xu, Anshumali Shrivastava
机构
*
Department of Computer Science, Rice University(计算机科学系, Rice大学)
;
Department of Computer Science, Stevens Institute of Technology(计算机科学系, Stevens理工学院)
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)
;
National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学,中国)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference
通过预处理稀疏性实现近oracle的KV选择用于长上下文推理
Yifei Gao, Lei Wang, Rong-Cheng Tu, Qixin Zhang, Jun Cheng, Dacheng Tao
机构
*
University College London(伦敦大学学院)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences (CAS)(深圳先进技术研究院,中国科学院)
;
Chinese University of Hong Kong(香港中文大学)
;
College of Computing & Data Science, Nanyang Technological University(computing 与数据科学学院,南洋理工大学)
专题命中
效率与部署
:LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
The Achilles' Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities
大语言模型的致命弱点:改变少量神经元即可摧毁语言能力
Zixuan Qin, Qingchen Yu, Kunlin Lyu, Zhaoxin Fan, Yifan Sun
机构
*
Center for Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心)
;
Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心)
;
School of Artificial Intelligence, Beihang University(北航人工智能学院)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
Enhancing Bandit Algorithms with LLMs for Time-varying User Preferences in Streaming Recommendations
利用LLM增强带算法以应对流媒体推荐中随时间变化的用户偏好
Chenglei Shen, Yi Zhan, Weijie Yu, Xiao Zhang, Jun Xu
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽学校)
;
School of Artificial Intelligence and Data Science, University of International Business and Economics(国际商务经济大学人工智能与数据科学学院)
专题命中
效率与部署
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
FlattenGPT: Depth Compression for Transformer with Layer Flattening
FlattenGPT: Transformer中基于层扁平化的深度压缩
Ruihan Xu, Qingpei Guo, Yao Zhu, Xiangyang Ji, Ming Yang, Shiliang Zhang
机构
*
State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学)
;
Tsinghua University(清华大学)