Break Through the Compression Bottleneck: From Theory to Practice
突破压缩瓶颈:从理论到实践
Xiusheng Huang, Lu Wang, Yequan Wang, Jun Zhao, Kang Liu
机构
*
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中
效率与部署
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)
;
School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
;
Huawei Foundation Model Dept(华为基础模型部)
专题命中
效率与部署
:large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls
Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering
看一次就够了?用于3D问答的在线几何感知令牌剪枝
Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun
机构
*
National Tsing Hua University(国立清华大学)
;
Industrial Technology Research Institute ITRI(工业技术研究院)
;
University of Toronto(多伦多大学)
;
Atmanity Inc(Atmanity公司)
专题命中
效率与部署
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Don't Wait to Reply: Towards Responsive yet Thoughtful Dialogue through Proactive Thinking
不要等待回复:通过主动思考实现响应迅速且深思熟虑的对话
Ante Wang, Jiaqi Fu, Xuanyi Chen, Ruotian Ma, Zhaopeng Tu, Weizhi Ma, Yang Liu
机构
*
Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院)
;
Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
;
Tencent(腾讯)
专题命中
效率与部署
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI