Bootstrapping SparseFormers from Vision Foundation Models
专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)
Comments CVPR 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)
Comments CVPR 2024
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract)
Comments ICLR 2024
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments CVPR 2024 camera-ready
专题命中 效率与部署 :post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments 15 pages, 15 figures
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)
Comments 16 pages, 10 figures
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)
Comments 16 pages; 7 figures
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at ICLR 2024. First two authors contributed equally
专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)
Comments Project homepage: https://glee-vision.github.io
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to EMNLP 2023 (Main Conference)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted on ASE'2023
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments Accepted by the 23rd IEEE International Conference on Software Quality, Reliability, and Security (QRS 2023)
专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Peer reviewed and accepted for presentation at the Structured Probabilistic Inference & Generative Modeling (SPIGM) workshop at ICML 2023, Hawaii, USA
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2023; Code and data available at https://github.com/AlexTMallen/adaptive-retrieval
专题命中 效率与部署 :prompting(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 8 pages, 6 figures
PolyKV:一种用于多智能体LLM推理的共享非对称压缩KV缓存池
机构 * Independent Researcher(独立研究者)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG
AI总结 PolyKV通过非对称压缩技术实现多个并发推理代理共享单一KV缓存池,提升内存效率并减少推理延迟。
Comments 10 pages, 6 tables. Code: https://github.com/ishan1410/PolyKV Keywords: KV cache compression, multi-agent LLM inference, asymmetric quantization, FWHT, TurboQuant, shared memory
通过长度正则化改进扩散语言模型的变长生成
机构 * Tsinghua University(清华大学) ; Proxseer Inc.(Proxseer公司)
专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出LR-DLLM,通过长度正则化改进扩散语言模型的变长生成能力,提升了在未知长度下的生成效果。
Comments diffusion language models
机构 * ELLIS Institute Tübingen & Max-Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所及图宾根马克斯·普朗克智能系统研究所AI中心)
专题命中 效率与部署 :language model(title,abstract);pretraining(abstract,comments);分类 cs.CL、cs.LG
Comments Code can be found at https://github.com/seal-rg/recurrent-pretraining
硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质
机构 * University of Science and Technology of China(中国科学技术大学) ; Peking University(北京大学) ; IQuest Research(IQuest研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Zhejiang University(浙江大学)
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL
AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。
Comments Under Review