Revisiting Block-based Quantisation: What is Important for Sub-8-bit LLM Inference?
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
Comments Accepted by EMNLP2023
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
Comments Accepted by EMNLP2023
专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments 17 pages, 15 figures, published to ACM MobiCom'24
Journal ref The 30th Annual International Conference on Mobile Computing and Networking, 2024
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments 16 pages, 8 figures, 5 tables
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
Comments 7 pages, 3 figures, 1 table
Journal ref Nature Communications (2024) 15:1569
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 效率与部署 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments Work in progress
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments 18 pages, 11 figures, submitted to Scientific Reports on Nov. 12, 2023
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 效率与部署 :foundation model(title);LLM(abstract);large language model(abstract);language model(abstract)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
Comments 10 pages, accepted by IEEE BigData 2023 as a workshop paper in GTA3
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments 15 pages, 2 figures
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
ButterflyQuant: 通过可学习的正交蝴蝶变换实现超低比特LLM量化
机构 * Bingxin Xu ; Zhen Dong ; Oussama Elachqar ; Yuzhang Shang
专题命中 效率与部署 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 ButterflyQuant通过可学习的正交蝴蝶变换实现超低比特LLM量化,有效抑制异常值并提升量化性能。
Comments Replace discrete Hadamard transforms with continuous Butterfly transforms to facilitate the learning of rotation matrices in LLM quantization
通过正交等价变换重新参数化LLM训练
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 POET通过正交等价变换重新参数化神经元,提升LLM训练的稳定性与泛化能力,并验证了其在大规模神经网络训练中的有效性。
Comments NeurIPS 2025 (40 pages, 26 figures, project page: https://spherelab.ai/poet/, v4: added experiments of finetuning and larger-scale pretraining)
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
Comments Extended version of short paper to appear in PAISE 2025: Mayank Arya and Yogesh Simmhan, "Understanding the Performance and Power of LLM Inferencing on Edge Accelerators" in 7th Workshop on Parallel AI and Systems for the Edge, Co-located with IEEE International Parallel & Distributed Processing Symposium (IPDPS), 2025
专题命中 效率与部署 :foundation model(title,comments);LLM(abstract);large language model(abstract);language model(abstract)
Comments presented as a poster at ACM EC 24 Foundation Models and Game Theory Workshop
专题命中 效率与部署 :LLM(title,abstract);language model(abstract,comments);large language model(abstract)
Comments Accepted to Vision-Language Models for Navigation and Manipulation (VLMNM) Workshop (ICRA 2024)
SplitLite:面向分裂学习的低秩残差压缩
机构 * The University of Hong Kong(香港大学) ; California Institute of Technology(加州理工学院)
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文针对设备端LLM联邦微调的高通信成本问题,提出SplitLite方法,利用残差的低秩结构压缩传输量,在保持性能的同时大幅降低了通信成本。
Ansari:基于检索的伊斯兰AI助手——架构、部署及14万次对话的经验教训
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究推出基于检索的伊斯兰AI助手Ansari,其经多平台部署后处理14万次跨语言对话,在IslamicMMLU等基准中表现优异,为信仰敏感型LLM部署提供了经验。
Comments 10 pages, 1 figure, 3 tables. Live system: https://askansari.ai . Code: https://github.com/ansari-project
更快、更便宜、更准确:专门知识追踪模型超越大语言模型
机构 * Prarthana Bhattacharyya(普拉塔拉·巴特查利亚) ; Joshua Mitton(乔舒亚·米顿) ; Ralph Abboud(拉尔夫·阿布德) ; Simon Woodhead(西蒙·伍德赫德)
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文比较了多种LLM和KT模型在预测性能、部署成本和推理速度上的表现,发现领域特定的KT模型在准确性上优于LLM。
Comments Published as Poster at EDM 2026. Link: https://educationaldatamining.org/edm2026/proceedings/2026.EDM.poster-demo-papers.379/2026.EDM.poster-demo-papers.379.pdf. 7 pages, 6 figures. Prarthana Bhattacharyya and Joshua Mitton contributed equally to this work
使用小型语言模型的低成本多语言短文本分类路由流水线
专题命中 效率与部署 :language model(title);small language model(title);分类 cs.CL、cs.AI
AI总结 本研究提出一种使用小型语言模型的多语言短文本分类路由流水线,通过选择性翻译低资源语言提升分类性能,在两个基准上验证了该策略的有效性。
Comments Accepted for publication at the 16th International Conference on Advanced Computer Information Technologies (ACIT 2026), https://acit.tech/
FriendBench:人类与多模态大语言模型的二元熟悉度推理基准
机构 * Fluid Concepts Research(流体概念研究机构)
专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI
AI总结 该研究推出FriendBench基准,通过20秒二元破冰对话片段推断两人熟悉度,对比7家公司26个模型与人类的表现,发现模型与人类准确率无统计差异但先验倾向不同,且仅人类能从可见行为中获益,同时发布了相关资源。
Comments 15 pages, 3 figures
公平剪枝:通过差分激活定位GLU-MLP层中的人口统计偏差
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出Fairness Pruning方法,通过最小对比提示对与激活捕获定位LLM的GLU-MLP层中人口统计偏差神经元,经实验验证该方法可针对性调控偏差且对模型能力影响极小。
Comments 15 pages, 3 figures, 9 tables. Code and datasets publicly available
开放权重大语言模型中的同质性偏见对解码超参数具有鲁棒性
机构 * Independent Researcher(独立研究者)
专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究开放权重LLM中同质性偏见对解码超参数的鲁棒性,发现西班牙裔和亚裔美国人的同质性偏见在大多数配置下稳健,而非裔美国人和性别偏见则因模型而异。
Comments 19 pages