arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-30 至 2025-12-30 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 43 篇

2508.03332 2025-12-30 cs.LG cs.AI 92%

Exploring Layer-wise Information Effectiveness for Post-Training Quantization in Small Language Models

探索分层信息有效性以实现小语言模型的后训练量化

He Xiao, Qingyao Yang, Dirui Xie, Wendong Xu, Zunhai Su, Runming yang, Wenyong Zhou, Haobo Liu, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);post-training(title,abstract);large language model(abstract)

AI总结 LieQ通过分层信息有效性量化方法,在亚8B模型中实现高效低比特压缩,减少精度损失并提升边缘设备部署可行性。

Comments low-bit quantization

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07185 2025-12-30 cs.CL cs.AI cs.LG 90%

DySK-Attn: A Framework for Efficient, Real-Time Knowledge Updating in Large Language Models via Dynamic Sparse Knowledge Attention

DySK-Attn:通过动态稀疏知识注意力实现大语言模型高效实时知识更新的框架

Kabir Khan, Priya Sharma, Arjun Mehta, Neha Gupta, Ravi Narayanan

机构 * Department of Computer Science, San Francisco State University, San Francisco, CA 94132, India(计算机科学系,圣何塞州立大学) Department of Computer Science and Engineering, Indian Institute of Technology Bombay, Mumbai 400076, India(印度班加罗尔理工学院计算机科学与工程系) Department of Computer Science and Engineering, Indian Institute of Technology Delhi, New Delhi 110016, India(印度德里理工学院计算机科学与工程系) Department of Computer Science and Automation, Indian Institute of Science, Bengaluru 560012, India(印度班加罗尔科学研究所计算机科学与自动化系) Machine Learning Lab, International Institute of Information Technology Hyderabad (IIIT-H), Hyderabad 500032, India(国际信息科技研究所海得拉巴分所机器学习实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DySK-Attn通过动态稀疏知识注意力机制,实现大语言模型高效实时知识更新,提升事实准确性和计算效率。

Comments Preprint; 7 figures, 3 tables, 1 algorithm; v1. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19486 2025-12-30 cs.LG cs.AI 90%

Efficient Inference Using Large Language Models with Limited Human Data: Fine-Tuning then Rectification

利用有限人类数据高效推理:微调后再校正

Lei Wang, Zikun Ye, Jinglong Zhao

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院) Questrom School of Business, Boston University(波士顿大学questrom商学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段框架,结合微调与校正,并优化有限标记样本的分配,以提高估计和推理性能,实现成本节约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21884 2025-12-30 cs.DC cs.AI cs.NI 89%

Optimizing Resource Allocation for Geographically-Distributed Inference by Large Language Models

通过大语言模型进行地理分布式推断的资源分配优化

Tingyang Sun, Ting He, Bo Ji, Parimal Parag

机构 * Department of Computer Science and Engineering, Pennsylvania State University, University Park, PA, USA(计算机科学与工程系,宾夕法尼亚州立大学,大学公园,PA,USA) Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(计算机科学系,弗吉尼亚理工大学,布莱克堡,VA,USA) Department of Electrical Communication Engineering, Indian Institute of Science, Bangalore, India(电子通信工程系,印度科学研究院,班加罗尔,印度)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出了一种系统研究分布式LLM推断中的资源分配问题,通过块放置和请求路由的优化,显著减少推断时间并开发了轻量级CPU模拟器。

Journal ref Performance Evaluation, Vol. 170, pp. 102527, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10426 2025-12-30 cs.CL 89%

Computational Economics in Large Language Models: Exploring Model Behavior and Incentive Design under Resource Constraints

在大型语言模型中进行计算经济学:在资源限制下探索模型行为和激励设计

Sandeep Reddy, Kabir Khan, Rohit Patil, Ananya Chakraborty, Faizan A. Khan, Swati Kulkarni, Arjun Verma, Neha Singh

机构 * Department of Computer Science and Engineering, Jorhat Engineering College(计算机科学与工程系,贾尔哈特工程学院) School of Computer Science, KLE Technological University(计算机科学学院,KLE技术大学) Department of Computer Applications, Bundelkhand University(计算机应用系,邦德尔坎德大学) Department of Computer Science, Sant Gadge Baba Amravati University(计算机科学系,桑塔·加德·巴瓦·阿姆拉瓦蒂大学) San Francisco State University(旧金山州立大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种基于计算经济学的LLM训练方法,通过引入计算成本项促进高效激活,实现更高效的模型和更可解释的注意力模式。

Comments Preprint; 7 figures, 4 tables, 1 algorithm. Experiments on GLUE (MNLI, STS-B, CoLA) and WikiText-103 with BERT-base; evaluation includes FLOPS, latency, Gini and entropy metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22402 2025-12-30 cs.DC cs.AI 89%

Efficient Multi-Model Orchestration for Self-Hosted Large Language Models

高效多模型编排用于自托管大型语言模型

Bhanu Prakash Vangala, Tanu Malik

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Pick和Spin框架通过混合路由模块和自适应自动化,提升自托管LLM的效率和经济性,实现更高的成功率、更低的延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14937 2025-12-30 cs.CL cs.CR 89%

Operationalizing a Threat Model for Red-Teaming Large Language Models (LLMs)

为大规模语言模型(LLMs)的红队测试构建威胁模型

Apurv Verma, Satyapriya Krishna, Sebastian Gehrmann, Madhavan Seshadri, Anu Pradhan, Tom Ault, Leslie Barrett, David Rabinowitz, John Doucette, NhatHai Phan

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出了一种针对大规模语言模型的威胁模型,并系统化地总结了红队攻击的分类、防御方法及实践策略,以提升LLM系统的安全性和鲁棒性。

Comments Transactions of Machine Learning Research (TMLR)

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22682 2025-12-30 cs.CL cs.AI 88%

Conformal Prediction Sets for Next-Token Prediction in Large Language Models: Balancing Coverage Guarantees with Set Efficiency

针对大语言模型的下一个标记预测的符合预测集:在覆盖保证与集合效率之间平衡

Yoshith Roy Kotla, Varshith Roy Kotla

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出VACP框架,通过语义掩码和温度调整评分,在保证覆盖的前提下显著提升预测集效率,实验证明其在大语言模型下一个标记预测中的有效性。

Comments 10 pages, 5 tables and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23014 2025-12-30 cs.CL 87%

Improving Generalization in LLM Structured Pruning via Function-Aware Neuron Grouping

通过函数感知神经元分组提升LLM结构剪枝的泛化能力

Tao Yu, Yongqi An, Kuan Zhu, Guibo Zhu, Ming Tang, Jinqiao Wang

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 FANG通过函数感知神经元分组提升LLM结构剪枝的泛化能力,结合FLAP和OBC方法在稀疏性下提升下游任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23184 2025-12-30 cs.AI econ.EM 85%

From Model Choice to Model Belief: Establishing a New Measure for LLM-Based Research

从模型选择到模型信念:为基于大语言模型的研究建立新的度量标准

Hongshen Sun, Juanjuan Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出模型信念作为LLM研究的新度量标准,通过需求估计实验展示其在提高估计精度和降低计算成本方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23029 2025-12-30 cs.DC cs.AI 85%

Viability and Performance of a Private LLM Server for SMBs: A Benchmark Analysis of Qwen3-30B on Consumer-Grade Hardware

私有LLM服务器的可行性和性能:基于Qwen3-30B在消费级硬件上的基准分析

Alex Khalil, Guillaume Heilles, Maria Parraga, Simon Heilles

机构 * UCLouvain(列日大学) Universidad Espíritu Santo(圣灵大学) DENEM Labs(DENEM实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文基于Qwen3-30B在消费级硬件上评估私有LLM服务器的可行性和性能,证明其在成本和隐私方面对SMBs的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22309 2025-12-30 cs.LG cs.AI 85%

LLMBoost: Make Large Language Models Stronger with Boosting

LLMBoost: 通过提升使大型语言模型更强

Zehao Chen, Tianxiang Ai, Yifei Li, Gongxun Li, Yuyang Wei, Wang Zhou, Guanghui Li, Bin Yu, Zhijun Chen, Hailong Sun, Fuzhen Zhuang, Jianxin Li, Deqing Wang, Yikun Ban

机构 * Beihang University(北航大学) China Telecom eSurfing Cloud(中国电信云)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 LLMBoost通过引入跨模型注意力机制、链式训练范式和近似并行推理范式,提升大型语言模型的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22925 2025-12-30 cs.DC 85%

Argus: Token Aware Distributed LLM Inference Optimization

Argus:基于令牌的分布式大语言模型推理优化

Panlong Wu, Yifei Zhong, Danyang Chen, Ting Wang, Fangxin Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Argus是一种基于令牌的分布式大语言模型推理优化框架,通过长度感知语义模块和Lyapunov引导卸载优化模块,实现高效的任务卸载和动态异构环境下的高效率推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12018 2025-12-30 cs.CL cs.AI cs.LG 85%

Atom of Thoughts for Markov LLM Test-Time Scaling

思想原子用于马尔可夫LLM测试时间扩展

Fengwei Teng, Quan Shi, Zhaoyang Yu, Jiayi Zhang, Yuyu Luo, Chenglin Wu, Zhijiang Guo

机构 * HKUST(GZ)(香港科技大学(广州)) DeepWisdom(DeepWisdom公司) Renmin University of China(中国人民大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出思想原子(\our),通过马尔可夫链结构与树搜索等技术结合,实现高效推理,提升LLM测试时间扩展性能。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23145 2025-12-30 cs.CL cs.AI 84%

Reservoir Computing inspired Matrix Multiplication-free Language Model

受回声计算启发的无矩阵乘法语言模型

Takumi Shiratsuchi, Yuichiro Tanaka, Hakaru Tamukoh

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology, Japan(九州工学技术大学生命科学与系统工程研究生院) Research Center for Neuromorphic AI Hardware, Kyushu Institute of Technology, Japan(九州工学技术大学神经形态人工智能硬件研究中心)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种受回声计算启发的无矩阵乘法语言模型,通过共享权重和优化内存访问,有效降低计算成本并提升效率。

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22737 2025-12-30 cs.CL 83%

WeDLM: Reconciling Diffusion Language Models with Standard Causal Attention for Fast Inference

WeDLM:弥合扩散语言模型与标准因果注意力以实现快速推理

Aiwei Liu, Minghua He, Shaoxun Zeng, Sijun Zhang, Linhao Zhang, Chuhan Wu, Wei Jia, Yuan Liu, Xiao Zhou, Jie Zhou

机构 * WeChat AI, Tencent(腾讯微信AI) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 WeDLM通过使用标准因果注意力实现高效并行解码,显著提升推理速度,优于优化的AR引擎。

Comments 23 pages, 8 figures, project page: https://wedlm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22238 2025-12-30 cs.LG cs.AI cs.CV 81%

Masking Teacher and Reinforcing Student for Distilling Vision-Language Models

掩码教师与强化学生用于蒸馏视觉-语言模型

Byung-Kwan Lee, Yu-Chiang Frank Wang, Ryo Hachiuma

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Masters通过掩码教师和强化学生的方法,解决视觉-语言模型蒸馏中的大小差距问题,提升学生模型的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22195 2025-12-30 cs.DC cs.AI cs.LG 81%

MatKV: Trading Compute for Flash Storage in LLM Inference

MatKV: 用闪存存储替代计算以提升大语言模型推理效率

Kun-Woo Shin, Jay H. Park, Moonwook Oh, Yohan Jo, Jaeyoung Do, Sang-Won Lee

机构 * Seoul National University(首尔国立大学) Samsung Electronics(三星电子)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 MatKV通过预先计算并存储键值向量以提升RAG推理效率,减少能耗和时间,同时保持问答准确性。

Comments Accepted for publication in ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21580 2025-12-30 cs.CL 79%

Gamayun's Path to Multilingual Mastery: Cost-Efficient Training of a 1.5B-Parameter LLM

Gamayun的多语言 mastery 之路:一种 1.5B 参数 LLM 的高效训练

Alexander Podolskiy, Semen Molokov, Timofey Gerasin, Maksim Titov, Alexey Rukhovich, Artem Khrapov, Kirill Morozov, Evgeny Tetin, Constantine Korikov, Pavel Efimov, Polina Lazukova, Yuliya Skripkar, Nikita Okhotnikov, Irina Piontkovskaya, Meng Xiaojun, Zou Xueyi, Zhang Zhenhe

机构 * Gamayun Team(Gamayun团队)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.CL

AI总结 Gamayun 通过两阶段预训练策略,在资源受限环境下高效训练出 1.5B 参数多语言模型,支持 12 种语言,尤其在俄语上取得先进成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15545 2025-12-30 cs.CL cs.AI 79%

TokenTiming: A Dynamic Alignment Method for Universal Speculative Decoding Model Pairs

TokenTiming: 一种适用于通用推测解码模型对的动态对齐方法

Sibo Xiao, Jinyuan Fu, Zhongle Xie, Lidan Shou

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TokenTiming通过动态对齐方法实现通用推测解码,无需重新训练即可处理不同词汇模型,提升LLM推理效率1.57倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22125 2025-12-30 cs.DC cs.AI 77%

GPU-Virt-Bench: A Comprehensive Benchmarking Framework for Software-Based GPU Virtualization Systems

GPU-Virt-Bench: 一种全面的软件GPU虚拟化系统基准测试框架

Jithin VG, Ditto PS

机构 * Bud Ecosystem Inc(Bud生态系统公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GPU-Virt-Bench是一种用于评估软件GPU虚拟化系统性能的全面基准测试框架,通过56项指标评估隔离质量、LLM性能等关键因素,为多租户环境下的GPU资源部署提供决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14973 2025-12-30 cs.CL cs.AI cs.LG 75%

Attention Is All You Need for KV Cache in Diffusion LLMs

注意力是扩散大语言模型中KV缓存的所有需求

Quan Nguyen-Tri, Mukul Ranjan, Zhiqiang Shen

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Elastic-Cache方法,通过适应性缓存更新提升扩散LLM的解码效率和生成质量。

Comments Code at: https://github.com/VILA-Lab/Elastic-Cache

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18516 2025-12-30 eess.AS 75%

Distinctive Feature Codec: An Adaptive Efficient Speech Representation for Depression Detection

Distinctive Feature Codec: 一种适应性高效的抑郁症检测语音表示

Xiangyu Zhang, Fuming Fang, Peng Gao, Bin Qin, Beena Ahmed, Julien Epps

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Distinctive Feature Codec通过动态分割信号生成可变长度标记,提升抑郁症检测的语音表示效率和时间动态性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23310 2025-12-30 cs.LG cs.AI cs.DC cs.ET cs.NI 73%

Splitwise: Collaborative Edge-Cloud Inference for LLMs via Lyapunov-Assisted DRL

Splitwise: 通过Lyapunov辅助深度强化学习实现LLM的协作边缘-云推断

Abolfazl Younesi, Abbas Shabrang Maryan, Elyas Oustad, Zahra Najafabadi Samani, Mohsen Ansari, Thomas Fahringer

机构 * University of Innsbruck(因斯布鲁克大学) Sharif University of Technology(谢赫·巴赫尔·卡什·大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Splitwise通过Lyapunov辅助深度强化学习实现LLM在边缘和云环境中的细粒度自适应划分,减少延迟和能耗,提高鲁棒性。

Comments 11 pages, 9 figures. Accepted by ACM for presentation at UCC '25 (18th International Conference on Utility and Cloud Computing), December 1-4, 2025, France. Proceedings publication pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22733 2025-12-30 cs.LG cs.AI 73%

FoldAct: Efficient and Stable Context Folding for Long-Horizon Search Agents

FoldAct: 长时间 horizon 搜索代理的高效且稳定的上下文折叠

Jiaqi Shao, Yufeng Miao, Wei Zhang, Bing Luo

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Duke Kunshan University(杜克大学昆山学院) Microsoft AI(微软人工智能)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FoldAct通过分离损失计算、全上下文一致性损失和选择性段训练,解决长时间 horizon 搜索代理中上下文折叠的非平稳观察问题,提升训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22562 2025-12-30 cs.CL cs.AI 73%

Learning When Not to Attend Globally

学习何时不进行全局关注

Xuan Luo, Kailai Zhang, Xifeng Yan

机构 * Department of Computer Science, UC Santa Barbara(计算机科学系,加州大学圣巴巴拉分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AHA通过动态切换全关注与局部滑动窗口关注,实现高效推理,减少93%的完全关注操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22129 2025-12-30 cs.MA cs.AI cs.LG 73%

ReCollab: Retrieval-Augmented LLMs for Cooperative Ad-hoc Teammate Modeling

ReCollab:基于检索增强的LLM用于协作即兴队友建模

Conor Wallace, Umer Siddique, Yongcan Cao

机构 * Department of Electrical and Computer Engineering, University of Texas at San Antonio(电子与计算机工程系,德克萨斯大学圣安东尼奥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ReCollab通过检索增强生成技术提升即兴团队合作中队友行为建模的适应性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22886 2025-12-30 cs.LG stat.ML 70%

Theory and Algorithms for Learning with Multi-Class Abstention and Multi-Expert Deferral

多类回避与多专家延迟学习的理论与算法

Anqi Mao

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出多专家延迟和回避学习的理论框架与算法,通过设计替代损失函数和一致性保证,提升分类和回归任务的性能与效率。

Comments Ph.D. Dissertation, New York University

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16531 2025-12-30 cs.AI 70%

Scaling Laws for Energy Efficiency of Local LLMs

本地大语言模型和视觉-语言模型的扩展定律

Ander Alvarez, Alessandro Genuardi, Nilotpal Sinha, Antonio Tiene, Mikail Okyay, Bakbergen Ryskulov, David Montero, Samuel Mugel, Román Orús

机构 * Multiverse Computing Donostia International Physics Center Ikerbasque Foundation for Science Multiverse Computing, Centre for Social Innovation

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示了本地大语言模型和视觉-语言模型在中央处理单元上的计算扩展定律,并展示了量子启发压缩在降低能耗和资源消耗方面的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13797 2025-12-30 cs.CL 70%

Breadcrumbs Reasoning: Memory-Efficient Reasoning with Compression Beacons

痕迹推理:通过压缩信标实现的内存高效推理

Giovanni Monea, Yair Feldman, Shankar Padmanabhan, Kianté Brantley, Yoav Artzi

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出通过压缩信标实现内存高效推理,利用联合蒸馏和强化学习框架优化缓存压缩,提升大语言模型在长上下文推理中的内存与准确性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏