arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2606.05429 2026-06-05 cs.AI 91%

Minimizing the Hidden Cost of Scales: Graph-Guided Ultra-Low-Bit Quantization for Large Language Models

最小化缩放因子的隐藏成本:面向大语言模型的图引导超低位量化

Rayyan Abdalla, Amir Hussein, Min Wu, Dinesh Manocha

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 提出SAGE-PTQ框架,通过图引导的显著性感知量化分离显著与非显著权重,实现超低位量化并最小化缩放开销,在LLaMA-3-8B上困惑度降至6.74且内存低于BiLLM的50%。

Comments Preprint. 18 pages, 10 figures, 7 tables, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07783 2026-05-11 cs.CL 91%

Chain-based Distillation for Effective Initialization of Variable-Sized Small Language Models

基于链式蒸馏的变量大小小型语言模型有效初始化方法

Boyu Shi, YiCheng Jiang, Chang Liu, Qiufeng Wang, Xu Yang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院,南京,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用重点实验室(东南大学),教育部,中国)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出链式蒸馏方法,通过逐步蒸馏构建中间模型链,实现变量大小语言模型的高效初始化,提升效率和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00815 2026-05-05 cs.AI 91%

Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement

通过动态单次策略细化实现大规模语言模型推理的资源高效强化学习

Yunjian Zhang, Sudong Wang, Yang Li, Peiran Xu, Conghao Zhou, Xiaoyue Ma, Jianing Li, Yao Zhu

机构 * UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) Sun Yat-Sen University(中山大学) Xidian University(西安电子科技大学) George Mason University(乔治·梅森大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 本文提出动态单次策略细化方法,通过减少训练样本数量和计算开销,提升大规模语言模型推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02380 2026-05-05 cs.LG 91%

EntroLLM: Entropy Encoded Weight Compression for Efficient Large Language Model Inference on Edge Devices

EntroLLM:基于熵编码的权重压缩用于边缘设备上高效的大语言模型推理

Arnab Sanyal, Gourav Datta, Prithwish Mukherjee, Sandeep P. Chinchali, Michael Orshansky

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Georgia Institute of Technology(佐治亚理工学院) Case Western Reserve University(凯斯西储大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 EntroLLM结合混合量化和熵编码技术,通过提升权重压缩率和编码效率,在边缘设备上实现高效的大语言模型推理,实验显示存储节省达30%-65%,推理速度提升31.9%-146.6%。

Comments 4 pages, 1 reference page

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10140 2026-05-01 cs.SE cs.AI cs.MA 91%

Can Large Language Models Implement Agent-Based Models? An ODD-based Replication Study

大型语言模型能否实现基于主体的模型?基于ODD的复制研究

Nuno Fachada, Daniel Fernandes, Carlos M. Fernandes, João P. Matos-Carvalho

机构 * Lusófona University(卢塞佛纳大学) INESC INOV-Lab(INESC INOV实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文评估17种LLM在ODD到代码转换任务中的表现,探讨LLM能否可靠实现基于主体的模型并支持复制、验证与验证。

Comments The peer-reviewed version of this paper is published in Ecological Modelling at https://doi.org/10.1016/j.ecolmodel.2026.111624. This version is typeset by the author and differs only in pagination and typographical detail

Journal ref Ecological Modelling, 517, 111624, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14043 2025-12-17 cs.AI 91%

Evaluating Small Language Models for Agentic On-Farm Decision Support Systems

评估小型语言模型用于农场代理决策支持系统

Enhong Liu, Haiyu Yang, Miel Hostens

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文评估了小型语言模型在乳牛养殖决策支持系统中的可行性,开发了集成多个代理的 AI 系统,并展示了 Qwen-4B 在多数任务中的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06301 2025-12-10 cs.AI 91%

Large Language Models and Their Applications in Roadway Safety and Mobility Enhancement: A Comprehensive Review

大语言模型及其在道路安全与出行提升中的应用:全面综述

Muhammad Monjurul Karim, Yan Shi, Shucheng Zhang, Bingzhang Wang, Mehrdad Nasri, Yinhai Wang

机构 * Department of Civil and Environmental Engineering, University of Washington(土木与环境工程系,华盛顿大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 本文综述了大语言模型在道路安全与出行提升中的应用,探讨其在交通领域的适应策略及面临的挑战。

Journal ref Artificial Intelligence for Transportation, 1, 100004, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26622 2025-10-31 cs.CL 91%

Encoder-Decoder or Decoder-Only? Revisiting Encoder-Decoder Large Language Model

Biao Zhang, Yong Cheng, Siamak Shakeri, Xinyi Wang, Min Ma, Orhan Firat

机构 * Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments The scaling study inspiring T5Gemma

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02153 2025-09-17 cs.AI 91%

Small Language Models are the Future of Agentic AI

Peter Belcak, Greg Heinrich, Shizhe Diao, Yonggan Fu, Xin Dong, Saurav Muralidharan, Yingyan Celine Lin, Pavlo Molchanov

机构 * NVIDIA Research(NVIDIA研究)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18989 2025-03-26 cs.LG 91%

A Novel Hat-Shaped Device-Cloud Collaborative Inference Framework for Large Language Models

Zuan Xie, Yang Xu, Hongli Xu, Yunming Liao, Zhiwei Yao

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12687 2025-03-19 cs.LG cs.DC cs.IT cs.NI eess.SP math.IT 91%

Uncertainty-Aware Hybrid Inference with On-Device Small and Remote Large Language Models

Seungeun Oh, Jinhyuk Kim, Jihong Park, Seung-Woo Ko, Tony Q. S. Quek, Seong-Lyun Kim

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments 7 pages, 6 figures; to be presented at IEEE International Conference on Machine Learning for Communication and Networking (ICMLCN) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18010 2025-02-25 eess.AS cs.CL cs.SD 91%

JPPO: Joint Power and Prompt Optimization for Accelerated Large Language Model Services

Feiran You, Hongyang Du, Kaibin Huang, Abbas Jamalipour

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06663 2025-02-13 cs.LG 91%

EfficientLLM: Scalable Pruning-Aware Pretraining for Architecture-Agnostic Edge Language Models

Xingrun Xing, Zheng Liu, Shitao Xiao, Boyan Gao, Yiming Liang, Wanpeng Zhang, Haokun Lin, Guoqi Li, Jiajun Zhang

专题命中 效率与部署 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00086 2026-08-04 cs.CV cs.AI cs.CL cs.LG 版本更新 91%

Hierarchical Pre-Training of Vision Encoders with Large Language Model

基于大语言模型的视觉编码器分层预训练

Eugene Lee, Ting-Yu Chang, Jui-Huang Tsai, Jiajie Diao, Chen-Yi Lee

机构 * University of Cincinnati(辛辛那提大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HIVE框架,通过引入视觉编码器与大语言模型间的分层交叉注意力机制,提升视觉语言对齐,改进特征融合与表征学习,实验表明其在图像分类和多模态任务中表现优异。

Comments 17 pages, 14 figures, accepted to Computer Vision and Pattern Recognition Conference (CVPR) Workshops 2026. 5th MMFM Workshop: What is Next in Multimodal Foundation Models?

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 7415-7424) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11045 2026-08-12 cs.LG cs.CL 新提交 91%

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound:用于解决无校准LLM量化中中点歧义的重构舍入法

He-Yen Hsieh, H. T. Kung

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 ReRound是一种后训练量化方法,通过条件扩散模型解决无校准LLM量化的中点歧义,在小型LLM的3、4比特量化上优于标准RTN,性能接近依赖校准方法且无额外推理开销。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23419 2026-06-23 cs.LG cs.AI 新提交 91%

GRINQH: Graded Input-based Quantization Hierarchy for Efficient LLM Generation

GRINQH:基于分级输入的量化层次结构用于高效LLM生成

Jette Oberländer, Jan Finkbeiner, Catherine M. Schöfmann, Emre Neftci

机构 * Fakultät für Informatik, RWTH Aachen(亚琛工业大学计算机科学系) Fakultät für Elektrotechnik und Informationstechnik, RWTH Aachen(亚琛工业大学电气工程与信息技术系) Peter Grünberg Institut, Forschungszentrum Jülich GmbH(于利希研究中心彼得·格林贝格研究所)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出GRINQH框架,利用激活幅度动态分配权重通道精度,统一量化与稀疏化,加速LLM解码阶段,在Llama3和Qwen3上优于现有方法,实现2位生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21312 2026-06-16 cs.DC cs.AI cs.LG 版本更新 91%

Frontier: Towards Comprehensive and Accurate LLM Inference Simulation

Frontier: 向全面且准确的LLM推理模拟迈进

Yicheng Feng, Xin Tan, Yangtao Deng, Yimin Jiang, Yibo Zhu, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) Anuttacon StepFun

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Frontier,一种用于现代LLM推理服务的离散事件模拟器,通过离散化抽象和对关键运行时优化的建模,实现了对复杂工作负载的准确预测,从而在不同服务场景中提供更精确的计算、通信和内存成本预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17255 2026-06-15 cs.LG cs.AI 版本更新 91%

UltraSketchLLM: Sub-1-Bit LLM Compression via Sketch and Hardware-Friendly Operators

UltraSketchLLM:基于草图与硬件友好算子的低于1比特LLM压缩

Sunan Zou, Xueting Sun, Ziyun Zhang, Guojie Luo

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学) School of Electronic Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学) Center for Energy-efficient Computing and Applications, Peking University(能效计算与应用中心,北京大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UltraSketchLLM,利用数据草图将LLM权重压缩至0.5比特,结合硬件友好实现,在保持可接受性能下降的同时实现14.9倍加速。

Comments Accepted by the 63rd ACM/IEEE The Chips to Systems Conference (DAC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08692 2026-06-08 cs.LG cs.CL 版本更新 91%

AAAC: Activation-Aware Adaptive Codebooks for 4-bit LLM Weight Quantization

AAAC: 面向4位LLM权重量化的激活感知自适应码本

Beshr IslamBouli, David Jin

机构 * University of Waterloo(滑铁卢大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出AAAC方法,通过每层两个小型学习码本(64字节)替代固定标量码本,以激活加权重建误差最小化选择码本,实现零额外存储开销的4位权重量化,在3-30分钟内完成量化,精度优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00888 2026-06-02 cs.LG cs.AI 91%

Memory-Efficient LLM Training with Dynamic Sparsity: From Stability to Practical Scaling

基于动态稀疏性的内存高效LLM训练:从稳定性到实际扩展

Qiao Xiao, Boqian Wu, Patrik Okanovic, Tomasz Sternal, Maurice van Keulen, Elena Mocanu, Mykola Pechenizkiy, Decebal Constantin Mocanu, Torsten Hoefler

机构 * University of Waterloo(滑铁卢大学) University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Michigan(密歇根大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SMET方法,通过优化器预热和密度感知学习率缩放解决动态稀疏训练中的优化不稳定问题,实现LLM的稳定、可扩展且内存高效的稀疏预训练。

Comments Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26175 2026-05-27 cs.LG cs.AI 91%

InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

InfoQuant:为低比特LLM量化塑造激活分布

Ke Li, Dong An, Xiaoling Zang, Can Ye, Liang Xie, Qibo Qiu, Chen Shen, Xiaofei He, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Ant Group(蚂蚁集团) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院) Alibaba Cloud Computing(阿里云计算) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对低比特激活量化中分布与量化器不匹配的问题,提出基于信息论的分析和无需训练的峰值抑制正交变换(PSOT)方法,显著提升量化精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25984 2026-05-26 cs.CL cs.AI 91%

SafeCtrl-RL: Inference-Time Adaptive Behaviour Control for LLM Dialogue via RL-Driven Prompt Optimisation

SafeCtrl-RL: 通过RL驱动的提示优化的LLM对话推理时自适应行为控制

Michael Orme, Yanchao Yu, Zhiyuan Tan

机构 * School of Computing, Engineering and Building Environment(计算、工程与建筑环境学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeCtrl-RL框架,利用强化学习在推理时动态选择提示调整策略,无需重新训练即可抑制不安全行为,提升LLM对话的安全性和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23938 2026-05-26 cs.AI cs.CY cs.LG 91%

Authority Inversion in LLM-Mediated Ubiquitous Systems: When Models Trust Users Over Sensors

LLM介导的普适系统中的权威倒置:当模型信任用户胜过传感器

Long Zhang, Zi-bo Qin, Wei-neng Chen

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computer Science(计算机科学学院) Engineering, South China University of Technology(华南理工大学工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究揭示了大语言模型在融合传感器与用户冲突信息时,由于格式依赖性导致数值传感器数据被自然语言用户主张支配的权威倒置现象,并提出了几何框架、审计指标(CIR和AAI)以及推理时层干预方法(GAC)来诊断和缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21558 2026-05-22 cs.LG cs.CL 91%

From Parameters to Data: A Task-Parameter-Guided Fine-Tuning Pipeline for Efficient LLM Alignment

从参数到数据:一种任务参数引导的微调流水线用于高效的LLM对齐

Hao Chen, Qi Zhang, Liyao Li, Zhanming Shen, Wentao Ye, Lirong Gao, Ningtao Wang, Xing Fu, Xiaoyu Shen, Junbo Zhao

机构 * Zhejiang University(浙江大学) Eastern Institute of Technology(东部技术研究所)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出了一种任务参数引导的微调流水线,通过任务敏感的注意力头作为双指南,实现样本挖掘和结构剪枝,从而提高LLM对齐的效率。

Comments Accepted@ICML26, 28 pages, 11 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20706 2026-05-21 cs.DC cs.AI cs.LG 91%

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

网络上的Llamas:基于WebGPU的内存高效、性能可移植和多精度LLM推理

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

机构 * Microsoft Research(微软研究院) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LlamaWeb,一种基于WebGPU的LLM推理框架,通过静态内存规划和高效模型加载减少内存开销,支持多种模型权重格式,实现了内存高效、性能可移植的LLM推理。

Comments 19 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14444 2026-05-21 cs.LG cs.AI 91%

A Free Lunch in LLM Compression: Revisiting Retraining after Pruning

在LLM压缩中寻找免费午餐:重新审视剪枝后的重新训练

Moritz Wagner, Christophe Roux, Max Zimmer, Sebastian Pokutta

机构 * Department for AI in Society, Science, and Technology, Zuse Institute Berlin(人工智能社会、科学与技术系,柏林Zuse研究所) Institute of Mathematics, Technische Universität Berlin(数学系,柏林技术大学)

专题命中 效率与部署 :LLM(title,title_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在剪枝后通过局部重建进行适应的方法,发现其在减少数据和计算成本的同时能有效提升模型性能,并揭示了在不同粒度下重建参数窗口对最终质量的影响,挑战了LLM剪枝后适应不可行的主流观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16360 2026-05-19 cs.LG cs.AI 91%

ProxyKV: Cross-Model Proxy Pruning for Efficient Long-Context LLM Inference

ProxyKV:跨模型代理剪枝用于高效长上下文LLM推理

Junjie Li, Jiong Lou, Jie Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ProxyKV通过跨模型代理剪枝方法,解决LLM长上下文推理中的KV缓存内存瓶颈,实现高效推理与高精度的平衡,提升预填充速度和长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11186 2026-05-13 cs.LG cs.AI 91%

CATS: Cascaded Adaptive Tree Speculation for Memory-Limited LLM Inference Acceleration

CATS:基于内存限制的LLM推理加速的级联自适应树推测

Yuning Han, Yangchenchen Jin, Dylan Zhao, Jingwei Sun

机构 * University of Florida(佛罗里达大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CATS通过级联验证和修正机制,在内存受限设备中优化LLM推理,提升吞吐量并保持内存足迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24013 2026-05-11 cs.LG cs.AI cs.CV cs.DC 91%

CommFuse: Hiding Tail Latency via Communication Decomposition and Fusion for Distributed LLM Training

CommFuse:通过通信分解与融合隐藏尾部延迟以分布式LLM训练

Rezaul Karim, Austin Wen, Wang Zongzuo, Weiwei Zhang, Yang Liu, Walid Ahmed

机构 * Huawei(华为)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CommFuse方法,通过分解与融合通信操作,有效缓解分布式LLM训练中的通信瓶颈,降低延迟并提升模型利用率。

Comments Slightly modified the title, and corresponding minor wording change in the content

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13010 2026-05-11 cs.LG cs.AI 91%

Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation

Lightning OPD: 为大推理模型高效实现离线在线蒸馏

Yecheng Wu, Song Han, Hai Cai

机构 * NVIDIA

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出Lightning OPD,通过强制教师一致性消除对实时教师服务器的需求,实现高效离线在线蒸馏,实验表明其在数学推理和代码生成任务中性能与传统OPD相当,训练效率提升4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏