arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2205.11005 2022-05-24 cs.AI 86%

Parameter-Efficient Sparsity for Large Language Models Fine-Tuning

Yuchao Li, Fuli Luo, Chuanqi Tan, Mengdi Wang, Songfang Huang, Shen Li, Junjie Bai

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.AI

Comments This paper is published in IJCAI 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.08181 2021-08-04 cs.CL 86%

Direction is what you need: Improving Word Embedding Compression in Large Language Models

Klaudia Bałazy, Mohammadreza Banaei, Rémi Lebret, Jacek Tabor, Karl Aberer

专题命中 效率与部署 :language model(title,abstract);large language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20973 2026-08-21 eess.AS cs.AI cs.CL 版本更新 86%

Towards Audio Token Compression in Large Audio Language Models

向大型音频语言模型中的音频标记压缩迈进

Saurabhchand Bhati, Samuel Thomas, Hilde Kuehne, Rogerio Feris, James Glass

机构 * MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出通过无监督分割和低秩适配器技术,压缩音频标记以提升大型音频语言模型在资源受限平台上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03057 2026-08-18 cs.LG cs.AI 版本更新 86%

LACE-SVD: Loss-Aware SVD with Cumulative Error Correction for LLM Compression

LACE-SVD:用于大语言模型压缩的带累积误差校正的损失感知奇异值分解

Zhuowen Liu, Longkun Hao, Shiyu Feng, Xiaowen Chang, Ruiqun Li, Changqun Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型参数规模增长需求,提出LACE-SVD框架,先依候选压缩率估算损失增加量分配秩预算,再用局部更新和误差校正优化模型,降低累积误差传播,效果优于现有方法。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23815 2026-08-17 cs.DB cs.AI cs.CL 版本更新 86%

Kalypso: Relational LLM Serving

卡利普索:关系型大语言模型服务

Hojae Son, Md Ashraful Islam, Huy Gia Cao, Hui Guan, Marco Serafini

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何提升大语言模型服务语义查询效率,提出关系型大语言模型服务,通过跨语义运算符流水线执行复用KV缓存状态,卡利普索系统利用自适应算法执行查询计划,解决在线调度问题,相比基线系统大幅提高查询完成时间。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07952 2026-08-11 cs.LG cs.AI cs.CR cs.SE 新提交 86%

Persistent Semantic Entities in Tool-Augmented LLM Systems

工具增强型大语言模型系统中的持久语义实体

Zhaohui Wang

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 该研究定义工具增强型LLM系统的持久语义实体(PSEs),证实其在24款不同规模模型中普遍存在,偏好/指令污染难自校正,上下文隔离自验证可降低污染,为智能体系统安全提供关键发现。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version; 32 pages . The openreview url is https://openreview.net/forum?id=zPjmtawzT8&noteId=CXB95ws5so and ICML poster url is https://icml.cc/virtual/2026/poster/60521

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18867 2026-08-11 cs.LG cs.CL 版本更新 86%

HindsightBench: A Black-Box Behavioral Audit Protocol for Parametric Hindsight in Time-Indexed LLM Decision Tasks

HindsightBench:用于时间索引语言模型决策任务中参数后见之明的黑盒行为审计协议

Haozhe Jia

机构 * University College Dublin(都柏林大学学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型在金融决策任务中泄露参数知识的问题,提出HindsightBench黑盒行为审计协议,通过特定矩阵、探测及指标分析参数后见之明,应用于多模型获三个主要模式,揭示模型特性及审计结果与服务的关系,还发布相关数据。

Comments 17 pages, 3 figures. Code, panel, and per-model audit rows: https://github.com/Khaozhe/hindsightbench (v1.0 release archived at doi:10.5281/zenodo.21453191)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01928 2026-08-06 cs.CL cs.LG 版本更新 86%

Esoteric Language Models: A Family of Any-Order Diffusion LLMs

深奥语言模型:一类任意阶扩散LLM

Subham Sekhar Sahoo, Zhihan Yang, Yash Akhauri, Johnna Liu, Deepansha Singh, Zhoujun Cheng, Zhengzhong Liu, Eric Xing, John Thickstun, Arash Vahdat

机构 * Cornell University(康奈尔大学) NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);LLM(title_cn);分类 cs.CL、cs.LG

AI总结 提出Eso-LMs模型,融合自回归与掩码扩散范式,通过因果注意力实现精确似然计算和KV缓存,在速度-质量帕累托前沿上达到新最优。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09176 2026-08-05 cs.LG cs.AI math.OC 交叉投稿 86%

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

在大语言模型谷中导航:从AdamW到内存高效和矩阵优化器

Aditya Ranganath

机构 * Center for Applied Scientific Computing(应用科学计算中心)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文探讨了大语言模型优化器的发展,从传统方法到内存高效和矩阵优化器,强调了在大规模训练中优化器的统计有效性、计算和内存效率。

Comments No figures, 65 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24192 2026-07-30 cs.IT cs.CL cs.LG math.IT 版本更新 86%

LLM-based Source Code Compression via Thresholded Symbol Ranking

基于阈值符号排序的基于大语言模型的源代码压缩

Angelo Nardone, Paolo Ferragina

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究基于大语言模型的源代码无损压缩问题,提出两种阈值符号排序变体,将预测限制在前\(T\)个排名,通过通用压缩器联合压缩阈值外符号。实验表明该方法在压缩率和吞吐量上优于此前方法,在压缩速度频谱中提供新权衡点。

Comments This is the version of the paper submitted and then accepted for presentation at the 24th International Conference of the Italian Association for Artificial Intelligence (AIxIA 2026), Perugia, Italy, 6--9 October 2026. The paper will appear in the proceedings, published by Springer Verlag in the Lecture Notes in Artificial Intelligence (LNAI) series

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20507 2026-07-24 cs.AI cs.LG 新提交 86%

MiniCache: Reusable Program Caching with Small Model Interfaces for Efficient LLM Inference

MiniCache:用于高效大语言模型推理的具有小模型接口的可重复使用程序缓存

Jingquan Chen, Jinghua Piao, Jie Feng, Shaogang Hu, Yong Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理成本高的问题,提出MiniCache框架,将PoT程序转换为参数化缓存对象,通过重用小模型进行语义变量提取和推测性起草,减少目标大语言模型调用,实验证明其能提升推理性能,平衡延迟、缓存重用和准确性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14575 2026-07-23 cs.LG cs.AI stat.ME stat.ML 版本更新 86%

Generative Augmented Inference of LLM-generated Data for Market Research: Theory and Empirical Evidence

生成式增强推断

Cheng Lu, Mengxin Wang, Dennis J. Zhang, Heng Zhang

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出生成式增强推断(GAI)框架,将AI输出视为学习真实标签的高维信息特征而非代理,通过非参数方法建模,实现人机数据联合的一致估计和有效推断,在随机标注下渐近效率严格优于仅用人类数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18604 2026-07-22 cs.RO cs.AI cs.LG cs.NI cs.SY eess.SY 新提交 86%

Intelligent Multi-UAV Navigation in ITNTNs: A Hierarchical LLM Approach

智能多无人机在综合陆地与非陆地网络中的导航:一种分层大语言模型方法

Zijiang Yan, Hao Zhou, Wael Jaafar, Jianhua Pei, Ping Wang, Halim Yanikomeroglu, Hina Tabassum

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对高速无人机在三维空中高速公路部署中面临的协调问题,提出分层大语言模型驱动控制框架,利用云端大语言模型管理全局负载平衡,边缘大语言模型转化局部观测为子目标,引导深度强化学习控制器执行轨迹,降低碰撞率并提高系统吞吐量。

Comments This paper has been accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16241 2026-07-21 cs.LG cs.AI 新提交 86%

KernelBench-Verified: Do LLM-Generated Kernels Actually Beat PyTorch?

KernelBench验证:大语言模型生成的内核真的能超越PyTorch吗?

Yunxiang Zhang, Ping Yu, Jianyu Wang, Max, Fan, Julian Reed, Azalia Mirhoseini, Will Su

机构 * Meta FAIR at Meta SuperIntelligence Lab(元超智能实验室公平团队) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型生成的内核是否真能超越PyTorch,指出前沿模型存在奖励黑客行为。引入KernelBench-Verified扩展评估框架及内存效率指标,实验发现最佳模型加速比低,无模型始终超PyTorch,部分模型增加GPU内存峰值使用,强调持续调整评估协议的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16496 2026-07-16 eess.SY cs.AI cs.LG cs.SY 86%

Synergies between Federated Foundation Models and Smart Power Grids

联邦基础模型与智能电力电网的协同作用

Seyyedali Hosseinalipour, Shimiao Li, Adedoyin Inaolaji, Filippo Malandra, Luis Herrera, Nicholas Mastronarde

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出联邦基础模型与智能电网的协同方法,通过双向视角探讨M3T FedFMs在电网功能增强和模型设计优化中的应用。

Journal ref IEEE Electrification Magazine, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10183 2026-07-15 cs.DC cs.AI cs.LG 版本更新 86%

Automated Tensor Scheduling for Hybrid CPU-GPU LLM Inference on Consumer Devices

用于消费级设备上混合CPU - GPU大语言模型推理的自动张量调度

Yangyijian Liu, Hongyi Ye, Mingyang Li, Wu-jun Li

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究在消费级设备运行大语言模型时因模型权重超GPU内存需卸载推理的问题,提出ATSInfer系统,通过结合静态张量放置与负载感知动态传输及异步协调,在代表性平台评估,相比现有系统显著提升吞吐量、利用率等,改善本地大语言模型部署体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10582 2026-07-14 cs.LG cs.AI 新提交 86%

MemDecay: Region-Aware KV Cache Eviction for Efficient LLM Agent Inference

MemDecay:用于高效大语言模型智能体推理的区域感知键值缓存逐出策略

Venkatesha Matam, Keon Kim

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体KV缓存内存瓶颈问题,提出无需训练的区域感知逐出策略MemDecay,为令牌分配特定区域优先级和衰减率,经实验验证该策略能有效管理缓存,确立语义提示结构对KV缓存管理的作用并明确其与关注重要性的结合方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09015 2026-07-13 cs.LG cs.AI 新提交 86%

Correlation-Aware Contextual Bandits with Surrogate Rewards for LLM Routing

用于大语言模型路由的具有替代奖励的相关感知上下文博弈

Ajay Narayanan Sridhar, Ronak Singh, Mehrdad Mahdavi, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究用于大语言模型路由的相关感知上下文博弈问题,提出耦合奖励混合与解耦预测混合两种利用替代奖励的算法,经理论分析和实验评估,相比基线方法提高了样本效率和精度 - 成本权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08010 2026-07-10 cs.CL cs.LG cs.SE 新提交 86%

Tool-Making and Self-Evolving LLM Agents in Low-Latency Systems

低延迟系统中的工具制作与自我进化大语言模型智能体

Kalle Kujanpää, Ning Liu, Shahnawaz Alam, Yeshwanth Reddy Sura, Tianyu Yang, Kristina Klinkner, Shervin Malmasi

机构 * Amazon(亚马逊)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 研究如何解决生产LLM智能体因重复生成代码浪费延迟和可靠性的问题,提出用智能工具制作管道取代推理时编码循环,部署该方法使系统更快、更可靠、易操作,降低延迟和错误率,提高可审计性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04428 2026-07-07 cs.CL cs.AI 新提交 86%

dOPSD: On-Policy Self-Distillation for Diffusion Language Models

dOPSD:扩散语言模型的策略内自蒸馏

Phuong Tuan Dat, Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究扩散语言模型强化推理难的问题,提出dOPSD,通过从学生去噪轨迹直接推导教师特权信息,实现策略内自蒸馏,提升模型在数学推理和代码生成等任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01237 2026-07-07 cs.CL cs.AI 新提交 86%

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

Kara: 通过滑动窗口KV缓存压缩实现高效推理LLM服务

Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对推理语言模型长思维链导致KV缓存过大、解码延迟高的问题,提出Kara滑动窗口KV缓存压缩方法,利用双向注意力评分选择信息性KV对并通过Token2Chunk模块扩展为块,结合PagedAttention构建KvLLM推理框架,降低内存占用并提升输出吞吐量。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21952 2026-07-07 cs.LG cs.AI cs.AR cs.NE cs.RO 86%

Focus Session: Hardware and Software Techniques for Accelerating Multimodal Foundation Models

聚焦会议:加速多模态基础模型的硬件和软件技术

Muhammad Shafique, Abdul Basit, Muhammad Abdullah Hanif, Alberto Marchisio, Rachmad Vidya Wicaksana Putra, Minghao Shao

机构 * eBRAIN Lab, New York University (NYU) Abu Dhabi(eBRAIN实验室,纽约大学(NYU)阿布扎比)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种多层方法,通过硬件和软件协同设计和优化流程,提升多模态基础模型的效率。方法包括混合精度量化、结构剪枝、推测解码等技术,结合硬件加速器优化计算和内存需求,验证了在医疗和代码生成任务中的有效性。

Comments Accepted at the Design, Automation and Test in Europe Conference (DATE), April 20-22, 2026 in Verona, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06133 2026-06-30 math.OC cs.AI cs.LG 86%

LLM Serving Optimization with Variable Prefill and Decode Lengths

具有可变预填和解码长度的LLM服务优化

Meixuan Wang, Yinyu Ye, Zijie Zhou

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Industrial Engineering and Decision Analytics, HKUST(香港科技大学工业工程与决策分析系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究在固定KV缓存内存预算下,异构提示和响应长度的离线调度问题,提出Sorted-F算法以平衡批次大小与下游解码成本,实现常数因子近似保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14851 2026-06-30 cs.DC cs.AI cs.LG 86%

Efficient Serving of LLM Applications with Probabilistic Demand Modeling

通过概率需求建模实现LLM应用的高效服务

Yifei Liu, Zuo Gan, Zhenghao Gan, Weiye Wang, Chen Chen, Yizhou Shan, Xusheng Chen, Zhenhua Han, Yifei Zhu, Shixuan Sun, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Cloud(华为云) Unaffiliated(无隶属机构)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hermes系统,利用概率需求图建模LLM应用资源需求,采用Gittins策略优化调度顺序,预热冷后台,提升服务效率,减少平均完成时间70%以上,P95完成时间80%以上。

Journal ref ACM Transactions on Architecture and Code Optimization 23, 2, Article (June 2026), 1-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21847 2026-06-23 cs.LG cs.AI 新提交 86%

UniRank: Unified Rank Allocation for Low-Rank LLM Compression

UniRank: 面向低秩大语言模型压缩的统一秩分配方法

Chao Han, Haozhe Hu, Fei Ma, Wei Zhang, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工大学(宁波)) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出UniRank方法,将全局低秩分配转化为排序截断流程,通过局部奇异能量比和全局功能重要性双准则评分各奇异分量,并引入秩保持微调避免信息损失,在一次性压缩中困惑度降低高达50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19534 2026-06-19 cs.CV cs.AI cs.CL 新提交 86%

PerceptionDLM: Parallel Region Perception with Multimodal Diffusion Language Models

PerceptionDLM:基于多模态扩散语言模型的并行区域感知

Yueyi Sun, Yuhao Wang, Jason Li, Ye Tian, Tao Zhang, Jacky Mai, Yihan Wang, Haochen Wang, Jinbin Bai, Ling Yang, Yunhai Tong

机构 * Peking University(北京大学) MSALab ByteDance(字节跳动)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出PerceptionDLM,利用扩散语言模型的并行解码特性,通过高效提示和结构化注意力掩码实现多区域并行感知,显著提升推理效率,并构建ParaDLC-Bench基准进行评估。

Comments Code available at https://github.com/MSALab-PKU/PerceptionDLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13054 2026-06-15 cs.LG cs.AI 新提交 86%

TWLA: Achieving Ternary Weights and Low-Bit Activations for LLMs via Post-Training Quantization

TWLA:通过训练后量化实现大语言模型的三值权重和低位激活

Zhixiong Zhao, Zukang Xu, Zhixuan Chen, Xing Hu, Zhe Jiang, Dawei Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出TWLA框架,通过后训练量化实现1.58位权重和4位激活,解决激活分布长尾问题,加速推理。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06485 2026-06-11 cs.CL cs.AI 版本更新 86%

Litespark Inference For CPUs: Ultra-Fast SIMD Framework for Ternary (1.58-bit) Language Models

Litespark Inference For CPUs: 三元(1.58位)语言模型的超快SIMD框架

Nii Osae Osae Dade, Tony Morri, Moinul Hossain Rahat, Sayandip Pal, Rickston Pinto

机构 * Mindbeam AI

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对三元语言模型权重为{-1,0,1}的特点,提出自定义SIMD内核,用加减运算替代矩阵乘法,在CPU上实现18-96倍加速和6倍内存减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06712 2026-06-08 cs.CL cs.AI 新提交 86%

Data-Efficient Autoregressive-to-Diffusion Language Models via On-Policy Distillation

数据高效的自回归到扩散语言模型通过策略内蒸馏

Xingyu Su, Jacob Helwig, Shubham Parashar, Atharv Chagi, Lakshmi Jotsna, Degui Zhi, James Caverlee, Dileep Kalathil, Shuiwang Ji

机构 * Department of Computer Science and Engineering, Texas A&M University(德克萨斯大学阿马尔科分校计算机科学与工程系) Department of Bioinformatics and Systems Medicine, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校生物信息学与系统医学系) Department of Electrical and Computer Engineering, Texas A&M University(德克萨斯大学阿马尔科分校电气与计算机工程系)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出策略内扩散语言模型(OPDLM),通过策略内蒸馏将自回归模型转换为扩散语言模型,解决分布偏移和训练-推理不匹配问题,实现15倍至7000倍更少训练数据下的强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04703 2026-06-04 cs.CL cs.LG 86%

Rethinking Continual Experience Internalization for Self-Evolving LLM Agents

重新思考持续经验内化以实现自我进化的大语言模型智能体

Jingwen Chen, Wenkai Yang, Shengda Fan, Wenbo Nie, Chenxing Sun, Shaodong Zheng, Yangen Hu, Lu Pan, Ke Zeng, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) School of Software, Beihang University(北航软件学院) Meituan(美团)

专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过经验粒度、注入模式和内化机制三个维度,提出一种稳定可持续的经验内化方法,解决多轮经验学习中的能力崩溃问题。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏