arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22405 篇

2607.03089 2026-07-07 cs.LG cs.AI 新提交 84%

STELLA: Efficient Sensor-to-LLM Translation for On-Device Human Activity Recognition

STELLA:用于设备端人类活动识别的高效传感器到语言模型翻译

Nirhoshan Sivaroopan, Albert Zomaya, Kanchana Thilakarathna

机构 * The University of Sydney(悉尼大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究设备端人类活动识别难题,提出STELLA框架,通过轻量级分层分词器压缩传感器数据,投影到预训练语言模型嵌入空间,结合自然语言提示打分,支持设备端个性化,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03948 2026-07-07 cs.AI cs.LG math.OC 新提交 84%

Online Linear Programming for Multi-Objective Routing in LLM Serving

大语言模型服务中多目标路由的在线线性规划

Zixi Chen, Yinyu Ye, Zijie Zhou

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型服务在线路由问题,引入多目标优化框架将路由设为在线线性规划,应用高效出价控制策略,开发热启动投影一阶更新,集成路由器到模拟器,结果表明基于科学方法优于启发式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12262 2026-07-07 cs.CL cs.LG 版本更新 84%

Few-Step Diffusion Language Models via Trajectory Self-Distillation

通过轨迹自蒸馏实现少步扩散语言模型

Tunyu Zhang, Xinxi Zhang, Ligong Han, Haizhou Shi, Xiaoxiao He, Zhuowei Li, Hao Wang, Kai Xu, Akash Srivastava, Chengzhi Mao, Hao Wang, Vladimir Pavlovic, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过轨迹自蒸馏框架训练少步学生模型,以匹配全步教师的生成轨迹,从而减少解码步骤带来的输出质量下降,并结合DDO提升推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29215 2026-07-01 cs.LG cs.CL 版本更新 84%

Multi-Block Diffusion Language Models

多块扩散语言模型

Yijie Jin, Jiajun Xu, Yuxuan Liu, Chenkai Xu, Yi Tu, Jiajun Li, Dandan Tu, Xiaohui Yan, Kai Yu, Pengfei Liu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Xi’an Jiao Tong University(西安交通大学) Huawei(华为)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出多块教师强制(MultiTF)训练策略,将单块扩散语言模型扩展为多块扩散(MultiBD),通过块缓冲机制实现并行解码,提升令牌吞吐量和准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27732 2026-06-29 cs.IR cs.AI cs.LG 新提交 84%

Bifocal Diffusion Language Models: Asymmetric Bidirectional Context for Parallel Generation

双焦扩散语言模型:用于并行生成的非对称双向上下文

Yuhang Chen, Xianfeng Wu, Jinhao Duan, Mingfu Liang, Xiaohan Wei, Yunchen Pu, Fei Tian, Chonglin Sun, Parish Aggarwal, Frank Shyu, Luke Simon, Sandeep Pandey, Xi Liu, Tianlong Chen

机构 * Meta AI University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出双焦扩散语言模型R2LM,通过非对称双向上下文(因果注意力+反向Mamba)解决双向注意力与KV缓存不兼容问题,实现并行生成中2.4-12.9倍吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27627 2026-06-29 cs.LG cs.AI 新提交 84%

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec:为高效语音语言模型建模离散和连续表示

Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

机构 * Mila, Quebec AI Institute(Mila-魁北克人工智能研究所) Concordia University(康考迪亚大学) Sapienza University of Rome(罗马大学) Inria, Université Grenoble Alpes CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学国家科学研究中心,让·库尔曼实验室)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出HybridCodec,结合时间压缩离散令牌与降维连续残差,通过混合离散-连续焦点调制编解码器和混合Transformer,在离散域自回归推理并辅以非自回归预测和连续残差上采样,相比纯离散方法显著提升说话人特征保留并减少自回归步数。

Comments Accepted

Journal ref InterSpeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27550 2026-06-29 cs.CL cs.LG 新提交 84%

EntMTP: Accelerating LLM Inference with Entropy Guided Multi Token Prediction

EntMTP:基于熵引导的多令牌预测加速LLM推理

Carrie Chen

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EntMTP,一种无需训练的动态树注意力拓扑调度器,根据局部生成熵调整推测深度,在保持生成质量的同时最大化接受令牌吞吐量,相比Hydra和Medusa分别实现1.15倍和1.36倍加速。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26120 2026-06-26 cs.CL cs.LG 新提交 84%

Dynamic-dLLM: Dynamic Cache-Budget and Adaptive Parallel Decoding for Training-Free Acceleration of Diffusion LLM

Dynamic-dLLM: 动态缓存预算与自适应并行解码实现扩散大语言模型的无训练加速

Tianyi Wu, Xiaoxi Sun, Yanhua Jiao, Yulin Li, Yixin Chen, YunHao Cao, YiQi Hu, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Huawei(华为) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对扩散大语言模型计算复杂度随序列长度立方增长的问题,提出Dynamic-dLLM框架,通过动态缓存更新和自适应并行解码,在不训练的情况下实现3倍以上加速并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23104 2026-06-23 cs.LG cs.AI 新提交 84%

ReNIO: Reweighting Negative Trajectory Importance for LLM On-Policy Distillation

ReNIO: 为大语言模型在线策略蒸馏重加权负轨迹重要性

Chen Lin, Kedi Chen, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ReNIO方法,通过学生-教师概率比识别错误推理轨迹中的关键令牌并加权,在不依赖最终答案正确性的情况下提升在线策略蒸馏效果,在数学推理和代码生成任务上取得显著提升。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20670 2026-06-23 cs.LG cs.AI cs.IT math.IT 新提交 84%

Towards CSI-Native Foundation Models: A Channel-Adaptive Roadmap for 6G

面向CSI原生的基础模型:6G的信道自适应路线图

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(北京邮电大学移动网络技术国家工程研究中心) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(中央民族大学教育部民族语言智能分析与安全治理重点实验室) China Telecom Corporation Limited Gansu Branch(中国电信股份有限公司甘肃分公司)

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出信道自适应路线图,通过统一预训练、位置建模和注意力控制与信道需求对齐,实现CSI原生基础模型,在零样本泛化、尺度外推和推理效率上显著优于现有方法。

Comments 7 pages, 5 figures, submmited to IEEE WCM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19475 2026-06-23 cs.AI cs.CL 新提交 84%

Diffusion Language Models: An Experimental Analysis

扩散语言模型:一项实验分析

Thomas Bertolani, Davide Bucciarelli, Leonardo Zini, Marcella Cornia, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统比较了八种扩散语言模型在推理、编码、翻译等任务上的表现,分析了去噪步数、上下文长度等推理因素对性能与效率的影响,揭示了扩散语言模型在不同任务和预算下的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19558 2026-06-19 cs.LG cs.CL 新提交 84%

Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

位移不是方向:评估量化LLM部署的保真度指标

Miloš Nikolić, Ali Hadi Zadeh, Enrique Torres Sanchez, Andreas Moshovos

机构 * ByteShape University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文研究KL散度等保真度指标在量化语言模型部署中与下游基准分数的相关性,发现整体强相关但在近基线区域失效,归因于KL散度主要衡量分歧量而非方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14035 2026-06-19 cs.LG cs.AI 版本更新 84%

Wisdom of Committee: Diverse Distillation from Large Foundation Models and Domain Experts

委员会智慧:来自大型基础模型和领域专家的多样化蒸馏

Zichang Liu, Qingyun Liu, Yuening Li, Liang Liu, Anshumali Shrivastava, Shuchao Bi, Lichan Hong, Ed H. Chi, Zhe Zhao

机构 * Rice University(Rice大学) Google DeepMind(谷歌DeepMind) Google Inc(谷歌公司) University of California, Davis(加州大学戴维斯分校)

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对基础模型向紧凑领域模型蒸馏时能力、架构和模态差异大的问题,提出DiverseDistill框架,通过可学习的问答机制和对齐异构教师输出,在推荐和视觉任务上恢复73-114%的性能差距。

Comments Accepted at the 1st Workshop on Resource-Efficient Learning and Knowledge Discovery (RelKD), KDD 2026

Journal ref Proceedings of the International Workshop on Resource-Efficient Learning and Knowledge Discovery (RelKD), KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18271 2026-06-18 cs.AI cs.LG 新提交 84%

NAVI-Orbital: First In-Orbit Demonstration of a Zero-Shot Vision-Language Model for Autonomous Earth Observation

NAVI-Orbital:用于自主地球观测的零样本视觉语言模型的首次在轨演示

Juan Manuel Delfa Victoria, Taran Cyriac John, Andrew W. Herson

机构 * NASA Jet Propulsion Laboratory (JPL)(美国宇航局喷气推进实验室) Loft Orbital(Loft Orbital公司)

专题命中 效率与部署 :language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文介绍NAVI-Orbital系统,在低地球轨道卫星上首次实现视觉语言模型的自主多模态推理,通过语义压缩解决数据下传瓶颈。

Comments 17 pages, 47 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10239 2026-06-18 cs.LG cs.AI 版本更新 84%

Efficient Zeroth-Order Federated Finetuning of Language Models on Resource-Constrained Devices

资源受限设备上语言模型的高效零阶联邦微调

Mohamed Aboelenien Ahmed, Kilian Pfeiffer, Ramin Khalili, Heba Khdr, Jörg Henkel

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Huawei(华为) Heisenberg Research Center (Munich), Germany(海森堡研究中心(慕尼黑),德国)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于零阶优化的联邦微调方法,通过分块模型并分配更多扰动到后一块,复用中间激活减少前向评估次数,在保持内存和通信优势的同时将计算量降低至其他零阶方法的1/3。

Comments Published at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06154 2026-06-17 cs.LG cs.CL 版本更新 84%

MoSE: Mixture of Slimmable Experts for Efficient and Adaptive Language Models

MoSE: 混合可瘦身专家实现高效自适应语言模型

Nurbek Tastan, Stefanos Laskaridis, Karthik Nandakumar, Samuel Horvath

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed bin Zayed人工智能大学(MBZUAI)) Michigan State University (MSU), USA(密歇根州立大学(MSU)) Amazon Science, UK(亚马逊科学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MoSE架构,每个专家具有可变宽度的嵌套结构,支持在推理时连续调节精度-计算权衡,通过多宽度训练和轻量级测试时训练实现高效自适应。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16496 2026-06-16 cs.CL cs.LG 新提交 84%

REFLEX: Reflective Evolution from LLM Experience

REFLEX: 基于大语言模型经验的反思进化

Pan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出REFLEX框架,通过解耦视觉诊断与代码生成实现可审计的高效策略进化,在控制任务和天线阵列合成中展现优异样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11320 2026-06-16 cs.LG cs.AI cs.DC math.OC stat.ML 版本更新 84%

Optimizing LLM Inference: Fluid-Guided Online Scheduling with Memory Constraints

优化大语言模型推理:带有内存约束的流引导在线调度

Ruicheng Ao, Gan Luo, David Simchi-Levi, Xinshang Wang

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出流引导在线调度方法,通过等待阈值算法和嵌套等待算法,在内存约束下优化大语言模型推理的延迟和容量,减少过载时的延迟。

Comments 79 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12841 2026-06-12 cs.LG cs.AI 新提交 84%

TimeROME-DLM: Temporal Causal Tracing and Low-Rank Inference-Time Knowledge Editing for Masked Diffusion Language Models

TimeROME-DLM:掩码扩散语言模型的时间因果追踪与低秩推理时知识编辑

Zhengtao Yao, Liuyang Song, Hongbo Zhang, Chenhao Wei, Haoyan Xu, Guang Yang, Siheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出TimeROME-DLM,首个无需训练和梯度的推理时知识编辑框架,通过时间因果追踪定位关键坐标并应用低秩残差编辑,在保持模型性能的同时高效删除事实。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07618 2026-06-09 cs.LG cs.AI cs.CV 新提交 84%

ScaleSweep: Accurate NVFP4 Post-Training Quantization of LLMs via Block Scale Initialization

ScaleSweep: 通过块尺度初始化实现LLM的精确NVFP4训练后量化

Li Lin, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 效率与部署 :post-training(title);LLM(title_cn);分类 cs.AI、cs.LG

AI总结 提出ScaleSweep方法,通过扫描可行块尺度候选并选择最小化目标函数的候选,优化NVFP4量化中的尺度初始化,理论推导扫描范围边界,在Llama和Qwen模型上提升量化性能,缩小与全精度的差距。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26099 2026-06-08 cs.CL cs.AI 版本更新 84%

Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference

语言模型需要睡眠吗?用于改进在线推理的离线循环

Sangyun Lee, Sean McLeish, Tom Goldstein, Giulia Fanti

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种类似睡眠的巩固机制,通过离线循环将上下文转换为快速权重,以解决Transformer注意力机制随上下文长度扩展性差的问题,并在合成任务和数学推理任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08564 2026-06-04 cs.CL cs.LG 84%

Attention-Based Sampler for Diffusion Language Models

基于注意力的扩散语言模型采样器

Yuyan Zhou, Kai Syun Hou, Weiyu Chen, James Kwok

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 针对扩散语言模型采样中忽略全局序列结构的问题,提出基于注意力矩阵列和的采样顺序优化方法,实现无训练的高质量并行采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.02110 2026-06-02 cs.CL cs.LG 84%

GottBERT: a pure German Language Model

GottBERT: 一个纯德语语言模型

Raphael Scheible, Johann Frei, Fabian Thomczyk, Henry He, Patric Tippmann, Jochen Knaus, Victor Jaravine, Frank Kramer, Martin Boeker

机构 * Institute for AI and Informatics in Medicine, University Hospital rechts der Isar, Technical University Munich(慕尼黑技术大学医学人工智能与信息学研究所,莱茵河右岸大学医院) IT-Infrastructure for Translational Medical Research, Faculty of Applied Computer Science, University of Augsburg(奥格斯堡大学应用计算机科学学院医学转化研究IT基础设施) Data Integration Center, Faculty of Medicine, University of Freiburg(弗赖堡大学医学学院数据整合中心) School of Computation, Information and Technology, Technical University Munich(慕尼黑技术大学计算、信息与技术学院) Institute of Medical Biometry and Statistics, Medical Center, Faculty of Medicine, University of Freiburg(弗赖堡大学医学学院医学生物统计学研究所) Freiburg Center for Data Analysis and Modeling, University of Freiburg(弗赖堡大学数据分析与建模中心) Hengrui Europe Biosciences, Zurich(苏黎世亨格里欧生物科学公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出了首个德语单语言RoBERTa模型GottBERT,在OSCAR德语子集上预训练,并在NER和文本分类任务上展示了竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30859 2026-06-01 cs.LG cs.AI 84%

DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning

DARTS: 分布感知的主动展开轨迹塑造以加速LLM强化学习

Yujie Wang, Siwei Chen, Longzan Luo, Xinyi Liu, Xupeng Miao, Fangcheng Fu, Bin Cui

机构 * School of Computer Science \& Beijing Key Laboratory of Software Hardware Cooperative Artificial Intelligence Systems, Peking University, Beijing, China School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China Institute of Computational Social Science, Peking University (Qingdao), Qingdao, China

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 针对强化学习中长尾响应分布导致的效率瓶颈,提出分布感知的主动轨迹塑造方法,通过细粒度识别提示内长尾并削减无效冗余,实现高达1.77倍的加速而不损失模型性能。

Comments 16 pages, 14 figures, 5 tables. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30251 2026-05-29 cs.CL cs.AI 84%

Same Evidence, Different Answers: Canonical-Context On-Policy Distillation for Multi-Turn Language Models

相同证据,不同答案:面向多轮语言模型的规范上下文在线策略蒸馏

Zizhuo Lin, Quanling Liu, Jinsheng Quan, Chao Zhang, Yifan Zhu, Xing Shi, Jingtao Xu, Zhihui Li, Yawei Luo

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出规范上下文在线策略蒸馏(CCOPD)方法,通过教师-学生框架对齐模型在完整提示和逐步揭示信息下的行为,减少自我锚定漂移,在多轮数学对话上训练后,在原始分片任务上平均提升32%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29459 2026-05-29 cs.CL cs.LG 84%

Kronecker Embeddings: Byte-Level Structured Token Representations for Parameter-Efficient Language Models

Kronecker嵌入:用于参数高效语言模型的字节级结构化词元表示

Rohan Shravan

机构 * The School of AI(人工智能学院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出Kronecker嵌入,通过字节级字符-位置确定性分解替代标准嵌入表,消除91-94%输入侧可训练参数,在多个实验中实现更低验证损失、更强拼写鲁棒性和运行时效率。

Comments 28 pages, 16 tables. Reference implementation: https://github.com/theschoolofai/kronecker-embeddings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29398 2026-05-29 cs.LG cs.AI 84%

GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models

GDSD:强化学习作为扩散语言模型的引导去噪器自蒸馏

Xiaohang Tang, Keyue Jiang, Che Liu, Qifang Zhao, Xiaoxiao Xu, Sangwoong Yoon, Ilija Bogunovic

机构 * UCL Dept. of Statistical Science(伦敦大学学院统计科学系) UCL Centre for AI(伦敦大学学院人工智能中心) Alibaba Group(阿里巴巴集团) Dept. of EEE(电子工程系) Imperial College London(伦敦帝国理工学院) UNIST(全南大学) University of Basel(巴塞尔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出引导去噪器自蒸馏(GDSD)方法,通过从逆KL正则化强化学习的闭式最优解中导出的优势引导自教师直接蒸馏扩散语言模型的去噪器,避免了ELBO似然代理带来的训练-推理不匹配偏差,在规划、数学和代码基准上显著优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28526 2026-05-28 cs.AI cs.CL 84%

Entropy-aware Masking for Masked Language Modeling

面向掩码语言建模的熵感知掩码策略

Gokul Srinivasagan, Kai Hartung, Munir Georges

机构 * AImotion Bavaria(AImotion巴伐利亚) Technische Hochschule Ingolstadt(英戈尔施塔特技术大学)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出基于熵分布的掩码策略,通过模型预测熵识别信息量高的token进行掩码,并引入自掩码方法提升训练效率,在GLUE上平均提升5%。

Comments accepted at starsem 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28283 2026-05-28 cs.CL cs.AI 84%

PrunePath: Towards Highly Structured Sparse Language Models

PrunePath:迈向高度结构化稀疏语言模型

Zhexuan Gu, Zixun Fu, Yancheng Yuan

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PrunePath框架,通过软最大归一化路由和累积质量阈值实现自适应预算的结构化稀疏化,在自然语言理解、生成和指令调优中取得优越的稀疏-性能权衡,并利用Triton内核将结构化稀疏转化为实际内存节省和解码速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17759 2026-05-27 cs.CR cs.CL cs.CV cs.LG stat.ML 84%

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

VERA-V:用于破解视觉语言模型的变分推断框架

Qilin Liao, Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science, Purdue University, USA(美国普渡大学计算机科学系)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 提出VERA-V变分推断框架,通过联合后验分布生成隐蔽的文本-图像对抗输入,以系统性地发现视觉语言模型的多模态漏洞,在多个基准上攻击成功率最高提升53.75%。

Comments 18 pages, 7 Figures,

详情

展开后加载摘要…

URL PDF HTML 收藏