arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2407.15516 2024-07-23 cs.LG cs.CL 85%

Attention Is All You Need But You Don't Need All Of It For Inference of Large Language Models

Georgy Tyukin, Gbetondji J-S Dovonon, Jean Kaddour, Pasquale Minervini

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03142 2024-06-11 cs.LG cs.CL 85%

Less is KEN: a Universal and Simple Non-Parametric Pruning Algorithm for Large Language Models

Michele Mastromattei, Fabio Massimo Zanzotto

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG

Comments 14 pages, 8 figures, 7 tables - to be published at ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09737 2024-04-16 cs.LG cs.CL 85%

Quantization of Large Language Models with an Overdetermined Basis

Daniil Merkulov, Daria Cherniuk, Alexander Rudikov, Ivan Oseledets, Ekaterina Muravleva, Aleksandr Mikhalev, Boris Kashin

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02799 2024-03-06 cs.CL cs.AI 85%

DPPA: Pruning Method for Large Language Model to Model Merging

Yaochen Zhu, Rui Xia, Jiajun Zhang

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04658 2024-01-17 cs.CL cs.AI 85%

Lightning Attention-2: A Free Lunch for Handling Unlimited Sequence Lengths in Large Language Models

Zhen Qin, Weigao Sun, Dong Li, Xuyang Shen, Weixuan Sun, Yiran Zhong

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI

Comments Technical Report. Yiran Zhong is the corresponding author. The source code is available at https://github.com/OpenNLPLab/lightning-attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03738 2023-07-10 cs.LG cs.CL cs.PF 85%

QIGen: Generating Efficient Kernels for Quantized Inference on Large Language Models

Tommaso Pegolotti, Elias Frantar, Dan Alistarh, Markus Püschel

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11222 2023-06-27 cs.LG cs.CL 85%

LoSparse: Structured Compression of Large Language Models based on Low-Rank and Sparse Approximation

Yixiao Li, Yifan Yu, Qingru Zhang, Chen Liang, Pengcheng He, Weizhu Chen, Tuo Zhao

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07941 2023-06-14 cs.CL cs.LG 85%

GPT-Calls: Enhancing Call Segmentation and Tagging by Generating Synthetic Conversations via Large Language Models

Itzik Malkiel, Uri Alon, Yakir Yehuda, Shahar Keren, Oren Barkan, Royi Ronen, Noam Koenigstein

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06516 2026-06-30 cs.CL 85%

You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

你只有一份工作:利用LLM隐藏表示进行每任务量化

Amit LeVi, Raz Lapid, Rom Himelstein, Chaim Baskin, Ravid Shwartz Ziv, Avi Mendelson

机构 * Technion—Israel Institute of Technology(技术ion—以色列理工学院) Zenity(Zenity公司) DeepKeep(DeepKeep公司) Ben-Gurion University of the Negev(巴伊兰大学) New York University(纽约大学)

专题命中 效率与部署 :LLM(title_cn,abstract);post-training(abstract);分类 cs.CL;foundation model(comments)

AI总结 本文提出TAQ框架,通过任务校准提示分配更高精度给任务相关的transformer层,提升精度-内存比和部署性能。

Comments Accepted at ICML 2026 Workshop on AdaptFM: Resource-Adaptive Foundation Model Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22549 2025-05-29 cs.LG 85%

DES-LOC: Desynced Low Communication Adaptive Optimizers for Training Foundation Models

Alex Iacob, Lorenzo Sani, Mher Safaryan, Paris Giampouras, Samuel Horváth, Andrej Jovanovic, Meghdad Kurmanji, Preslav Aleksandrov, William F. Shen, Xinchi Qiu, Nicholas D. Lane

专题命中 效率与部署 :foundation model(title,abstract);language model(abstract,comments);分类 cs.LG;large language model(comments)

Comments Keywords: Distributed Training, Foundation Models, Large Language Models, Optimizers, Communication Efficiency, Federated Learning, Distributed Systems, Optimization Theory, Scaling, Robustness. Preprint, under review at NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22070 2026-08-25 cs.CE 新提交 85%

SoulGard-VL-2B: A Vision-Language Model for Edge-Based Feline Behavior Understanding

SoulGard-VL-2B:用于边缘端猫行为理解的视觉语言模型

YuHang Wu, HaoXian Liu, Jia Tao

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);prompting(abstract)

AI总结 本研究提出基于Qwen3-VL-2B后训练得到的边缘端VLM SoulGard-VL-2B,结合多阶段后训练方案,在RK3576芯片上实现高准确率与低延迟,可生成猫行为JSON结构化输出,提升了动物VLM的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20486 2026-08-24 eess.SP 新提交 85%

Wireless Physical-Layer Foundation Models: Architectures, Learning Paradigms, Applications, and Deployment

无线物理层基础模型:架构、学习范式、应用与部署

Mohammad Cheraghinia, Davide Buffelli, Liu Li, Mohammad Alhellani, Jaron Fontaine, Sattar Vakili, Mamoun Guenach, Eli De Poorter, Adnan Shahid

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文综述无线物理层基础模型(WPFMs)的架构、学习范式等,提出五维度分类体系,分析其在多领域的应用部署可行性,探讨模型压缩与挑战,为相关研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18339 2026-08-20 cs.CV cs.AI cs.CL cs.LG 新提交 85%

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

从推理到适应:视觉语言模型的统一最优传输视角

Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Wayne State University(韦恩州立大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出名为algname的VLM测试时适应方法,通过Wasserstein最优传输统一VLM的推理与适应目标,实验显示其性能较最优方法提升7%且效率先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15171 2026-08-18 cs.DC 新提交 85%

P-PAS: Prefill-Pressure Adaptive Scheduling for Long-Context LLM Serving

P-PAS:面向长上下文大语言模型服务的预填充压力自适应调度

Timo Sämann

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 针对长上下文LLM服务中静态最大批处理令牌数(MBT)无法适配不同调度压力的问题,提出P-PAS动态调度策略,可在各类负载下维持低延迟,避免固定MBT的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07918 2026-08-18 cs.LG cs.AI cs.CL cs.CR 版本更新 85%

Efficient Safety Alignment of Language Models via Latent Personality Traits

通过潜在人格特质实现语言模型的高效安全对齐

Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman

机构 * Mila, Quebec AI Institute(米拉,魁北克人工智能研究所) McGill University(麦吉尔大学) LawZero Université de Montréal(蒙特利尔大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型安全方法易受攻击问题,提出潜在人格对齐(LPA)方法,基于66条陈述训练,通过假设人格表征与避害共享结构,实现高攻击成功率、轻量级训练及良好泛化性。

Comments 19 pages, 6 figures. Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14333 2026-08-17 cs.AR 新提交 85%

Beyond Capacity: Scalable MoE LLM Inference via High-Bandwidth Flash with Direct GPU and HBM Paths

超越容量:通过具有直接GPU和HBM路径的高带宽闪存实现可扩展的MoE大语言模型推理

Seeyeon Kim, Juhyeong Jin, Joo-Young Kim

专题命中 效率与部署 :LLM(title,abstract);language model(abstract)

AI总结 该研究针对MoE大语言模型推理的HBM容量瓶颈,提出同时利用HBF到GPU的直接路径和HBF经HBM到GPU的中继路径的架构,可提升专家传递效率,实现1.94倍吞吐量与1.90倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11668 2026-08-14 cs.AR 版本更新 85%

HBF Sucks! A Full-Stack Characterization of High-Bandwidth Flash for KV-Centric LLM Serving

面向以KV为核心的大语言模型服务的高带宽闪存全栈表征

Zhuoran Li, Zhuohang Bian, Xin Huang, Yibo Zhao, Guangyu Sun, Youwei Zhuo

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究通过全栈表征发现,将高带宽闪存(HBF)直接替代SSD作为瞬态KV卸载层会降低LLM服务性能,HBF需作为感知复用的协调层使用而非SSD替代品。

Comments 13 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07076 2026-08-10 cs.SE 新提交 85%

Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study

面向专用语言模型的解释引导式变异测试:一项实证研究

Xingcheng Chen, Mehmet Besenk, Andrea Stocco

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过在三个数据集、四种模型架构下的20种配置开展实证研究,发现解释引导式变异测试生成的经验证故障诱导测试用例是启发式变异策略的2.30倍,可有效评估专用语言模型的鲁棒性。

Comments 20 pages, 4 figures. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28418 2026-07-31 cs.AI cs.CL cs.LG 新提交 85%

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

WIDE:通过令牌级动态宽度剪枝提升自适应大语言模型推理效率

Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波东方理工大学宁波数字孪生研究院) Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WIDE是首个端到端可微令牌级动态宽度剪枝框架,通过两阶段训练与剪枝-内核协同设计,在50%稀疏度下实现显著推理加速与更优精度保持,性能优于现有动态剪枝方法。

Comments 30 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25346 2026-07-29 cs.IR 新提交 85%

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

反对用于检索的生成式模型:判别式语言模型作为有效的检索器

Zhe Xu, Prachi Agrawal, Kavosh Asadi, Tianyi Chen, Carl Hu, Justin Johnson, Wuwei Lan, Mingfu Liang, Xi Liu, Tik On Lui, Oladipo Ositelu, Sandeep Pandey, Ankit Peshin, Feng Qi, Anil Ramakrishna, Kaushik Rangadurai, Frank Shyu, Luke Simon, Yang Yang, Chiyu Zhang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24788 2026-07-29 cs.AI cs.CL cs.LG 新提交 85%

GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference

GLIDE:用于高效大语言模型推理的引导式分层混合注意力机制

Vimal William, Ravi Tandon, Jyotikrishna Dass

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型推理时KV缓存瓶颈问题,提出GLIDE引导式分层混合注意力机制,通过分层自适应平衡线性循环与softmax窗口,非均匀压缩softmax占用空间,实现性能-效率权衡,降低长上下文生成延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18957 2026-07-22 cs.DC 新提交 85%

InstantInfer: Enabling Fast LLM Cold Start with Communicating Finite Automata

InstantInfer:使用通信有限自动机实现快速大语言模型冷启动

Yitao Yuan, Yongchao He, Shaoke Fang, Wenfei Wu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型推理服务冷启动低效问题,提出通信有限自动机抽象及编程框架,经证明其正确性后应用于vLLM相关环节形成InstantInfer,大幅加速冷启动且在多场景表现鲁棒。

Comments 15 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02345 2026-07-22 cs.CL cs.AI cs.DC cs.LG cs.NE 版本更新 85%

Breaking the MoE LLM Trilemma: Dynamic Expert Clustering with Structured Compression

打破MoE大语言模型三重困境:动态专家聚类与结构压缩

Peijun Zhu, Ning Yang, Baoliang Tian, Jiayu Wei, Weihao Zhang, Haijun Zhang, Pin Lv

机构 * Guangzhou University(广州大学) Institue of Automation Chinese Academy of Sciences(中国科学院自动化研究所) ByteDance Inc.(字节跳动公司) University of Science and Technology Beijing(北京科技大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出动态专家聚类与结构压缩框架,通过参数分解和分层路由策略,显著提升MoE大语言模型的效率和内存利用率。

Comments 10 pages, 2 figures, 8 tables. Under review as a conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17415 2026-07-21 cs.AR 新提交 85%

Transition-Aware Backend Dispatch for Edge LLM Inference

用于边缘大语言模型推理的过渡感知后端调度

Alaaddin Goktug Ayar, Martin Margala

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究边缘平台大语言模型推理问题,提出过渡感知后端调度方法,结合算子特征与后端选择,经实验验证该方法能降低延迟、能量及能量延迟积,减少切换,提升边缘变压器工作负载调度效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17498 2026-07-21 quant-ph 新提交 85%

LLM-Driven Cross-Paradigm Design for Quantum Optimal Control

基于大语言模型驱动的量子最优控制跨范式设计

Yu-Qin Chen, Shi-Xin Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对量子最优控制实际应用的瓶颈,提出由大语言模型驱动的QOC-Workbench工作流程,可跨范式设计协议,能自主解析文献、积累控制模式,在多场景验证中表现出色,建立了自主量子控制的跨范式方法。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03043 2026-07-21 cs.CL cs.AI cs.LG 版本更新 85%

Lil: Less is Less When Applying Post-Training Sparse-Attention Algorithms in Long-Decode Stage

Lil: 在长解码阶段应用后训练稀疏注意力算法时,少即是少

Junhao Hu, Fangze Li, Mingtao Xu, Feifan Meng, Shiju Zhao, Tiancheng Hu, Ting Peng, Anmin Liu, Wenrui Huang, Chenxu Liu, Ziyue Hua, Tao Xie

机构 * SCS, Peking University, Beijing, China(北京大学信息科学与技术学院,北京,中国) Key Lab of HCST (PKU), MOE, Beijing, China(高等教育出版社HCST重点实验室(PKU),北京,中国) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Tencent, Shenzhen, China(腾讯,深圳,中国) Beijing Tongming Lake Information Technology Application Innovation Center, Beijing, China(北京 Tongming Lake 信息技术应用创新中心,北京,中国)

专题命中 效率与部署 :post-training(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在长解码阶段应用稀疏注意力算法时,信息丢失导致序列变长的问题,提出早停算法减少token消耗并降低精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04411 2026-07-21 cs.LG cs.AI cs.CL 版本更新 85%

Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing

Mediator:基于较少参数冲突和不确定性路由的内存高效大语言模型合并

Kunfeng Lai, Zhenheng Tang, Xinglin Pan, Peijie Dong, Xiang Liu, Haolan Chen, Huacan Wang, Li Shen, Bo Li, Xiaowen Chu

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型合并中参数冲突致性能下降等问题,提出基于层参数冲突情况分别处理,结合任务算术稀疏性解耦专家,依输入数据任务不确定性选合并专家,实验表明该方法提升性能且降低系统成本。

Comments work in progress. arXiv admin note: text overlap with arXiv:2405.09673 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11475 2026-07-21 cs.CV 版本更新 85%

OmniVLM: A Token-Compressed, Sub-Billion-Parameter Vision-Language Model for Efficient On-Device Inference

OmniVLM:一种用于高效设备端推理的令牌压缩、参数少于十亿的视觉语言模型

Wei Chen, Zhiyuan Li, Shuo Xin

机构 * Nexa AI

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);preference optimization(abstract)

AI总结 研究提出OmniVLM视觉语言模型,通过令牌压缩机制减少计算开销,经多阶段训练匹配更大模型性能。在多基准测试中优于现有基线,在笔记本电脑上实证显示速度提升,能在边缘设备高效部署,模型权重可在huggingface获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11262 2026-07-14 cs.DC 新提交 85%

GPU-Tile-Sim: A Tile-Centric GPU Simulation Framework for LLM Hardware-Software Co-Design

GPU-Tile-Sim:用于大语言模型软硬件协同设计的以瓦片为中心的GPU仿真框架

Yitong Ding, Jiawei Huang, Renyang Guan, Yangjie Zhou, Zihan Liu, Yu Feng, Shixuan Sun, Mingyi Guo, Jingwen Leng, Jian Weng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型中GPU内核给性能模型带来的挑战,提出GPU-Tile-Sim框架,以瓦片图表示内核执行,设计前后端,在多种工作负载上评估,精度高,还扩展到Blackwell验证其对设计分析的有效性。

Comments 14 pages, 14 figures. Accepted to MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07518 2026-07-13 cs.CR 版本更新 85%

Efficient and Universal Watermarking for LLM-Generated Code Detection

用于大语言模型生成代码检测的高效通用水印技术

Boquan Li, Zirui Fu, Mengdi Zhang, Peixin Zhang, Jun Sun, Xingmei Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对大语言模型生成代码检测问题,提出即插即用的ACW水印方法,无需训练,通过精心设计的代码转换作隐式水印,有效高效检测代码,保留其实用性且具通用性,解决了现有方法的局限。

Comments This work has been accepted by IEEE Transactions on Software Engineering for publication, and the copyright follows IEEE policies

详情

展开后加载摘要…

URL PDF HTML 收藏