arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22313 篇

2601.19611 2026-01-28 cs.LG cs.AI cs.CL 90%

Explicit Multi-head Attention for Inter-head Interaction in Large Language Models

显式多头注意力机制用于大语言模型中头间的交互

Runyu Peng, Yunhua Zhou, Demin Song, Kai Lv, Bo Wang, Qipeng Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07878 2026-01-14 cs.LG cs.AI cs.CL 90%

Sliced-Wasserstein Distribution Alignment Loss Improves the Ultra-Low-Bit Quantization of Large Language Models

切片瓦瑟斯坦分布对齐损失提高了大语言模型的超低比特量化

Deyu Cao, Yixin Yin, Samin Aref

机构 * Department of Information and Communication Engineering, The University of Tokyo(信息与通信工程系,东京大学) Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Department of Mechanical and Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 切片瓦瑟斯坦分布对齐损失通过提升超低比特量化性能,有效恢复模型准确性。

Comments Post-peer-review accepted manuscript, 17 pages including the supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07185 2025-12-30 cs.CL cs.AI cs.LG 90%

DySK-Attn: A Framework for Efficient, Real-Time Knowledge Updating in Large Language Models via Dynamic Sparse Knowledge Attention

DySK-Attn:通过动态稀疏知识注意力实现大语言模型高效实时知识更新的框架

Kabir Khan, Priya Sharma, Arjun Mehta, Neha Gupta, Ravi Narayanan

机构 * Department of Computer Science, San Francisco State University, San Francisco, CA 94132, India(计算机科学系,圣何塞州立大学) Department of Computer Science and Engineering, Indian Institute of Technology Bombay, Mumbai 400076, India(印度班加罗尔理工学院计算机科学与工程系) Department of Computer Science and Engineering, Indian Institute of Technology Delhi, New Delhi 110016, India(印度德里理工学院计算机科学与工程系) Department of Computer Science and Automation, Indian Institute of Science, Bengaluru 560012, India(印度班加罗尔科学研究所计算机科学与自动化系) Machine Learning Lab, International Institute of Information Technology Hyderabad (IIIT-H), Hyderabad 500032, India(国际信息科技研究所海得拉巴分所机器学习实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DySK-Attn通过动态稀疏知识注意力机制,实现大语言模型高效实时知识更新,提升事实准确性和计算效率。

Comments Preprint; 7 figures, 3 tables, 1 algorithm; v1. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13334 2025-11-26 cs.CL cs.AI cs.LG 90%

BiasJailbreak:Analyzing Ethical Biases and Jailbreak Vulnerabilities in Large Language Models

BiasJailbreak: 分析大型语言模型中的伦理偏见和 jailbreak 漏洞

Isack Lee, Haebin Seong

机构 * Theori Inc.(Theori公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析了大型语言模型中的伦理偏见和 jailbreak 漏洞,提出 BiasJailbreak 和 BiasDefense 方法以提高模型安全性。

Comments Accepted as a workshop paper at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18690 2025-11-25 eess.SP 90%

LLM4AMC: Adapting Large Language Models for Adaptive Modulation and Coding

LLM4AMC: 为自适应调制与编码适应大型语言模型

Xinyu Pan, Boxun Liu, Xiang Cheng, Chen Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 LLM4AMC利用预训练大型语言模型优化自适应调制与编码,通过改进的网络架构提升信道质量预测精度,从而提升链路性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11624 2025-11-18 cs.DC cs.AI cs.CL cs.LG 90%

Characterizing and Understanding Energy Footprint and Efficiency of Small Language Model on Edges

Md Romyull Islam, Bobin Deng, Nobel Dhar, Tu N. Nguyen, Selena He, Yong Shi, Kun Suo

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Submitted version; 9 pages, 5 figures; presented at IEEE MASS 2025 (online publication pending)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11017 2025-11-17 cs.LG cs.AI cs.CL cs.CV 90%

First-Order Error Matters: Accurate Compensation for Quantized Large Language Models

Xingyu Zheng, Haotong Qin, Yuye Li, Haoran Chu, Jiakai Wang, Jinyang Guo, Michele Magno, Xianglong Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by AAAI 2026. The code is available at https://github.com/Xingyu-Zheng/FOEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05314 2025-10-28 cs.CL cs.AI cs.LG 90%

Constrained Entropic Unlearning: A Primal-Dual Framework for Large Language Models

Taha Entesari, Arman Hatami, Rinat Khaziev, Anil Ramakrishna, Mahyar Fazlyab

机构 * Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The Thirty-Ninth Annual Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24293 2025-10-14 cs.LG cs.AI cs.CL 90%

Equivalent Linear Mappings of Large Language Models

James R. Golden

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments title changed; major revisions; code available at https://github.com/jamesgolden1/equivalent-linear-LLMs/; published at https://openreview.net/forum?id=oDWbJsIuEp

Journal ref Transactions on Machine Learning Research (TMLR) (10/2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21613 2025-09-29 cs.CL cs.AI cs.LG cs.MA 90%

Multi-Objective Reinforcement Learning for Large Language Model Optimization: Visionary Perspective

Lingxiao Kong, Cong Yang, Oya Deniz Beyan, Zeyd Boukhers

机构 * Fraunhofer Institute for Applied Information Technology FIT, Germany(弗劳恩霍夫应用信息科技研究所) Soochow University, China(苏州大学) University Hospital of Cologne, Germany(科隆大学医院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 3 pages, 1 figure, accepted by ECAI MODeM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14526 2025-09-19 cs.CL cs.AI cs.LG 90%

Delta Knowledge Distillation for Large Language Models

Yihan Cao, Yanbin Kang, Zhengming Xing, Ruijie Jiang

机构 * LinkedIn Corporation(领英公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16393 2025-09-17 cs.AI cs.CL cs.LG 90%

Concurrent Linguistic Error Detection (CLED): a New Methodology for Error Detection in Large Language Models

Jinhua Zhu, Javier Conde, Zhen Gao, Pedro Reviriego, Shanshan Liu, Fabrizio Lombardi

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 6 figures, 30 references

Journal ref IEEE Transactions on Computers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09675 2025-09-12 cs.CL cs.AI cs.LG 90%

CDE: Curiosity-Driven Exploration for Efficient Reinforcement Learning in Large Language Models

Runpeng Dai, Linfeng Song, Haolin Liu, Zhenwen Liang, Dian Yu, Haitao Mi, Zhaopeng Tu, Rui Liu, Tong Zheng, Hongtu Zhu, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) Tencent Multimodal Department(腾讯多模态部门) University of North Carolina at Chapel Hill(北卡罗来纳大学夏洛特分校) University of Virginia(弗吉尼亚大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18311 2025-09-03 cs.LG cs.AI cs.CL 90%

Towards Incremental Learning in Large Language Models: A Critical Review

Mladjan Jovanovic, Peter Voss

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21377 2025-09-01 cs.CL cs.AI cs.LG 90%

Challenges and Applications of Large Language Models: A Comparison of GPT and DeepSeek family of models

Shubham Sharma, Sneha Tuli, Narendra Badam

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03182 2025-08-26 cs.DC 90%

Enhancing Memory Efficiency in Large Language Model Training Through Chronos-aware Pipeline Parallelism

Xinyuan Lin, Chenlu Li, Zongle Huang, Chunyu Wang, Bo Xiao, Huazhong Yang, Shishi Duan, Yongpan Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05239 2025-08-08 cs.CL cs.AI cs.LG 90%

Pruning Large Language Models by Identifying and Preserving Functional Networks

Yiheng Liu, Junhao Ning, Sichen Xia, Xiaohui Gao, Ning Qiang, Bao Ge, Junwei Han, Xintao Hu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14204 2025-07-22 cs.LG cs.AI cs.CL 90%

LaCache: Ladder-Shaped KV Caching for Efficient Long-Context Modeling of Large Language Models

Dachuan Shi, Yonggan Fu, Xiangchi Yuan, Zhongzhi Yu, Haoran You, Sixu Li, Xin Dong, Jan Kautz, Pavlo Molchanov, Yingyan, Lin

机构 * NVIDIA

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025. Code: https://github.com/GATECH-EIC/LaCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07147 2025-07-11 cs.LG cs.AI cs.CL cs.CV 90%

Weighted Multi-Prompt Learning with Description-free Large Language Model Distillation

Sua Lee, Kyubum Shin, Jung Ho Park

机构 * Seoul National University(首尔国立大学) Naver AI

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20589 2025-07-09 cs.CR cs.AI cs.CL cs.LG 90%

LLMs Have Rhythm: Fingerprinting Large Language Models Using Inter-Token Times and Network Traffic Analysis

Saeif Alhazbi, Ahmed Mohamed Hussain, Gabriele Oligeri, Panos Papadimitratos

机构 * College of Science and Engineering (CSE), Hamad Bin Khalifa University (HBKU)(哈马德·本·卡伊夫大学科学与工程学院) Networked Systems Security Group, KTH Royal Institute of Technology -- Stockholm, Sweden(瑞典皇家理工学院网络系统安全组)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.17711 2025-07-01 cs.CL cs.AI cs.LG 90%

Beware of Calibration Data for Pruning Large Language Models

Yixin Ji, Yang Xiang, Juntao Li, Qingrong Xia, Ping Li, Xinyu Duan, Zhefeng Wang, Min Zhang

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Key Laboratory of Data Intelligence and Advanced Computing, Soochow University(苏州大学数据智能与先进计算重点实验室) Huawei Cloud, China(华为云(中国))

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21408 2025-06-27 cs.LG cs.AI cs.CL 90%

Scalable Bayesian Low-Rank Adaptation of Large Language Models via Stochastic Variational Subspace Inference

Colin Samplawski, Adam D. Cobb, Manoj Acharya, Ramneet Kaur, Susmit Jha

机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) Computer Science Laboratory(计算机科学实验室) SRI International(SRI国际)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at UAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19697 2025-06-25 cs.LG cs.AI cs.CL 90%

Outlier-Safe Pre-Training for Robust 4-Bit Quantization of Large Language Models

Jungwoo Park, Taewhoo Lee, Chanwoong Yoon, Hyeon Hwang, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN公司)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15704 2025-06-23 cs.LG cs.AI cs.CL 90%

Learn from the Past: Fast Sparse Indexing for Large Language Model Decoding

Feiyu Yao, Qian Wang

机构 * Beijing University of Technology(北京理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09223 2025-06-17 cs.CL cs.AI cs.LG 90%

Foundations of Large Language Models

Tong Xiao, Jingbo Zhu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12627 2025-06-12 cs.NE 90%

Efficient Heuristics Generation for Solving Combinatorial Optimization Problems Using Large Language Models

Xuan Wu, Di Wang, Chunguo Wu, Lijie Wen, Chunyan Miao, Yubin Xiao, You Zhou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Accepted by SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12094 2025-06-03 cs.CL cs.AI cs.LG 90%

SepLLM: Accelerate Large Language Models by Compressing One Segment into One Separator

Guoxuan Chen, Han Shi, Jiawei Li, Yihang Gao, Xiaozhe Ren, Yimeng Chen, Xin Jiang, Zhenguo Li, Weiyang Liu, Chao Huang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14109 2025-06-03 cs.CL cs.AI cs.LG quant-ph 90%

CompactifAI: Extreme Compression of Large Language Models using Quantum-Inspired Tensor Networks

Andrei Tomut, Saeed S. Jahromi, Abhijoy Sarkar, Uygar Kurt, Sukhbinder Singh, Faysal Ishtiaq, Cesar Muñoz, Prabdeep Singh Bajaj, Ali Elborady, Gianni del Bimbo, Mehrazin Alizadeh, David Montero, Pablo Martin-Ramiro, Muhammad Ibrahim, Oussama Tahiri Alaoui, John Malcolm, Samuel Mugel, Roman Orus

机构 * Multiverse Computing(多维计算公司) Catalan Institute of Nanoscience and Nanotechnology (ICN2)(加泰罗尼亚纳米科学与纳米技术研究所) The Barcelona Institute of Science and Technology(巴塞罗那科学技术研究院) Donostia International Physics Center(多斯蒂亚国际物理中心) Centre for Social Innovation(社会创新中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 5 pages, 4 figures, 2 tables, and supplementary information of 2 pages and 1 figure. Revised version with new benchmarks for LlaMA2-7B

Journal ref Proceedings of the 33rd European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning (ESANN 2025), Bruges, Belgium, pp. 531-537, April 2025. ISBN: 9782875870926

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18754 2025-06-02 cs.CL cs.AI cs.LG 90%

Few-Shot Optimization for Sensor Data Using Large Language Models: A Case Study on Fatigue Detection

Elsen Ronando, Sozo Inoue

机构 * Graduate School of Life Science and Systems Engineering, Kyushu Institute of Technology(九州工学院生命科学与系统工程研究生院) Department of Informatics, Universitas 17 Agustus 1945 Surabaya(Surabaya 17 August 1945 大学信息系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 43 pages, 18 figures. Accepted for publication in MDPI Sensors (2025). Final version before journal publication

Journal ref Sensors 2025, 25, 3324

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01662 2025-05-30 cs.CL cs.AI cs.LG 90%

Fast Large Language Model Collaborative Decoding via Speculation

Jiale Fu, Yuchu Jiang, Junkai Chen, Jiaming Fan, Xin Geng, Xu Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏