arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2508.08343 2025-11-20 cs.PF cs.AI cs.CL 86%

A Data-driven ML Approach for Maximizing Performance in LLM-Adapter Serving

Ferran Agullo, Joan Oliveras, Chen Wang, Alberto Gutierrez-Torre, Olivier Tardieu, Alaa Youssef, Jordi Torres, Josep Ll. Berral

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心) Universitat Politècnica de Catalunya - BarcelonaTech (UPC)(巴塞罗那技术大学) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted in a computer science workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08383 2025-11-19 cs.LG cs.AI cs.CR 86%

Efficient Decoding Methods for Language Models on Encrypted Data

Matan Avitan, Moran Baruch, Nir Drucker, Itamar Zimerman, Yoav Goldberg

机构 * IBM Research(IBM研究院) Bar-Ilan University(巴伊兰大学) Tel Aviv University(特拉维夫大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06261 2025-11-18 cs.LG cs.CL 86%

Hogwild! Inference: Parallel LLM Generation via Concurrent Attention

Gleb Rodionov, Roman Garipov, Alina Shutova, George Yakushev, Erik Schultheis, Vage Egiazarian, Anton Sinitsin, Denis Kuznedelev, Dan Alistarh

机构 * Yandex HSE University(俄罗斯高等经济大学) IST Austria(国际研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12751 2025-11-18 cs.LG cs.AI cs.RO 86%

Are LLMs The Way Forward? A Case Study on LLM-Guided Reinforcement Learning for Decentralized Autonomous Driving

Timur Anvar, Jeffrey Chen, Yuyan Wang, Rohan Chandra

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20856 2025-11-17 cs.LG cs.AI 86%

Strada-LLM: Graph LLM for traffic prediction

Seyed Mohamad Moghadas, Bruno Cornelis, Alexandre Alahi, Adrian Munteanu

机构 * Department of Electronics and Informatics, Vrije Universiteit Brussel(布鲁塞尔自由大学电子与信息系) VITA Lab, EPFL(EPFL VITA实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25979 2025-11-13 cs.CL cs.LG 86%

AttnCache: Accelerating Self-Attention Inference for LLM Prefill via Attention Cache

Dinghong Song, Yuan Feng, Yiwei Wang, Shangye Chen, Cyril Guyot, Filip Blagojevic, Hyeran Jeon, Pengfei Su, Dong Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14884 2025-11-13 cs.LG cs.AI 86%

Polar Sparsity: High Throughput Batched LLM Inferencing with Scalable Contextual Sparsity

Susav Shrestha, Brad Settlemyer, Nikoli Dryden, Narasimha Reddy

机构 * Texas A&M University(德克萨斯大学) NVIDIA(英伟达) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025, 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07426 2025-11-12 cs.DC cs.AI cs.CL cs.NI cs.SE 86%

Network and Systems Performance Characterization of MCP-Enabled LLM Agents

Zihao Ding, Mufeng Zhu, Yao Liu

机构 * Rutgers University(罗格斯大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06010 2025-11-11 cs.LG cs.AI cs.DC 86%

MoSKA: Mixture of Shared KV Attention for Efficient Long-Sequence LLM Inference

Myunghyun Rhee, Sookyung Choi, Euiseok Kim, Joonseop Sim, Youngpyo Joo, Hoshik Kim

机构 * SK hynix Inc.(SK 海力士公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 4 pages, 5 figures, accepted for publication at IEEE Computer Architecture Letters (IEEE CAL), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06319 2025-11-11 cs.LG cs.AI 86%

Accelerating LLM Inference Throughput via Asynchronous KV Cache Prefetching

Yanhao Dong, Yubo Miao, Weinan Li, Xiao Zheng, Chao Wang, Jiesheng Wu, Feng Lyu

机构 * AAAI(美国人工智能协会) AAAI Press Staff(AAAI出版社员工) AAAI Publications Committee(AAAI出版委员会)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02647 2025-11-05 cs.DC cs.AI cs.LG 86%

Federated Attention: A Distributed Paradigm for Collaborative LLM Inference over Edge Networks

Xiumei Deng, Zehui Xiong, Binbin Chen, Dong In Kim, Merouane Debbah, H. Vincent Poor

机构 * Pillar of Information Systems Technology and Design, Singapore University of Technology and Design(信息系统技术与设计学院,新加坡南洋理工大学) School of Electronics, Electrical Engineering and Computer Science, Queen’s University Belfast(电子、电气与计算机科学学院,女王大学贝尔法斯特分校) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学) KU 6G Research Center, Department of Computer and Information Engineering, Khalifa University(6G研究中心,计算机与信息工程系,哈利法大学) CentraleSupelec, University of Paris-Saclay(中央超导研究所,巴黎萨克雷大学) Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01633 2025-11-04 cs.LG cs.AI 86%

Scaling Graph Chain-of-Thought Reasoning: A Multi-Agent Framework with Efficient LLM Serving

Chengying Huan, Ziheng Meng, Yongchao Liu, Zhengyi Yang, Yun Zhu, Yue Yun, Shipeng Li, Rong Gu, Xiabao Wu, Haitao Zhang, Chuntao Hong, Shaonan Ma, Guihai Chen, Chen Tian

机构 * Nanjing University(南京大学) Ant Group(蚂蚁集团) University of New South Wales(新南威尔士大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08872 2025-11-04 cs.AI cs.GT cs.HC cs.LG cs.MA 86%

GTAlign: Game-Theoretic Alignment of LLM Assistants for Social Welfare

Siqi Zhu, David Zhang, Pedro Cisneros-Velarde, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) VMware Research(VMware研究)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 31 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07416 2025-11-04 cs.LG cs.AI 86%

LiteVLM: A Low-Latency Vision-Language Model Inference Pipeline for Resource-Constrained Environments

Jin Huang, Yuchao Jin, Le An, Josh Park

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10724 2025-11-03 cs.CL cs.LG 86%

HELIOS: Adaptive Model And Early-Exit Selection for Efficient LLM Inference Serving

Avinash Kumar, Shashank Nag, Jason Clemons, Lizy John, Poulami Das

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03717 2025-11-03 cs.LG cs.AI 86%

RaanA: A Fast, Flexible, and Data-Efficient Post-Training Quantization Algorithm

Yongyi Yang, Jianyang Gao, Wei Hu

机构 * Computer Science and Engineering, University of Michigan(密歇根大学计算机科学与工程系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机科学与数据科学学院) Physics of Artificial Intelligence Group, NTT Research, Inc.(NTT研究所人工智能物理组)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23408 2025-10-28 cs.AI cs.DC cs.ET cs.LG cs.MA 86%

AutoStreamPipe: LLM Assisted Automatic Generation of Data Stream Processing Pipelines

Abolfazl Younesi, Zahra Najafabadi Samani, Thomas Fahringer

机构 * Departement of Computer Science, University of Innsbruck(因斯布鲁克大学计算机科学系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24749 2025-10-28 cs.LG cs.CL math.OC 86%

SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training

Yehonathan Refael, Guy Smorodinsky, Tom Tirer, Ofir Lindenbaum

机构 * Faculty of Engineering(工程学院) Tel Aviv University(特拉维夫大学) Department of Computer science(计算机科学系) Ben Gurion University(本· Gurion大学) Faculty of Engineering Bar-Ilan University(巴伊兰大学工程学院) Bar-Ilan University(巴伊兰大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21883 2025-10-28 cs.CL cs.AI 86%

Language Ranker: A Lightweight Ranking framework for LLM Decoding

Chenheng Zhang, Tianqi Du, Jizhe Zhang, Mingqing Xiao, Yifei Wang, Yisen Wang, Zhouchen Lin

机构 * State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(一般人工智能国家重点实验室,智能科学与技术学院,北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) MIT CSAIL, MA, USA(MIT CSAIL,马萨诸塞州,美国) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13000 2025-10-28 cs.CL cs.AI cs.IR 86%

RAGE Against the Machine: Retrieval-Augmented LLM Explanations

Joel Rorseth, Parke Godfrey, Lukasz Golab, Divesh Srivastava, Jaroslaw Szlichta

机构 * University of Waterloo(滑铁卢大学) York University(约克大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by ICDE 2024 (Demonstration Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19947 2025-10-27 cs.LG cs.AI cs.SY eess.SY 86%

MESS+: Dynamically Learned Inference-Time LLM Routing in Model Zoos with Service Level Guarantees

Herbert Woisetschläger, Ryan Zhang, Shiqiang Wang, Hans-Arno Jacobsen

机构 * Technical University of Munich(慕尼黑技术大学) Horace Greeley High School(霍雷肖·格里利高中) IBM Research(IBM研究院) University of Toronto(多伦多大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025. Code: https://github.com/laminair/mess-plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18789 2025-10-27 cs.DC cs.CL cs.LG 86%

FlexLLM: Token-Level Co-Serving of LLM Inference and Finetuning with SLO Guarantees

Gabriele Oliaro, Xupeng Miao, Xinhao Cheng, Vineeth Kada, Mengdi Wu, Ruohan Gao, Yingyi Huang, Remi Delacourt, April Yang, Yingcheng Wang, Colin Unger, Zhihao Jia

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NSDI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18672 2025-10-22 cs.LG cs.AI 86%

Reasoning Language Model Inference Serving Unveiled: An Empirical Study

Qi Li, Junpan Wu, Xiang Liu, Yuxin Wang, Zeyu Li, Zhenheng Tang, Yuhan Chen, Shaohuai Shi, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) HKBU(香港 Baptist University) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16293 2025-10-21 cs.LG cs.AI cs.DC 86%

Robust LLM Training Infrastructure at ByteDance

Borui Wan, Gaohong Liu, Zuquan Song, Jun Wang, Yun Zhang, Guangming Sheng, Shuguang Wang, Houmin Wei, Chenyuan Wang, Weiqiang Lou, Xi Yang, Mofan Zhang, Kaihua Jiang, Cheng Ren, Xiaoyun Zhi, Menghan Yu, Zhe Nan, Zhuolin Zheng, Baoquan Zhong, Qinlong Wang, Huan Yu, Jinxin Chi, Wang Zhang, Yuhan Li, Zixian Du, Sida Zhao, Yongqiang Zhang, Jingzhe Tang, Zherui Liu, Chuan Wu, Yanghua Peng, Haibin Lin, Wencong Xiao, Xin Liu, Liang Xiang

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15330 2025-10-20 cs.DC cs.AI cs.CL cs.NI 86%

BeLLMan: Controlling LLM Congestion

Tella Rajashekhar Reddy, Atharva Deshmukh, Karan Tandon, Rohan Gandhi, Anjaly Parayil, Debopam Bhattacherjee

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To be presented at FAISYS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15283 2025-10-20 cs.CL cs.AI 86%

Exemplar-Guided Planing: Enhanced LLM Agent for KGQA

Jingao Xu, Shuoyoucheng Ma, Xin Song, Rong Jiang, Hongkui Tu, Bin Zhou

机构 * College of Computer Science and Technology, National University of Defense Technology, Changsha, China(计算机科学与技术学院,国防科技大学,长沙,中国)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19234 2025-10-16 cs.AI cs.CL cs.MA 86%

GUARDIAN: Safeguarding LLM Multi-Agent Collaborations with Temporal Graph Modeling

Jialong Zhou, Lichao Wang, Xiao Yang

机构 * King’s College London(伦敦国王学院) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12633 2025-10-15 cs.LG cs.AI cs.DC 86%

Laminar: A Scalable Asynchronous RL Post-Training Framework

Guangming Sheng, Yuxuan Tong, Borui Wan, Wang Zhang, Chaobo Jia, Xibin Wu, Yuqi Wu, Xiang Li, Chi Zhang, Yanghua Peng, Haibin Lin, Xin Liu, Chuan Wu

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11498 2025-10-14 cs.LG cs.CL 86%

ReLook: Vision-Grounded RL with a Multimodal LLM Critic for Agentic Web Coding

Yuhang Li, Chenchen Zhang, Ruilin Lv, Ao Liu, Ken Deng, Yuanxing Zhang, Jiaheng Liu, Wiggin Zhou, Bo Zhou

机构 * LLM Department, Tencent(腾讯大语言模型部门) Peking University(北京大学) Nanjing University(南京大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10739 2025-10-14 cs.LG cs.AI cs.SE 86%

A Stochastic Differential Equation Framework for Multi-Objective LLM Interactions: Dynamical Systems Analysis with Code Generation Applications

Shivani Shukla, Himanshu Joshi

机构 * University of San Francisco(旧金山大学) Vector Institute for Artificial Intelligence(人工智能向量研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Peer-reviewed and accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) DynaFront 2025 Workshop (https://sites.google.com/view/dynafrontneurips25)

详情

展开后加载摘要…

URL PDF HTML 收藏