arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22313 篇

2502.00299 2025-10-15 cs.CL 85%

ChunkKV: Semantic-Preserving KV Cache Compression for Efficient Long-Context LLM Inference

Xiang Liu, Zhenheng Tang, Peijie Dong, Zeyu Li, Yue Liu, Bo Li, Xuming Hu, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) CSE, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Guangzhou HKUST Fok Ying Tung Research Institute(广州HKUST福 Ying Tung研究 institute) Terminus Technologies

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10849 2025-10-14 cs.LG 85%

Glance for Context: Learning When to Leverage LLMs for Node-Aware GNN-LLM Fusion

Donald Loveland, Yao-An Yang, Danai Koutra

机构 * Department of Computer Science and Engineering University of Michigan(计算机科学与工程系 密歇根大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23841 2025-10-14 cs.IR cs.CL 85%

SkewRoute: Training-Free LLM Routing for Knowledge Graph Retrieval-Augmented Generation via Score Skewness of Retrieved Context

Hairu Wang, Yuan Feng, Yukun Cao, Xike Xie, S Kevin Zhou

机构 * School of Computer Science, University of Science and Technology of China(中国科学技术大学计算机科学学院) School of Biomedical Engineering, USTC(USTC生物医学工程学院) Suzhou Institute for Advanced Reasearch, USTC(USTC苏州市先进研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24840 2025-10-13 cs.LG cs.CE 85%

Cell2Text: Multimodal LLM for Generating Single-Cell Descriptions from RNA-Seq Data

Oussama Kharouiche, Aris Markogiannakis, Xiao Fei, Michail Chatzianastasis, Michalis Vazirgiannis

机构 * École Polytechnique, IP Paris(巴黎理工学院,IP巴黎)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08544 2025-10-10 cs.AR cs.DC cs.LG 85%

SPAD: Specialized Prefill and Decode Hardware for Disaggregated LLM Inference

Hengrui Zhang, Pratyush Patel, August Ning, David Wentzlaff

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04596 2025-10-10 cs.SE cs.AI 85%

LLM Applications: Current Paradigms and the Next Frontier

Xinyi Hou, Yanjie Zhao, Haoyu Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06175 2025-10-08 cs.CL 85%

VecInfer: Efficient LLM Inference with Low-Bit KV Cache via Outlier-Suppressed Vector Quantization

Dingyu Yao, Chenxu Yang, Zhengyang Tong, Zheng Lin, Wei Liu, Jian Luan, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) MiLM Plus, Xiaomi Inc(小米公司MiLM Plus)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06126 2025-10-08 cs.LG cs.PF 85%

lm-Meter: Unveiling Runtime Inference Latency for On-Device Language Models

Haoxin Wang, Xiaolong Tu, Hongyu Ke, Huirong Chai, Dawei Chen, Kyungtae Han

机构 * Georgia State University(佐治亚州立大学) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

Comments This is the preprint version of the paper accepted to The 10th ACM/IEEE Symposium on Edge Computing (SEC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05733 2025-10-08 cs.AI 85%

Syn-Diag: An LLM-based Synergistic Framework for Generalizable Few-shot Fault Diagnosis on the Edge

Zijun Jia, Shuang Liang, Jinsong Yu

机构 * Beihang University(北京航空航天大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05632 2025-10-08 cs.AR cs.LG 85%

From Principles to Practice: A Systematic Study of LLM Serving on Multi-core NPUs

Tianhao Zhu, Dahu Feng, Erhu Feng, Yubin Xia

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(上海交通大学平行与分布式系统研究所) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05445 2025-10-08 cs.CL 85%

AgentRouter: A Knowledge-Graph-Guided LLM Router for Collaborative Multi-Agent Question Answering

Zheyuan Zhang, Kaiwen Shi, Zhengqing Yuan, Zehong Wang, Tianyi Ma, Keerthiram Murugesan, Vincent Galassi, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) University of Connecticut(康涅狄格大学) IBM Research(IBM研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04724 2025-10-07 cs.MA cs.AI 85%

Who's the Mole? Modeling and Detecting Intention-Hiding Malicious Agents in LLM-Based Multi-Agent Systems

Yizhe Xie, Congcong Zhu, Xinyue Zhang, Tianqing Zhu, Dayong Ye, Minghao Wang, Chi Liu

机构 * Faculty of Data Science, City University of Macau(数据科学学院,澳门城市大学) Minzu University of China(民族大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09071 2025-10-07 cs.DC cs.AI 85%

Elastic On-Device LLM Service

Wangsong Yin, Rongjie Yi, Daliang Xu, Gang Huang, Mengwei Xu, Xuanzhe Liu

机构 * Peking University, Beijing, China(北京大学) Beijing University of Posts(北京邮电大学) Beiyou Shenzhen Institute, Shenzhen, China(贝友深圳研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments MobiCom'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02675 2025-10-06 cs.AR cs.AI 85%

HALO: Memory-Centric Heterogeneous Accelerator with 2.5D Integration for Low-Batch LLM Inference

Shubham Negi, Kaushik Roy

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University(埃洛姆家族电气与计算机工程学院,普渡大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01251 2025-10-03 cs.CL stat.ML 85%

Efficient Uncertainty Estimation for LLM-based Entity Linking in Tabular Data

Carlo Bono, Federico Belotti, Matteo Palmonari

机构 * Politecnico di Milano, DEIB(米兰理工学院信息工程学院) Università degli Studi di Milano Bicocca, DISCo(米兰大学比可卡分校信息科学学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01239 2025-10-03 cs.CL 85%

CIFLEX: Contextual Instruction Flow for Sub-task Execution in Multi-Turn Interactions with a Single On-Device LLM

Juntae Lee, Jihwan Bang, Seunghan Yang, Simyung Chang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments accepted at EMNLP 2025 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01234 2025-10-03 cs.CL 85%

LLMRank: Understanding LLM Strengths for Model Routing

Shubham Agrawal, Prasang Gupta

机构 * Zeno AI

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26200 2025-10-01 cs.NI cs.AI 85%

Toward an Unbiased Collective Memory for Efficient LLM-Based Agentic 6G Cross-Domain Management

Hatim Chergui, Miguel Catalan Cid, Pouria Sayyad Khodashenas, Daniel Camps Mur, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) ISI/ATH University of Patras(帕特拉大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25919 2025-10-01 cs.DC cs.AI 85%

Accelerating LLM Inference with Precomputed Query Storage

Jay H. Park, Youngju Cho, Choungsol Lee, Moonwook Oh, Euiseong Seo

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14043 2025-10-01 cs.LG 85%

Beyond Next Token Probabilities: Learnable, Fast Detection of Hallucinations and Data Contamination on LLM Output Distributions

Guy Bar-Shalom, Fabrizio Frasca, Derek Lim, Yoav Gelberg, Yftah Ziser, Ran El-Yaniv, Gal Chechik, Haggai Maron

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00741 2025-10-01 cs.AI cs.AR cs.DC 85%

DynamoLLM: Designing LLM Inference Clusters for Performance and Energy Efficiency

Jovan Stojkovic, Chaojie Zhang, Íñigo Goiri, Josep Torrellas, Esha Choukse

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Azure Research - Systems(微软Azure研究-系统)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23324 2025-09-30 cs.DC cs.AI 85%

Scaling LLM Test-Time Compute with Mobile NPU on Smartphones

Zixu Hao, Jianyu Wei, Tuowei Wang, Minxing Huang, Huiqiang Jiang, Shiqi Jiang, Ting Cao, Ju Ren

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07274 2025-09-30 cs.LG 85%

Cache-Efficient Posterior Sampling for Reinforcement Learning with LLM-Derived Priors Across Discrete and Continuous Domains

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(计算机科学系,爱荷华州立大学) Department of Civil, Construction and Environmental Engineering, Iowa State University, Ames, IA, USA(土木、建设与环境工程系,爱荷华州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11343 2025-09-26 cs.CL 85%

From Replication to Redesign: Exploring Pairwise Comparisons for LLM-Based Peer Review

Yaohui Zhang, Haijing Zhang, Wenlong Ji, Tianyu Hua, Nick Haber, Hancheng Cao, Weixin Liang

机构 * Stanford University(斯坦福大学) Emory University(埃默里大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18886 2025-09-24 cs.PF cs.AR cs.CR cs.LG 85%

Confidential LLM Inference: Performance and Cost Across CPU and GPU TEEs

Marcin Chrapek, Marcin Copik, Etienne Mettaz, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18607 2025-09-24 cs.LG 85%

Reflect before Act: Proactive Error Correction in Language Models

Qiuhai Zeng, Sarvesh Rajkumar, Di Wang, Narendra Gyanchandani, Wenbo Yan

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09996 2025-09-23 cs.CL cs.CY 85%

From Judgment to Interference: Early Stopping LLM Harmful Outputs via Streaming Content Monitoring

Yang Li, Qiang Sheng, Yehan Yang, Xueyao Zhang, Juan Cao

机构 * Yang Li Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所、中国科学院大学) Qiang Sheng Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所) Yehan Yang Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所) Xueyao Zhang The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Juan Cao Media Synthesis and Forensics Lab, Institute of Computing Technology, Chinese Academy of Sciences University of Chinese Academy of Sciences(中国科学院计算技术研究所、中国科学院自动化研究所、中国科学院大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments NeurIPS 2025 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16443 2025-09-23 physics.app-ph cs.AI cs.PL 85%

LightCode: Compiling LLM Inference for Photonic-Electronic Systems

Ryan Tomich, Zhizhen Zhong, Dirk Englund

机构 * Research Laboratory of Electronics, Massachusetts Institute of Technology(麻省理工学院电子研究实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16442 2025-09-23 cs.IR cs.CL 85%

Evaluating the Effectiveness and Scalability of LLM-Based Data Augmentation for Retrieval

Pranjal A. Chitale, Bishal Santra, Yashoteja Prabhu, Amit Sharma

机构 * Microsoft Research India(微软研究院印度分部)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 (MAIN Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14680 2025-09-19 cs.MA cs.LG 85%

LEED: A Highly Efficient and Scalable LLM-Empowered Expert Demonstrations Framework for Multi-Agent Reinforcement Learning

Tianyang Duan, Zongyuan Zhang, Songxiao Guo, Dong Huang, Yuanye Zhao, Zheng Lin, Zihan Fang, Dianxin Luan, Heming Cui, Yong Cui

机构 * Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) College of International Education, Hebei University of Economics and Business(河北经贸大学国际教育学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电子与电气工程系) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Institute for Imaging, Data and Communications, University of Edinburgh(爱丁堡大学成像、数据与通讯研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏