arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2504.07494 2025-04-11 cs.LG 85%

Apt-Serve: Adaptive Request Scheduling on Hybrid Cache for Scalable LLM Inference Serving

Shihong Gao, Xin Zhang, Yanyan Shen, Lei Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06823 2025-04-10 cs.CL 85%

Open Problems and a Hypothetical Path Forward in LLM Knowledge Paradigms

Xiaotian Ye, Mengqi Zhang, Shu Wu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments Blog post preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05821 2025-04-10 cs.LG cs.DB 85%

Optimizing LLM Queries in Relational Data Analytics Workloads

Shu Liu, Asim Biswal, Amog Kamsetty, Audrey Cheng, Luis Gaspar Schroeder, Liana Patel, Shiyi Cao, Xiangxi Mo, Ion Stoica, Joseph E. Gonzalez, Matei Zaharia

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02877 2025-04-07 cs.CL 85%

Revisiting Funnel Transformers for Modern LLM Architectures with Comprehensive Ablations in Training and Inference Configurations

DongHyun Choi, Lucas Spangher, Chris Hidey, Peter Grabowski, Ramy Eskander

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01994 2025-04-04 cs.AR cs.AI 85%

PIM-LLM: A High-Throughput Hybrid PIM Architecture for 1-bit LLMs

Jinendra Malekar, Peyton Chandarana, Md Hasibul Amin, Mohammed E. Elbtity, Ramtin Zand

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00341 2025-04-02 cs.CR cs.AI cs.SY eess.SY 85%

Integrated LLM-Based Intrusion Detection with Secure Slicing xApp for Securing O-RAN-Enabled Wireless Network Deployments

Joshua Moore, Aly Sabri Abdalla, Prabesh Khanal, Vuk Marojevic

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments This article has been accepted for publication in the IEEE 2025 International Conference on Communications (ICC2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00002 2025-04-02 cs.PF cs.AI cs.HC cs.NI 85%

Are We There Yet? A Measurement Study of Efficiency for LLM Applications on Mobile Devices

Xiao Yan, Yi Ding

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23361 2025-04-01 cs.CL 85%

Discovering Knowledge Deficiencies of Language Models on Massive Knowledge Base

Linxin Song, Xuwei Ding, Jieyu Zhang, Taiwei Shi, Ryotaro Shimizu, Rahul Gupta, Yang Liu, Jian Kang, Jieyu Zhao

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17922 2025-03-28 cs.CL 85%

WindowKV: Task-Adaptive Group-Wise KV Cache Window Selection for Efficient LLM Inference

Youhui Zuo, Sibo Wei, Chen Zhang, Zhuorui Liu, Wenpeng Lu, Dawei Song

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20552 2025-03-27 cs.DC cs.LG 85%

Injecting Adrenaline into LLM Serving: Boosting Resource Utilization and Throughput via Attention Disaggregation

Yunkai Liang, Zhangyu Chen, Pengfei Zuo, Zhi Zhou, Xu Chen, Zhou Yu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments 14 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19090 2025-03-26 cs.CL 85%

LLM-Based Insight Extraction for Contact Center Analytics and Cost-Efficient Deployment

Varsha Embar, Ritvik Shrivastava, Vinay Damodaran, Travis Mehlinger, Yu-Chung Hsiao, Karthik Raghunathan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13773 2025-03-26 cs.CL 85%

Mitigating KV Cache Competition to Enhance User Experience in LLM Inference

Haiying Shen, Tanmoy Sen, Masahiro Tanaka

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00088 2025-03-26 cs.DC cs.AI 85%

T-MAC: CPU Renaissance via Table Lookup for Low-Bit LLM Deployment on Edge

Jianyu Wei, Shijie Cao, Ting Cao, Lingxiao Ma, Lei Wang, Yanyong Zhang, Mao Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments EuroSys 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16893 2025-03-24 cs.DC cs.LG 85%

Improving the End-to-End Efficiency of Offline Inference for Multi-LLM Applications Based on Sampling and Simulation

Jingzhi Fang, Yanyan Shen, Yue Wang, Lei Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11006 2025-03-24 cs.DC cs.AI cs.PF cs.SE 85%

GREEN-CODE: Learning to Optimize Energy Efficiency in LLM-based Code Generation

Shashikant Ilager, Lukas Florian Briem, Ivona Brandic

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Under submission in ACM/IEEE conference, 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19509 2025-03-24 cs.CV cs.AI 85%

MBQ: Modality-Balanced Quantization for Large Vision-Language Models

Shiyao Li, Yingchun Hu, Xuefei Ning, Xihui Liu, Ke Hong, Xiaotao Jia, Xiuhong Li, Yaqi Yan, Pei Ran, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15655 2025-03-21 cs.AI 85%

R$^2$: A LLM Based Novel-to-Screenplay Generation Framework with Causal Plot Graphs

Zefeng Lin, Yi Xiao, Zhiqiang Mo, Qifan Zhang, Jie Wang, Jiayang Chen, Jiajing Zhang, Hui Zhang, Zhengyi Liu, Xianyong Fang, Xiaohua Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04425 2025-03-21 cs.CL 85%

DELIFT: Data Efficient Language model Instruction Fine Tuning

Ishika Agarwal, Krishnateja Killamsetty, Lucian Popa, Marina Danilevksy

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14932 2025-03-20 cs.CR cs.DC cs.LG 85%

Prada: Black-Box LLM Adaptation with Private Data on Resource-Constrained Devices

Ziyao Wang, Yexiao He, Zheyu Shen, Yu Li, Guoheng Sun, Myungjin Lee, Ang Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13737 2025-03-19 cs.CL 85%

AccelGen: Heterogeneous SLO-Guaranteed High-Throughput LLM Inference Serving for Diverse Applications

Haiying Shen, Tanmoy Sen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03834 2025-03-18 cs.AI 85%

GraphRouter: A Graph-based Router for LLM Selections

Tao Feng, Yanzhen Shen, Jiaxuan You

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08704 2025-03-13 cs.CR cs.AI 85%

Life-Cycle Routing Vulnerabilities of LLM Router

Qiqi Lin, Xiaoyang Ji, Shengfang Zhai, Qingni Shen, Zhi Zhang, Yuejian Fang, Yansong Gao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08323 2025-03-12 cs.CL 85%

Towards Scalable and Cross-Lingual Specialist Language Models for Oncology

Morteza Rohanian, Tarun Mehra, Nicola Miglino, Farhad Nooralahzadeh, Michael Krauthammer, Andreas Wicki

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06433 2025-03-11 cs.DC cs.AI 85%

Seesaw: High-throughput LLM Inference via Model Re-sharding

Qidong Su, Wei Zhao, Xin Li, Muralidhar Andoorveedu, Chenhao Jiang, Zhanda Zhu, Kevin Song, Christina Giannoula, Gennady Pekhimenko

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10340 2025-03-10 cs.RO cs.AI 85%

On the Vulnerability of LLM/VLM-Controlled Robotics

Xiyang Wu, Souradip Chakraborty, Ruiqi Xian, Jing Liang, Tianrui Guan, Fuxiao Liu, Brian M. Sadler, Dinesh Manocha, Amrit Singh Bedi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04611 2025-03-07 cs.CL 85%

Towards Data-Efficient Language Models: A Child-Inspired Approach to Language Learning

Mohammad Amin Ghanizadeh, Mohammad Javad Dousti

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01704 2025-03-04 cs.LG 85%

DILEMMA: Joint LLM Quantization and Distributed LLM Inference Over Edge Computing Systems

Minoo Hosseinzadeh, Hana Khamfroush

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04671 2025-03-04 cs.HC cs.AI 85%

CUIfy the XR: An Open-Source Package to Embed LLM-powered Conversational Agents in XR

Kadir Burak Buldu, Süleyman Özdel, Ka Hei Carrie Lau, Mengdi Wang, Daniel Saad, Sofie Schönborn, Auxane Boch, Enkelejda Kasneci, Efe Bozkir

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

Comments 7th IEEE International Conference on Artificial Intelligence & eXtended and Virtual Reality (IEEE AIxVR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07295 2025-03-04 cs.SE cs.LG cs.PL 85%

IterGen: Iterative Semantic-aware Structured LLM Generation with Backtracking

Shubham Ugare, Rohan Gumaste, Tarun Suresh, Gagandeep Singh, Sasa Misailovic

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Accepted at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09044 2025-03-04 cs.CL 85%

MiLoRA: Harnessing Minor Singular Components for Parameter-Efficient LLM Finetuning

Hanqing Wang, Yixia Li, Shuo Wang, Guanhua Chen, Yun Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments This paper has been accepted at NAACL 2025. Code is available at: https://github.com/sufenlp/MiLoRA

详情

展开后加载摘要…

URL PDF HTML 收藏