arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2509.25853 2025-10-01 cs.AR 85%

SAIL: SRAM-Accelerated LLM Inference System with Lookup-Table-based GEMV

Jingyao Zhang, Jaewoo Park, Jongeun Lee, Elaheh Sadredini

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00970 2025-09-30 cs.CL cs.AI cs.LG 85%

SentenceKV: Efficient LLM Inference via Sentence-Level Semantic KV Caching

Yuxuan Zhu, Ali Falahati, David H. Yang, Mohammad Mohammadi Amiri

机构 * Department of Computer Science Rensselaer Polytechnic Institute(计算机科学系,罗切斯特理工学院) Department of Computer Science University of Waterloo(计算机科学系,滑铁卢大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22062 2025-09-29 cs.SD eess.AS 85%

Comprehend and Talk: Text to Speech Synthesis via Dual Language Modeling

Junjie Cao, Yichen Han, Ruonan Zhang, Xiaoyang Hao, Hongxiang Li, Shuaijiang Zhao, Yue Liu, Xiao-Ping Zhng

机构 * Tsinghua University(清华大学) Peking University(北京大学) AMAP Speech(AMAP语音)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments conference paper about TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15524 2025-09-26 cs.DC 85%

HydraServe: Minimizing Cold Start Latency for Serverless LLM Serving in Public Clouds

Chiheng Lou, Sheng Qi, Chao Jin, Dapeng Nie, Haoran Yang, Yu Ding, Xuanzhe Liu, Xin Jin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by NSDI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18056 2025-09-26 cs.IR 85%

RL-based Query Rewriting with Distilled LLM for online E-Commerce Systems

Duy A. Nguyen, Rishi Kesav Mohan, Van Yang, Pritom Saha Akash, Kevin Chen-Chuan Chang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13739 2025-09-25 cs.CV 85%

Enhancing Targeted Adversarial Attacks on Large Vision-Language Models via Intermediate Projector

Yiming Cao, Yanjie Li, Kaisheng Liang, Bin Xiao

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04931 2025-09-25 cs.CV 85%

Long Video Understanding with Learnable Retrieval in Video-Language Models

Jiaqi Xu, Cuiling Lan, Wenxuan Xie, Xuejin Chen, Yan Lu

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted by IEEE Transactions on Multimedia (TMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23817 2025-09-24 cs.AR cs.DC 85%

MVDRAM: Enabling GeMV Execution in Unmodified DRAM for Low-Bit LLM Acceleration

Tatsuya Kubo, Daichi Tokuda, Tomoya Nagatani, Masayuki Usui, Lei Qu, Ting Cao, Shinya Takamaeda-Yamazaki

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01606 2025-09-23 cs.CL cs.AI cs.CY cs.LG 85%

Beyond Prompting: An Efficient Embedding Framework for Open-Domain Question Answering

Zhanghao Hu, Hanqi Yan, Qinglin Zhu, Zhenyi Shen, Yulan He, Lin Gui

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 效率与部署 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted in ACL 2025 Main, Project link: https://zhanghao-acl25-embqa.github.io/ACL2025-EmbQA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14781 2025-09-19 cs.AR 85%

LEAP: LLM Inference on Scalable PIM-NoC Architecture with Balanced Dataflow and Fine-Grained Parallelism

Yimin Wang, Yue Jiet Chong, Xuanyao Fong

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted to the 2025 International Conference on Computer-Aided Design (ICCAD'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13942 2025-09-18 cs.SE 85%

Evaluating Classical Software Process Models as Coordination Mechanisms for LLM-Based Software Generation

Duc Minh Ha, Phu Trac Kien, Tho Quan, Anh Nguyen-Duc

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13765 2025-09-18 cs.AR 85%

TENET: An Efficient Sparsity-Aware LUT-Centric Architecture for Ternary LLM Inference On Edge

Zhirui Huang, Rui Ma, Shijie Cao, Ran Shu, Ian Wang, Ting Cao, Chixiao Chen, Yongqiang Xiong

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13710 2025-09-18 cs.AR 85%

CompAir: Synergizing Complementary PIMs and In-Transit NoC Computation for Efficient LLM Acceleration

Hongyi Li, Songchen Ma, Huanyu Qu, Weihao Zhang, Jia Chen, Junfeng Lin, Fengbin Tu, Rong Zhao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13514 2025-09-18 cs.CR 85%

AQUA-LLM: Evaluating Accuracy, Quantization, and Adversarial Robustness Trade-offs in LLMs for Cybersecurity Question Answering

Onat Gungor, Roshan Sood, Harold Wang, Tajana Rosing

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by the 24th IEEE International Conference on Machine Learning and Applications (ICMLA'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10259 2025-09-17 cs.DC cs.NI 85%

Temporal-Aware GPU Resource Allocation for Distributed LLM Inference via Reinforcement Learning

Chengze Du, Zhiwei Yu, Heng Xu, Haojie Wang, Bo liu, Jialong Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08523 2025-09-17 cs.SE 85%

InferLog: Accelerating LLM Inference for Online Log Parsing via ICL-oriented Prefix Caching

Yilun Wang, Pengfei Chen, Haiyu Huang, Zilong He, Gou Tan, Chuanfu Zhang, Jingkai He, Zibin Zheng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by ICSE '26 (The 48th IEEE/ACM International Conference on Software Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11524 2025-09-16 cs.IR 85%

Decoding in Latent Spaces for Efficient Inference in LLM-based Recommendation

Chengbing Wang, Yang Zhang, Zhicheng Wang, Tianhao Shi, Keqin Bao, Fuli Feng, Tat-Seng Chua

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted for publication in EMNLP'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10372 2025-09-15 cs.AR 85%

MCBP: A Memory-Compute Efficient LLM Inference Accelerator Leveraging Bit-Slice-enabled Sparsity and Repetitiveness

Huizheng Wang, Zichuan Wang, Zhiheng Yue, Yousheng Long, Taiquan Wei, Jianxun Yang, Yang Wang, Chao Li, Shaojun Wei, Yang Hu, Shouyi Yin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09801 2025-09-15 cs.CL cs.AI cs.LG 85%

HEFT: A Coarse-to-Fine Hierarchy for Enhancing the Efficiency and Accuracy of Language Model Reasoning

Brennen Hill

机构 * Department of Computer Science University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02992 2025-09-15 cs.IR cs.CV 85%

Efficient and Effective Adaptation of Multimodal Foundation Models in Sequential Recommendation

Junchen Fu, Xuri Ge, Xin Xin, Alexandros Karatzoglou, Ioannis Arapakis, Kaiwen Zheng, Yongxin Ni, Joemon M. Jose

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院) Amazon(亚马逊) Telefonica Scientific Research(Telefonica科学研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by IEEE Transactions on Knowledge and Data Engineering (TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10059 2025-09-04 cs.SE 85%

CodeGrad: Integrating Multi-Step Verification with Gradient-Based LLM Refinement

Yueke Zhang, Yifan Zhang, Kevin Leach, Yu Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 6 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06463 2025-09-04 cs.SE 85%

Evaluating Efficiency and Novelty of LLM-Generated Code for Graph Analysis

Atieh Barati Nia, Mohammad Dindoost, David A. Bader

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 7 pages, v2: minor revision to match final paper published in the The 29th Annual IEEE High Performance Extreme Computing Conference (HPEC), Virtual, September 15-19, 2025. Outstanding Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02540 2025-09-03 eess.SP 85%

LLM-Enhanced Space-Air-Ground-Sea Integrated Networks

Halvin Yang, Sangarapillai Lambotharan, Mahsa Derakhshani, Lajos Hanzo

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 6 figures, 7 pages, magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19504 2025-08-28 cs.MA cs.DC 85%

Aegis: Taxonomy and Optimizations for Overcoming Agent-Environment Failures in LLM Agents

Kevin Song, Anand Jayarajan, Yaoyao Ding, Qidong Su, Zhanda Zhu, Sihang Liu, Gennady Pekhimenko

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18089 2025-08-26 cs.SE 85%

LLM-Guided Genetic Improvement: Envisioning Semantic Aware Automated Software Evolution

Karine Even-Mendoza, Alexander Brownlee, Alina Geiger, Carol Hanna, Justyna Petke, Federica Sarro, Dominik Sobania

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17720 2025-08-26 cs.SE 85%

RepoTransAgent: Multi-Agent LLM Framework for Repository-Aware Code Translation

Ziqi Guan, Xin Yin, Zhiyuan Peng, Chao Ni

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16684 2025-08-26 cs.SE cs.HC 85%

Democratizing AI Development: Local LLM Deployment for India's Developer Ecosystem in the Era of Tokenized APIs

Vikranth Udandarao, Nipun Misra

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments for survey results, check https://docs.google.com/spreadsheets/d/1t0eV9oURaiu2HfARWo6sriBO0eC8bHUyZNN7CgK2NAk/edit?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16449 2025-08-25 cs.PF 85%

GreenLLM: SLO-Aware Dynamic Frequency Scaling for Energy-Efficient LLM Serving

Qunyou Liu, Darong Huang, Marina Zapater, David Atienza

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15243 2025-08-22 cs.CV 85%

Comp-X: On Defining an Interactive Learned Image Compression Paradigm With Expert-driven LLM Agent

Yixin Gao, Xin Li, Xiaohan Pan, Runsen Feng, Bingchen Li, Yunpeng Qi, Yiting Lu, Zhengxue Cheng, Zhibo Chen, Jörn Ostermann

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13114 2025-08-19 cs.SE 85%

Understanding LLM-Centric Challenges for Deep Learning Frameworks: An Empirical Analysis

Yanzhou Mu, Rong Wang, Juan Zhai, Chunrong Fang, Xiang Chen, Jiacong Wu, An Guo, Jiawei Shen, Bingzhuo Li, Zhenyu Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 46 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏