arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22405 篇

2308.11873 2023-10-17 cs.SE cs.LG cs.PL 89%

Dcc --help: Generating Context-Aware Compiler Error Explanations with Large Language Models

Andrew Taylor, Alexandra Vassar, Jake Renzella, Hammond Pearce

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 7 pages, 2 figures. Accepted in SIGCSE'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12870 2023-10-17 cs.CL 89%

Lion: Adversarial Distillation of Proprietary Large Language Models

Yuxin Jiang, Chunkit Chan, Mingyang Chen, Wei Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 21 pages, 5 figures, EMNLP 2023 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00807 2023-10-16 cs.IR cs.CL 89%

UDAPDR: Unsupervised Domain Adaptation via LLM Prompting and Distillation of Rerankers

Jon Saad-Falcon, Omar Khattab, Keshav Santhanam, Radu Florian, Martin Franz, Salim Roukos, Avirup Sil, Md Arafat Sultan, Christopher Potts

专题命中 效率与部署 :LLM(title,abstract);prompting(title);large language model(abstract);language model(abstract)

Comments Long Paper at Empirical Methods in Natural Language Processing (EMNLP) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06201 2023-10-11 cs.CL 89%

Compressing Context to Enhance Inference Efficiency of Large Language Models

Yucheng Li, Bo Dong, Chenghua Lin, Frank Guerin

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP 2023. arXiv admin note: substantial text overlap with arXiv:2304.12102; text overlap with arXiv:2303.11076 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03003 2023-10-05 cs.CL cs.DC 89%

From Words to Watts: Benchmarking the Energy Costs of Large Language Model Inference

Siddharth Samsi, Dan Zhao, Joseph McDonald, Baolin Li, Adam Michaleas, Michael Jones, William Bergeron, Jeremy Kepner, Devesh Tiwari, Vijay Gadepally

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16976 2023-10-02 cs.LG cs.DC 89%

Benchmarking and In-depth Performance Study of Large Language Models on Habana Gaudi Processors

Chengming Zhang, Baixi Sun, Xiaodong Yu, Zhen Xie, Weijian Zheng, Kamil Iskra, Pete Beckman, Dingwen Tao

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06180 2023-09-13 cs.LG cs.DC 89%

Efficient Memory Management for Large Language Model Serving with PagedAttention

Woosuk Kwon, Zhuohan Li, Siyuan Zhuang, Ying Sheng, Lianmin Zheng, Cody Hao Yu, Joseph E. Gonzalez, Hao Zhang, Ion Stoica

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments SOSP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05406 2023-09-13 cs.CL astro-ph.GA astro-ph.IM 89%

Galactic ChitChat: Using Large Language Models to Converse with Astronomy Literature

Ioana Ciucă, Yuan-Sen Ting

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 3 pages, published in RNAAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04725 2023-09-12 cs.CL 89%

EPA: Easy Prompt Augmentation on Large Language Models via Multiple Sources and Multiple Targets

Hongyuan Lu, Wai Lam

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.04255 2023-09-11 cs.NI cs.AI 89%

LLMCad: Fast and Scalable On-device Large Language Model Inference

Daliang Xu, Wangsong Yin, Xin Jin, Ying Zhang, Shiyun Wei, Mengwei Xu, Xuanzhe Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.15962 2023-09-01 cs.RO cs.AI 89%

WALL-E: Embodied Robotic WAiter Load Lifting with Large Language Model

Tianyu Wang, Yifan Li, Haitao Lin, Xiangyang Xue, Yanwei Fu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 14 pages, 8 figures. See https://star-uu-wang.github.io/WALL-E/

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.03082 2023-08-09 cs.AI 89%

InstructZero: Efficient Instruction Optimization for Black-Box Large Language Models

Lichang Chen, Jiuhai Chen, Tom Goldstein, Heng Huang, Tianyi Zhou

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 15 pages; 9 figures; Our code is available at https://lichang-chen.github.io/InstructZero/

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03558 2023-08-08 cs.CR cs.CL 89%

Mondrian: Prompt Abstraction Attack Against Large Language Models for Cheaper API Pricing

Wai Man Si, Michael Backes, Yang Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.11769 2023-07-25 cs.CL 89%

Domain Knowledge Distillation from Large Language Model: An Empirical Study in the Autonomous Driving Domain

Yun Tang, Antonio A. Bruto da Costa, Jason Zhang, Irvine Patrick, Siddartha Khastgir, Paul Jennings

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ITSC 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.10348 2023-07-21 cs.SE cs.LG cs.PL 89%

Code Detection for Hardware Acceleration Using Large Language Models

Pablo Antonio Martínez, Gregorio Bernabé, José Manuel García

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.08225 2023-07-18 cs.DB cs.AI cs.DC 89%

Harnessing Scalable Transactional Stream Processing for Managing Large Language Models [Vision]

Shuhao Zhang, Xianzhi Zeng, Yuhao Wu, Zhonghao Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00524 2023-07-04 cs.CL 89%

Large Language Models Enable Few-Shot Clustering

Vijay Viswanathan, Kiril Gashteovski, Carolin Lawrence, Tongshuang Wu, Graham Neubig

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13986 2023-06-27 cs.CL 89%

Large Language Models as Sous Chefs: Revising Recipes with GPT-3

Alyssa Hwang, Bryan Li, Zhaoyi Hou, Dan Roth

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03509 2022-07-11 cs.CL 89%

Meta-Learning the Difference: Preparing Large Language Models for Efficient Adaptation

Zejiang Hou, Julian Salazar, George Polovets

专题命中 效率与部署 :language model(title,abstract);large language model(title);pretraining(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11539 2024-08-02 cs.AI cs.CL cs.LG 89%

KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs

Shangshang Zheng, He Bai, Yizhe Zhang, Yi Su, Xiaochuan Niu, Navdeep Jaitly

专题命中 效率与部署 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ACL 2024 Workshop Towards Knowledgeable Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13628 2024-03-29 cs.LG cs.AI cs.CL 89%

Prompt Risk Control: A Rigorous Framework for Responsible Deployment of Large Language Models

Thomas P. Zollo, Todd Morrill, Zhun Deng, Jake C. Snell, Toniann Pitassi, Richard Zemel

专题命中 效率与部署 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 34 pages, 10 figures, published as conference paper at ICLR 2024, and accepted to the Socially Responsible Language Modelling Research (SoLaR) workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18108 2026-08-20 cs.CL cs.AI cs.HC cs.MA 新提交 89%

Same Facts, Different Updates: Inference Setup Shapes LLM Behavior in Medical Allocation

相同事实,不同更新:推理设置塑造医疗分配场景下大语言模型的行为

Spencer Gibson, Tyler Crosse, Magnus Saebo, Achyutha Menon, Eyon Jang, Diogo Cruz

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,在医疗资源分配场景中,大语言模型的推理设置会导致其对相同患者信息产生不同的资源分配概率,凸显了谨慎将LLM系统纳入决策的重要性。

Comments Accepted to the AI4GOOD Workshop at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07651 2026-08-11 cs.CL cs.AI 版本更新 89%

OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference

OBCache: 面向高效长上下文LLM推理的最优脑KV缓存剪枝

Yuzhe Gu, Xiyu Liang, Jiaojiao Zhao, Enmao Diao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OBCache框架,将缓存驱逐形式化为逐层结构化剪枝问题,基于最优脑损伤理论量化令牌显著性,通过输出感知分数改进现有驱逐策略,在长上下文任务中提升准确性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18871 2026-08-10 cs.LG cs.AI 89%

Periodic Asynchrony: An On-Policy Approach for Accelerating LLM Reinforcement Learning

周期性异步性:一种用于加速大语言模型强化学习的在线策略方法

Jian Lu, Yi Luo

机构 * Big Data & AI Lab(大数据与人工智能实验室)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种周期性异步框架,通过分离推理与训练部署,提升LLM强化学习的训练效率,采用统一三模型架构和共享提示注意力机制,实现高效异步执行并减少冗余计算,实验显示在NPU平台实现约2倍的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09904 2026-07-14 cs.LG cs.AI 版本更新 89%

Beyond Naïve Prompting: Strategies for Improved Context-aided Forecasting with LLMs

超越简单提示:改进LLMs上下文辅助预测的策略

Arjun Ashok, Andrew Robert Williams, Vincent Zhihao Zheng, Irina Rish, Nicolas Chapados, Étienne Marcotte, Valentina Zantedeschi, Alexandre Drouin

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出四种策略,从模型诊断、准确性和效率三个正交维度改进LLMs的上下文辅助预测,通过广泛实验揭示执行差距、性能提升和成本降低的解决方案。

Comments Published at TMLR - OpenReview link: https://openreview.net/forum?id=dkjHHFJkVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00501 2026-07-02 cs.CL cs.AI cs.PF 新提交 89%

BaseRT: Best-in-Class LLM Inference on Apple Silicon via Native Metal

BaseRT: 通过原生Metal在Apple Silicon上实现最佳LLM推理

Prabod Rathnayaka, Fabian Waschkowski, Lukas Wesemann

机构 * Base Compute, Melbourne, Australia(Base Compute,墨尔本,澳大利亚)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于原生Metal的推理运行时BaseRT,通过芯片特定内核融合、统一内存感知优化和自定义调度逻辑,在Apple Silicon上实现最高推理吞吐量,相比现有框架提升高达1.56倍解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27785 2026-06-29 cs.CL cs.AI 新提交 89%

Output-Space Allocation Costs for Calibration-Guided LLM Compression: An Empirical Study

校准引导的LLM压缩中输出空间分配成本的实证研究

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao

机构 * Analemma

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究ROCKET方法中分配成本与输出空间目标对齐对压缩模型保真度的影响,发现存在准确率-困惑度权衡,且成本函数影响随压缩率降低而减弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26587 2026-06-26 cs.LG cs.AI 新提交 89%

SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

SharQ:桥接激活稀疏性与FP4量化用于LLM推理

Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Huaqing Zheng, Xindian Ma, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SharQ方法,通过在线稀疏-稠密分解结合N:M稀疏性与FP4量化,无需训练即可恢复NVFP4与FP16之间43-63%的精度差距,并在RTX 5090上实现2.2-2.4倍延迟降低。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01708 2026-06-25 cs.DC cs.AI cs.LG 版本更新 89%

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip:超快无损KV压缩用于解耦的大语言模型服务

Yipin Guo, Siddharth Joshi

机构 * University of Notre Dame IN, USA(诺丁汉大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23277 2026-06-15 cs.CL cs.AI 版本更新 89%

Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression

Sentinel: 通过注意力探测解码上下文利用以实现高效LLM上下文压缩

Yong Zhang, Heng Li, Yanwen Huang, Ning Cheng, Yang Guo, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao

机构 * Ping An Technology (Shenzhen) Co., Ltd., China(平安科技(深圳)有限公司,中国) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出Sentinel,一种轻量级句子级压缩框架,通过冻结LLM的头部注意力模式解码推理时上下文利用行为,使用单次非自回归前向传递实现压缩,在LongBench上以0.5B代理模型达到5倍压缩且性能与7B模型方法相当。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏