Dcc --help: Generating Context-Aware Compiler Error Explanations with Large Language Models
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
Comments 7 pages, 2 figures. Accepted in SIGCSE'24
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
Comments 7 pages, 2 figures. Accepted in SIGCSE'24
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments 21 pages, 5 figures, EMNLP 2023 main conference
专题命中 效率与部署 :LLM(title,abstract);prompting(title);large language model(abstract);language model(abstract)
Comments Long Paper at Empirical Methods in Natural Language Processing (EMNLP) 2023
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments EMNLP 2023. arXiv admin note: substantial text overlap with arXiv:2304.12102; text overlap with arXiv:2303.11076 by other authors
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG
Comments SOSP 2023
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
Comments 3 pages, published in RNAAS
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments 14 pages, 8 figures. See https://star-uu-wang.github.io/WALL-E/
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments 15 pages; 9 figures; Our code is available at https://lichang-chen.github.io/InstructZero/
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments Accepted by ITSC 2023
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
专题命中 效率与部署 :language model(title,abstract);large language model(title);pretraining(abstract);prompting(abstract)
专题命中 效率与部署 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ACL 2024 Workshop Towards Knowledgeable Language Models
专题命中 效率与部署 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments 34 pages, 10 figures, published as conference paper at ICLR 2024, and accepted to the Socially Responsible Language Modelling Research (SoLaR) workshop at NeurIPS 2023
相同事实,不同更新:推理设置塑造医疗分配场景下大语言模型的行为
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究发现,在医疗资源分配场景中,大语言模型的推理设置会导致其对相同患者信息产生不同的资源分配概率,凸显了谨慎将LLM系统纳入决策的重要性。
Comments Accepted to the AI4GOOD Workshop at ICML 2026, Seoul, South Korea
OBCache: 面向高效长上下文LLM推理的最优脑KV缓存剪枝
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出OBCache框架,将缓存驱逐形式化为逐层结构化剪枝问题,基于最优脑损伤理论量化令牌显著性,通过输出感知分数改进现有驱逐策略,在长上下文任务中提升准确性。
Comments ICML 2026
周期性异步性:一种用于加速大语言模型强化学习的在线策略方法
机构 * Big Data & AI Lab(大数据与人工智能实验室)
专题命中 效率与部署 :LLM(title,summary_cn);post-training(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种周期性异步框架,通过分离推理与训练部署,提升LLM强化学习的训练效率,采用统一三模型架构和共享提示注意力机制,实现高效异步执行并减少冗余计算,实验显示在NPU平台实现约2倍的吞吐量提升。
超越简单提示:改进LLMs上下文辅助预测的策略
专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出四种策略,从模型诊断、准确性和效率三个正交维度改进LLMs的上下文辅助预测,通过广泛实验揭示执行差距、性能提升和成本降低的解决方案。
Comments Published at TMLR - OpenReview link: https://openreview.net/forum?id=dkjHHFJkVI
BaseRT: 通过原生Metal在Apple Silicon上实现最佳LLM推理
机构 * Base Compute, Melbourne, Australia(Base Compute,墨尔本,澳大利亚)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出基于原生Metal的推理运行时BaseRT,通过芯片特定内核融合、统一内存感知优化和自定义调度逻辑,在Apple Silicon上实现最高推理吞吐量,相比现有框架提升高达1.56倍解码吞吐量。
校准引导的LLM压缩中输出空间分配成本的实证研究
机构 * Analemma
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究ROCKET方法中分配成本与输出空间目标对齐对压缩模型保真度的影响,发现存在准确率-困惑度权衡,且成本函数影响随压缩率降低而减弱。
SharQ:桥接激活稀疏性与FP4量化用于LLM推理
机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出SharQ方法,通过在线稀疏-稠密分解结合N:M稀疏性与FP4量化,无需训练即可恢复NVFP4与FP16之间43-63%的精度差距,并在RTX 5090上实现2.2-2.4倍延迟降低。
Comments 20 pages, 4 figures
SplitZip:超快无损KV压缩用于解耦的大语言模型服务
机构 * University of Notre Dame IN, USA(诺丁汉大学)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。
Sentinel: 通过注意力探测解码上下文利用以实现高效LLM上下文压缩
机构 * Ping An Technology (Shenzhen) Co., Ltd., China(平安科技(深圳)有限公司,中国) ; University of Science and Technology of China(中国科学技术大学) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 提出Sentinel,一种轻量级句子级压缩框架,通过冻结LLM的头部注意力模式解码推理时上下文利用行为,使用单次非自回归前向传递实现压缩,在LongBench上以0.5B代理模型达到5倍压缩且性能与7B模型方法相当。
Comments Preprint