arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-09-01 至 2026-09-01 共收录 136 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 136 篇

2605.11222 2026-09-01 cs.LG 版本更新 93%

ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

ADMM-Q: 一种改进的基于Hessian的权重量化器用于大语言模型的后训练量化

Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder

机构 * MIT Operations Research Center(麻省理工学院运筹学中心) MIT Sloan School of Management(麻省理工学院斯隆管理学院) MIT Center for Statistics(麻省理工学院统计中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title,abstract);LLM(abstract,abstract_cn)

AI总结 ADMM-Q是一种新的权重量化算法,通过交替方向乘子法的组合变体,优化层间重建误差并逐步施加量化约束,提升大语言模型的压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04363 2026-09-01 cs.LG cs.CL 版本更新 92%

Amortizing intractable inference in large language models

摊销大型语言模型中难以处理的推理

Edward J. Hu, Moksh Jain, Eric Elmoznino, Younesse Kaddar, Guillaume Lajoie, Yoshua Bengio, Esmeralda S. Whitammer

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究针对大型语言模型的难以处理后验分布采样问题,提出用生成流网络(GFlowNets)的摊销贝叶斯推理方法微调LLM,可替代最大似然训练,还能高效适配需多步推理和工具使用的任务。

Comments ICLR 2024; 23 pages; code: this https URL (https://github.com/GFNOrg/gfn-lm-tuning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11468 2026-09-01 cs.SE 版本更新 92%

TRACE: Evaluating Execution Efficiency of LLM-Based Code Translation

TRACE: 评估基于LLM的代码翻译的执行效率

Zhihao Gong, Zeyu Sun, Dong Huang, Qingyuan Liang, Jie M. Zhang, Dan Hao

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出TRACE基准,评估LLM翻译代码的执行效率,发现正确性不等于效率,23.5%的正确翻译存在显著低效,提示需更关注效率评估。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27480 2026-09-01 q-bio.OT cs.AI cs.CY 版本更新 92%

BIRDS: Characterizing and Understanding Biodiversity Impact of Large Language Model Serving

BIRDS:表征与理解大语言模型服务对生物多样性的影响

Tianyao Shi, Yi Ding

机构 * Purdue University(普渡大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出BIRDS框架,通过定义请求级功能单元、量化运营与隐含生物多样性影响,并引入质量归一化生物多样性影响(QNBI),揭示大规模LLM服务对生态系统的累积影响及质量感知的服务权衡。

Comments 23 pages, 27 figures, 10 tables, the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP), Budapest, Hungary, October 24-29th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27786 2026-09-01 cs.LG cs.AI 版本更新 92%

Locality-Aware Redundancy Pruning for LLM Depth Compression

面向LLM深度压缩的局部感知冗余剪枝

Vincent-Daniel Yun, Youngrae Kim, Woosang Lim, YoungJin Heo, Minkyu Kim, Sunwoo Lee

机构 * University of Southern California(美国南加州大学) Neural Superintelligence Lab, MODULABS(MODULABS神经超级智能实验室) Seoul National University(首尔国立大学) Inha University(釜山大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LoRP,一种基于表示局部性的无训练单次深度剪枝框架,通过引入表示局部性分数(RLS)来识别和剪除冗余层,在多种LLM上提升了困惑度和下游任务准确率。

Comments EMNLP 2026 Main Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28042 2026-09-01 cs.CL cs.AI cs.LG 版本更新 92%

Extracting Small Translation Specialists from LLMs by Aggressively Pruning Experts

通过激进剪枝专家从LLM中提取小型翻译专家

Liu O. Martin, Lucas Bandarkar, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 效率与部署 :LLM(title_cn,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种从混合专家LLM中激进剪枝与翻译无关的专家,实现大幅压缩MoE块而不显著降低翻译质量的方法。

Comments EMNLP 2026, published at Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04445 2026-09-01 cs.NI cs.CL cs.PF 版本更新 92%

Dynamic Model Routing and Cascading for Efficient LLM Inference: A Survey

动态模型路由与级联用于高效LLM推理:综述

Yasmin Moslem, John D. Kelleher

机构 * ADAPT Centre(ADAPT中心) School of Computer Science & Statistics(计算机科学与统计学学院) Trinity College Dublin(都柏林三一学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文综述了多LLM路由与级联方法,分析了不同路由范式及关键权衡,提出框架揭示路由系统在决策时机、信息使用和计算方式上的特性,强调实际系统常整合多种范式以优化性能。

Comments Accepted by TMLR (2026). Work funded by ADAPT Centre, Trinity College Dublin, and Huawei Ireland

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30403 2026-09-01 cs.CR 新提交 91%

Why Are LLM Backdoor Defenses Fragmented? A Feature-Level Explanation with Sparse Autoencoders

为何LLM后门防御呈现碎片化?基于稀疏自编码器的特征级解释

Yizhe Zeng, Chenxu Niu, Wei Zhang, Hao Huang, Yunpeng Li, Dongxu Han, Dan Du, Cheng Hong, Hequn Xian, Yuling Liu

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究利用稀疏自编码器开展LLM后门的特征级机制分析,揭示脏标签与干净标签后门的编码差异,提出推理时特征钳位方法,可降低攻击成功率同时保留良性任务性能,解释了现有防御的碎片化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30731 2026-09-01 cs.CL cs.AI 新提交 91%

Calibrating Small Language Models for Claim Check-Worthiness Detection

校准小型语言模型以进行声明的核查价值检测

Pratuat Amatya, Venktesh Viswanathan, Vinay Setty

机构 * Factiverse AS(法克蒂弗斯公司) University of Stavanger(斯塔万格大学) Stockholm University(斯德哥尔摩大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 针对小型语言模型(SLMs)核查声明价值时的准确性与成本问题,提出轻量级校准方法NN-PPI,可使SLMs达到大型语言模型的准确性,大幅降低大规模核查的成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29305 2026-09-01 cs.CL cs.AI cs.LG 新提交 90%

Learning Simple Test-Time Environments for LLM Web Agents

为大型语言模型网页智能体学习简单的测试时环境

Junxuan Li, Zijun Liu, Ziyi Huang, Peng Li, Yuzhou Liu, Ming Yan, Yang Liu

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Dept. of Comp. Sci. & Tech., Tsinghua University(清华大学计算机科学与技术系) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子信息工程学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对LLM网页智能体在复杂真实环境中性能下降问题,提出测试时环境分解(TTED)方法,通过将复杂环境分解为子模块并利用子环境经验提升组合泛化能力,验证了其在合成与真实基准上的有效性。

Comments Code and data are released at this https URL (https://github.com/THUNLP-MT/TTED)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28592 2026-09-01 cs.AI 新提交 90%

A collective capability boundary in frontier large language models on guideline-conformant and case-specific oncology decision-making

前沿大语言模型在符合指南且针对具体病例的肿瘤决策中的集体能力边界

Zhang Sheng, Jinming Li, Wangyang Chen, Zhiwei Bao, Yu YoSean Wang

机构 * City University of Hong Kong(香港城市大学) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院) Affiliated Hangzhou First People’s Hospital, Westlake University School of Medicine(西湖大学医学院附属杭州市第一人民医院) Zhejiang University(浙江大学) Shaoxing Vocational & Technical College(绍兴职业技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究构建肿瘤决策边界基准评估9个前沿LLMs,发现其存在临床元判断盲点,需架构干预,模型质量非临床部署主瓶颈,需可检测自身能力边界并路由决策至临床医生的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01460 2026-09-01 cs.LG 版本更新 90%

Conformalized Large Language Models under Configuration Shift

配置偏移下的共形大语言模型

Yuqicheng Zhu, Jialin Yu, Lin Li, Gengyuan Zhang, Zhen Yang, Steffen Staab, Puneet Dokania, Philip Torr, Jie Tang, Evgeny Kharlamov

机构 * University of Stuttgart(斯图加特大学) Robert Bosch GmbH(罗伯特·博世有限公司) University of Oxford(牛津大学) LMU Munich(慕尼黑大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学) University of Oslo(奥斯陆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 该研究针对配置偏移对共形大语言模型有效性的影响展开系统分析,通过多维度实证研究揭示其削弱覆盖率的问题,提出两种实用缓解措施以恢复覆盖率并保留效率。

Comments Accepted to EMNLP 2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28667 2026-09-01 cs.CL cs.AI cs.PF 新提交 90%

GreenBench: Benchmarking Energy Efficiency and Carbon Footprint of Open-Source LLM Inference on Apple Silicon

GreenBench:针对Apple Silicon上开源大语言模型推理的能效与碳足迹的基准测试

Rajeswari Kannan, Raj Firke, Shreya Bengle, Srushti Deshmukh

机构 * Pimpri Chinchwad College of Engineering(平克里钦奇瓦德工程学院) Red Hat(红帽公司)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GreenBench基准框架,在Apple M4 Pro上测试开源LLM的能效等,发现其能效远高于数据中心GPU,确定了不同场景下的最优模型。

Comments 7 pages, 1 figure, 6 tables. Accepted at IEEE ICCUBEA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24945 2026-09-01 cs.LG cs.AI cs.DC 版本更新 90%

FAMPWQ: Fisher Information-based Adaptive Mixed Precision Weight Quantization for Effective LLM Inference

FAMPWQ:基于费舍尔信息的自适应混合精度权重量化方法,用于高效的大语言模型推理

Gongwei Lee, Ji Liu, Juncheng Jia, Ji Wu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Hithink Research(海思睿研究中心) Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM部署的资源瓶颈,该研究提出FAMPWQ方法,通过费舍尔信息度量层敏感度结合强化学习分配位宽,在7个模型和5个基准上优于7种基线方法,提升了量化性能。

Comments 21 pages, to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16391 2026-09-01 cs.LG cs.AI cs.DC 版本更新 90%

Kascade: A Practical Sparse Attention Method for Long-Context LLM Inference

Kascade:一种适用于长上下文LLM推理的实用稀疏注意力方法

Dhruv Deshmukh, Saurabh Goyal, Nipun Kwatra, Ramachandran Ramjee

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 Kascade是一种无需训练的稀疏注意力方法,通过锚定层计算Top-k索引并重用,实现长上下文LLM推理中的高效注意力处理。

Comments 11 pages, 8 figures, 3 tables and 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30932 2026-09-01 cs.AR 新提交 89%

Beacon: LLM Multi-Agent Driven Hardware Design Space Exploration for Heterogeneous Multi-Chiplet Deep Learning Accelerators

Beacon:面向异构多小芯片深度学习加速器的大语言模型多智能体驱动硬件设计空间探索

Boyu Li, Zongwei Zhu, Qianyue Cao, Xi Li, Xuehai Zhou

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 Beacon是一种报告驱动的LLM多智能体框架,用于异构多小芯片深度学习加速器的HW-DSE,可在有限迭代预算下将延迟-能耗-金钱成本的综合目标降低25.1%-93.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30509 2026-09-01 cs.AR 新提交 89%

CHIPSMORE: Compute-in-Interconnect and -Memory Chiplets for Multi-Mode Multi-Request LLM Inference Acceleration

CHIPSMORE:用于多模式多请求大语言模型推理加速的互连内及内存内小芯片

Yue Jiet Chong, Yimin Wang, Zhen Wu, Zixuan Wang, Wei Zhang, Xuanyao Fong

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 CHIPSMORE是一款集成互连内计算与CIM的LLM推理加速器,通过异构处理单元、分层KV内存、非复制多请求管道等设计,在Mistral-7B上较Nvidia H100实现2.38倍吞吐量与27倍能效提升,消除多请求权重复制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05238 2026-09-01 cs.SE 版本更新 89%

DeployBench: Benchmarking LLM Agents for Research Artifact Deployment

DeployBench: 用于研究工件部署的LLM智能体基准测试

Yuanli Wang, Yaoyao Qian, Yue Zhang, Hanhan Zhou, Jindan Huang, Tianfu Fu, Qiuyang Mang, Huanzhi Mao, Wenhao Chai, Wendong Fan, Liqiang Jing

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出DeployBench基准,包含51个跨领域的研究工件部署任务,评估LLM智能体在环境设置中的表现,发现主要失败原因是智能体过早停止且验证不充分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30505 2026-09-01 cs.LG cs.AI 新提交 89%

Tensor Methods for Language Models: From Token Representation to Training, Adaptation, Inference, Compression, and Interpretability

语言模型的张量方法:从词元表示到训练、适配、推理、压缩与可解释性

Matvei Tarasov, Salman Ahmadi-Asl, Andre L. F. de Almeida, Andrzej Cichocki

机构 * Innopolis University(因诺波利斯大学) Federal University of Ceará(塞阿拉联邦大学) Systems Research Institute of Polish Academy of Science(波兰科学院系统研究所) Warsaw University of Technology(华沙理工大学)

专题命中 效率与部署 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本综述以两种互补视角组织LLM的张量方法,提供统一符号与理论基础,分析Transformer组件的张量化策略,引入ρ_gap指标,为张量化语言模型提供结构化入门路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23986 2026-09-01 math.OC cs.AI cs.PF 版本更新 89%

The Shadow Price of Intelligence: Quality Degradation in LLM Inference as a Supply Chain Problem

智能的影子价格:作为供应链问题的大语言模型推理质量退化

Elioth Sanabria

机构 * Lehigh University - College of Business(里海大学商学院)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文将LLM推理质量退化视为供应链问题,建模拥塞下的服务分配,揭示节流的反直觉影响,提出影子价格可毫秒级计算最优策略,证明拥塞时节流是需求杠杆而非成本杠杆。

Comments 40 pages, 12 figures. Numerical instances calibrated to public benchmark data for five LLM providers

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30439 2026-09-01 cs.NE cs.LG 新提交 89%

Event-Driven Language Models with Sparse Neural Activity for Neuromorphic Hardware

面向神经形态硬件的、具有稀疏神经活动的事件驱动语言模型

Simon Richter, Ruhai Lin, Jason Yik, Taylor Kergan, Rui-Jie Zhu, Farshad Moradi, Jason Eshraghian

专题命中 效率与部署 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 该研究针对Transformer大语言模型推理的内存与计算瓶颈,提出在重度量化线性注意力模型中引入稀疏神经活动的方法,可提升神经形态平台的LLM部署性能,实现吞吐量与功耗的显著优化。

Comments 8 pages, 4 figures, Accepted at IEEE MCSOC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28726 2026-09-01 cs.AI 新提交 89%

Pro-Router: Token-Aware Progressive Model Routing with Adaptive Edge-Cloud Collaboration for Efficient Multimodal LLM Inference

Pro-Router:面向高效多模态大语言模型推理的、具备自适应边云协作的令牌感知渐进式模型路由方法

Xinyuan Gui, Shaowen Wang, Sheng Sun, Zijian Wang, Zishu Yu, Zheming Yang

机构 * Anyscale(安尼斯科尔公司) Mississippi State University(密西西比州立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of AI for Industries, Chinese Academy of Sciences(中国科学院产业人工智能研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 针对多模态大语言模型推理开销大的问题,提出具备自适应边云协作的Pro-Router方法,通过两阶段渐进式决策机制提升路由准确率与速度,端到端吞吐量显著优于现有方案。

Comments 9 pages, 7 figures, 2 tables. Code: this https URL (https://github.com/xinyuangui2/pro-router)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28496 2026-09-01 cs.CL 版本更新 89%

Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation

混沌中的阶梯:测试时缩放何时、如何(或许还有为何)提升大语言模型的机器翻译性能

Di Wu, Sergey Troshin, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探究LLM的序列式与并行式测试时缩放在机器翻译中的特性,发现序列式采样性能上限更高,可提升翻译流畅度但在大推理预算下会降准,还分析了其机制与鲁棒性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28846 2026-09-01 cs.CL cs.AI cs.LG 新提交 88%

A rigor-matched audit of periodic-step layer skipping for efficient llm inference: conflayers versus swift, with a supplemental analysis of trained routing alternatives

高效大语言模型推理的周期步长层跳过方法的严格匹配审计:ConfLayers与SWIFT,及训练路由替代方法的补充分析

Prateek Kumar Sikdar, Arpan Ghosh

机构 * Accenture(埃森哲)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过含3个随机种子的严格匹配审计,对比了ConfLayers与SWIFT两种周期步长层跳过方法及训练路由方法的LLM推理效率,发现SWIFT推理速度更快但搜索开销更高,训练路由方法准确率更低,还发布了审计对比模板。

Comments 17 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30649 2026-09-01 cs.CL cs.CV 新提交 88%

Where Identity Lives: Localized, Retain-Free Identity Unlearning in Multimodal Large Language Models

身份信息的留存位置:多模态大语言模型中无保留集的本地化身份遗忘

Kangwook Ko, Jaehyuk Jang, Wonjun Lee, Hee-Seon Kim, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对多模态大语言模型身份遗忘需依赖难获取保留集的问题,提出PAVA方法,定位解码器早期到中期MLPs并结合遗忘损失与视觉属性锚定,在基准上取得良好遗忘-保留权衡。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29111 2026-09-01 cs.CR cs.AI 新提交 88%

Auditing and Mitigating Privacy Leakage in Cloud-Edge Collaborative Decoding

云边协同解码中的隐私泄露审计与缓解

Kejia Zhang, Tianyuan Zou, Zixuan GU, Yang Liu

专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文针对云边协同解码范式的隐私风险提出防御机制CoVeil,可降低数据泄露最多87.2%且准确率损失极小,改善了隐私-效用权衡。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03136 2026-09-01 cs.CL 版本更新 88%

Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models

超越最终层:大型语言模型中用于更好多语言校准的中间表征

Ej Zhou, Caiqi Zhang, Tiancheng Hu, Chengzu Li, Nigel Collier, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究针对多语言校准问题,发现LLMs的后期中间层比最终层更适合提供可靠的多语言置信信号,提出无训练方法LACE以提升多语言校准,助力构建更公平可信的LLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30295 2026-09-01 cs.LG cs.AI 新提交 88%

CateKV: On Sequential Consistency for Long-Context LLM Inference Acceleration

CateKV:面向长上下文大语言模型推理加速的顺序一致性研究

Haoyun Jiang, Haolin Li, Jianwei Zhang, Fei Huang, Qiang Hu, Minmin Sun, Shuai Xiao, Yong Li, Junyang Lin, Jiangchao Yao

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对长上下文LLM推理的内存与延迟挑战,提出混合KV缓存方法CateKV,利用注意力头的顺序一致性特性减少冗余KV信息,在保持准确率的同时显著降低内存占用、提升解码与批量处理效率。

Comments Published at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28911 2026-09-01 cs.LG cs.CL cs.IT 新提交 88%

SemKV: Semantic Mixed-Precision KV Cache Quantization Guided by the Quality Cliff for Long-Context LLM Inference

SemKV:面向长上下文大语言模型推理的、由质量悬崖引导的语义混合精度KV缓存量化

Daeha Lee, Do-Hyung Kim, Jae-Hong Kim

机构 * Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院(ETRI))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SemKV基于质量悬崖提出语义混合精度KV缓存量化,保留所有token并分配特定精度,实现6.0倍存储压缩且无质量损失,优于FP16 token剪枝,替换量化器可提升压缩比至7.9倍。

Comments 34 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30703 2026-09-01 cs.CR cs.AI cs.CL cs.LG 新提交 88%

SingProbe Technical Report

SingProbe 技术报告

Sing Team

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SingProbe 是一种轻量级 LLM 内在运行时护栏,复用 LLM 隐藏状态以 token 级别预测意图、安全性与幻觉风险,仅约 200 万参数、额外开销<0.5%,还可指导安全解码,其衍生的 SingProbe-Med 可用于医疗生成的风险干预。

详情

展开后加载摘要…

URL PDF HTML 收藏