arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2606.19350 2026-06-19 cs.CL 新提交 88%

Pruning via Causal Attribution Preserves Reasoning Performance in Large Language Models

基于因果归因的剪枝保留大型语言模型的推理性能

Amogh Sheth, Biruk Assefa, Yi Wen Huang, Andrew Lin, Yuhao Ge

机构 * Edison Academy Magnet School(爱迪生学院磁石学校) Massachusetts Institute of Technology(麻省理工学院) State University of New York College at Plattsburgh(纽约州立大学普拉茨堡学院) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 提出无需训练的因果归因剪枝(CAP)方法,通过测量注意力头对推理任务的因果影响进行细粒度剪枝,在20%稀疏度下相比Wanda在ARC-Challenge上准确率提升高达61%。

Comments Accepted at the ICLR 2026 Workshop on LLM Reasoning. 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08432 2025-07-14 cs.DB cs.CL 88%

xpSHACL: Explainable SHACL Validation using Retrieval-Augmented Generation and Large Language Models

Gustavo Correa Publio, José Emilio Labra Gayo

机构 * University of Leipzig(莱比锡大学) University of Oviedo(奥维耶多大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;LLM(comments)

Comments Accepted for publication in the 2nd LLM+Graph Workshop, colocated at VLDB'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07304 2024-07-11 cs.AI 88%

Inference Performance Optimization for Large Language Models on CPUs

Pujiang He, Shan Zhou, Wenhuan Huang, Changqing Li, Duyi Wang, Bin Guo, Chen Meng, Sheng Gui, Weifei Yu, Yi Xie

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI;foundation model(comments)

Comments 5 pages, 6 figure, ICML 2024 on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02750 2024-07-04 cs.CL 88%

Learning to Reduce: Towards Improving Performance of Large Language Models on Structured Data

Younghun Lee, Sungchul Kim, Ryan A. Rossi, Tong Yu, Xiang Chen

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL;foundation model(comments)

Comments ICML 2024 Workshop on Long-Context Foundation Models, Vienna, Austria 2024. arXiv admin note: substantial text overlap with arXiv:2402.14195

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22613 2026-08-25 cs.AR 新提交 88%

NOVA: Technology-Architecture Co-Design of Near-Memory Processing for Attention-SSM-MoE Hybrid LLM Inference

NOVA:面向注意力-状态空间模型-混合专家混合大语言模型推理的近内存处理技术-架构协同设计

In-Jun Jung, Jaeha Min, Joo-Young Kim

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 NOVA是面向注意力-SSM-MoE混合LLM推理的近内存处理技术-架构协同设计方案,通过4F² VCT DRAM与两层NMP架构,在低面积开销下实现远超GPU的推理性能与能效。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05545 2026-08-25 stat.ME econ.EM 版本更新 88%

Can Language Models Boost the Power of Randomized Experiments Without Statistical Bias?

语言模型能否在无统计偏见的情况下提升随机实验的效力?

Xinrui Ruan, Xinwei Ma, Yingfei Wang, Waverly Wei, Jingshen Wang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 CALM通过整合语言模型生成的洞察与因果估计器,提升随机实验的精度和有效性,减少偏见并提高稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13499 2026-08-14 cs.DC 新提交 88%

OpScale: Operator-level Provisioning and Autoscaling for LLM Serving

OpScale:面向大语言模型服务的算子级资源配置与自动扩缩容

Xingqi Cui, Chieh-Jan Mike Liang, Ziang Tang, Jiarong Xing, Haoran Qiu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM服务中粗粒度扩缩容的弊端,提出算子级编排框架OpScale,可在满足SLO的同时降低GPU用量、功耗,或在固定成本下提升吞吐量。

Comments 22 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25699 2026-08-05 cs.AR 版本更新 88%

NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference

NVLLM:一种以3D NAND为中心的架构, enabling 边缘设备上的LLM推理

Mingbo Hao, Changwei Yan, Haoyu Cui, Zhihao Yan, Yizhi Ding, Zhangrui Qian, Weiwei Shan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NVLLM通过将前馈网络计算移至Flash并利用轻量CMOS逻辑执行注意力,实现边缘设备上的高效LLM推理,其在参数规模达30B的模型上实现了显著的加速。

Comments Published in the Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026). This version includes additional supplementary material

Journal ref Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01985 2026-08-04 cs.CV 新提交 88%

DiffPrune: differentiable information throttling for token pruning in vision-language models

DiffPrune:用于视觉-语言模型中 token 剪枝的可微信息节流方法

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) CUHK MMLab, CPII under InnoHK(香港中文大学MMLab,InnoHK下属CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 DiffPrune 是一种用于视觉-语言模型的可微 token 剪枝方法,通过信息节流器避免松弛选择的不稳定性,在保留 96.5% 准确率的同时实现 2.85 倍 LLM 预填充加速,推理开销仅 0.69 毫秒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21076 2026-07-24 cs.CV 新提交 88%

C-PTQ: Fisher-weighted Channel-wise Sensitivity for Post-training Quantization of MLLMs

C-PTQ:用于多模态大语言模型训练后量化的Fisher加权通道敏感性

Jiameng Li, Han Zhou, Matthew B. Blaschko

专题命中 效率与部署 :post-training(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型训练后量化中异常通道致性能下降问题,提出C-PTQ方法,通过设计Fisher加权目标统一任务特定损失扰动和量化误差,无需辅助模块达最优性能,经实验验证有效。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04595 2026-07-23 cs.AR 版本更新 88%

Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference

Harmonia:面向内存和计算效率的BFP基大语言模型推理算法-硬件协同设计

Xinyu Wang, Jieyu Li, Yanan Sun, Weifeng He

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 Harmonia通过算法-硬件协同设计实现所有层BFP激活,提升LLM推理的内存和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19215 2026-07-22 cs.NI 新提交 88%

HACO: Hedged Agent Computing for Reliable LLM Systems

HACO:用于可靠大语言模型系统的套期保值代理计算

Enhan Li, Hongyang Du

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型代理在长期工作流中角色到实例绑定边界的故障问题,提出HACO运行时控制方案,将角色请求视为可靠性约束选择问题,通过结合乐观排序与保守可靠性积累及经验收集更新配置文件,提高了模型在变化条件下的性能并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12446 2026-07-13 cs.CL cs.AI cs.LG 版本更新 88%

Multi-Attribute Steering of Language Models via Targeted Intervention

通过目标干预对语言模型进行多属性引导

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何对语言模型进行多属性引导,提出MAT-Steer框架,通过对齐目标学习引导向量,减少属性间冲突,在问答和生成任务中评估,该框架优于现有方法。

Comments ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24044 2026-07-07 cs.DC cs.AI cs.CL cs.LG 版本更新 88%

Data Driven Optimization of GPU efficiency for Distributed LLM-Adapter Serving

用于分布式大语言模型适配器服务的GPU效率数据驱动优化

Ferran Agullo, Joan Oliveras, Chen Wang, Alberto Gutierrez-Torre, Olivier Tardieu, Alaa Youssef, Jordi Torres, Josep Ll. Berral

机构 * BSC(巴塞罗那超级计算中心) IBM(国际商业机器公司) UPC(巴塞罗那技术大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分布式大语言模型适配器服务中GPU资源利用问题,提出数据驱动管道,通过性能预测、数字孪生等组件,以最少GPU服务工作负载,提升效率,还可用于其他目标。

Comments update of the journal paper contents after major revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00447 2026-07-01 cs.SE 版本更新 88%

Think Harder and Don't Overlook Your Options: Revisiting Issue-Commit Linking with LLM-Assisted Retrieval

深入思考并不要忽视你的选项:重新审视基于LLM辅助检索的议题-提交链接

Cole Morgan, Muhammad Asaduzzaman, Shaiful Chowdhury, Shaowei Wang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文重新评估了多种议题-提交链接恢复技术,通过比较不同检索方法和机器学习模型,发现密集检索优于稀疏检索,传统机器学习方法性能优于大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-06-25 cs.CE 新提交 88%

Retrieval-Grounded Multilingual LLM Assistance for Island Smallholder Farmers

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16825 2026-06-16 cs.CL cs.AI cs.LG 新提交 88%

Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models

循环绑定——混合专家语言模型中的专家层绑定

Martin Jaggi

机构 * EPFL(瑞士联邦理工学院洛桑)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 提出专家绑定方法,通过共享连续Transformer层的专家参数,在保持独立路由和注意力的同时,将MoE模型内存占用降低近2倍,且不损失困惑度或下游性能。

Comments Code available at https://github.com/epfml/looped-moe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02955 2026-06-16 cs.CL cs.AI cs.LG 版本更新 88%

Fast-dLLM++: Fréchet Profile Decoding for Faster Diffusion LLM Inference

Fast-dLLM++: 用于更快扩散LLM推理的Fréchet轮廓解码

Siva Rajesh Kasa, Yasong Dai, Sumit Negi, Hongdong Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型推理中并行令牌生成的瓶颈,提出Fréchet轮廓解码方法,通过利用异构置信度轮廓选择并行提交集,在保持模型和缓存不变的情况下提升吞吐量。

Comments Initial version accepted at Workshop on Structured Probabilistic Inference & Generative Modeling, ICML 2026. Project Page: https://ringo-star.github.io/projectpage_frechet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24528 2026-06-02 cs.AI cs.CL cs.LG 88%

Hypothesis Generation and Inductive Inference in Children and Language Models

儿童与语言模型中的假设生成与归纳推理

Jeffrey Qin, Wasu Top Piriyakulkij, Zhuangfei Gao, Mia Radovanovic, Jessica Sommerville, Kevin Ellis, Marta Kryven

机构 * Computer Science University of Waterloo(滑铁卢大学计算机科学系) Department of Computer Science Cornell University(康奈尔大学计算机科学系) Department of Computer Science Dalhousie University(达尔豪斯大学计算机科学系) Department of Psychology University of Toronto(多伦多大学心理学系)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过归纳推理盒子任务,结合贝叶斯粒子推断的程序归纳形式化,比较儿童与基于LLM的智能体在不确定性下的假设生成与证据寻求行为,发现两者在适应环境结构上相似但信息寻求成本与归纳偏差不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28268 2026-05-28 cs.DB 88%

Towards Cost-effective LLMs Routing with Batch Prompting

面向成本效益的批量提示大语言模型路由

Haotian Xu, Kangfei Zhao, Jiadong Xie

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出RoBatch框架,联合优化模型分配和查询聚合两个维度,在成本预算下实现更优的成本-性能帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28051 2026-05-28 cs.CV 88%

Beyond Surrogate Gradients: Fully Differentiable Token Pruning for Vision-Language Models

超越代理梯度:面向视觉-语言模型的完全可微分令牌剪枝

Landi He, Mingde Yao, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院) CUHK MMLab(香港中文大学MMLab) CPII under InnoHK(创新工场CPII)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract)

AI总结 提出DiffPrune方法,通过将剪枝重新表述为令牌信息的连续控制而非离散选择学习,利用信息节流阀调节令牌,实现完全可微分的令牌重要性学习,在保持96.5%全模型精度的同时将LLM预填充加速2.85倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23640 2026-05-25 cs.CR 88%

CachePrune: Privacy-Aware and Fine-Grained KV Cache Sharing for Efficient LLM Inference

CachePrune:面向高效LLM推理的隐私感知细粒度KV缓存共享

Guanlong Wu, Zhaohan li, Yao Zhang, Zheng Zhang, Jianyu Niu, Ye Wu, Yinqian Zhang

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对跨用户KV缓存共享带来的侧信道泄露问题,提出CachePrune机制,通过令牌级细粒度缓存管理实现隐私感知的KV条目选择性重用,在消除直接泄露的同时显著降低首令牌延迟并提高缓存命中率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11938 2026-05-12 cs.DC 88%

FlexPipe: Adapting Dynamic LLM Serving Through Inflight Pipeline Refactoring in Fragmented Serverless Clusters

FlexPipe:通过片段化无服务器集群中的飞行管道重构实现动态LLM服务

Yanying Lin, Shijie Peng, Chengzhi Lu, Chengzhong Xu, Kejiang Ye

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 FlexPipe通过动态重构管道架构,解决无服务器集群中资源碎片化和请求模式变化带来的效率问题,实现8.5倍资源利用率提升和38.3%的延迟降低。

Comments EuroSys 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26821 2026-04-30 cs.AR cs.DC 88%

Exploring the Efficiency of 3D-Stacked AI Chip Architecture for LLM Inference with Voxel

探索3D堆叠AI芯片架构在大语言模型推理中的效率:Voxel

Yiqi Liu, Noelle Crawford, Michael Wang, Jilong Xue, Jian Huang

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Voxel框架,用于探索3D堆叠AI芯片在LLM推理中的效率,分析计算范式、映射策略及硬件架构的影响,揭示效率取决于多因素协同及映射设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02501 2026-04-06 eess.SP 88%

ECG Foundation Models and Medical LLMs for Agentic Cardiovascular Intelligence at the Edge: A Review and Outlook

ECG基础模型与医疗大语言模型用于边缘端心血管智能:综述与展望

Mudassir Hasan Khan, Ahmad Nayfeh, Mudassir Masood, Ali Ahmad Al-Shaikhi, Muhammad Mahboob Ur Rahman, Tareq Y. Al-Naffouri

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文综述了用于心血管疾病诊断、监测和临床决策支持的ECG基础模型和医疗大语言模型,探讨了其在边缘计算中的应用及未来发展方向。

Comments 18 pages, 4 figures, 4 tables, under review with a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19133 2026-03-30 cs.DC 88%

A Pipelined Collaborative Speculative Decoding Framework for Efficient Edge-Cloud LLM Inference

一种用于高效边缘-云LLM推理的流水线协同推测解码框架

Yida Zhang, Zhiyong Gao, Shuaibing Yue, Jie Li, Rui Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出PicoSpec框架,通过异步流水线解决边缘协作中的等待问题,并引入稀疏压缩降低通信延迟,实现在边缘-云协同推理中的高效性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14327 2026-03-06 cs.LG cs.AI cs.CL 88%

Yuan3.0 Ultra: A Trillion-Parameter Enterprise-Oriented MoE LLM

Yuan3.0 Ultra:一个万亿参数企业导向的MoE大语言模型

YuanLab. ai, :, Shawn Wu, Jiangang Luo, Darcy Chen, Sean Wang, Louie Li, Allen Wang, Xudong Zhao, Tong Yu, Bach Li, Joseph Shen, Gawain Ma, Jasper Jia, Marcus Mao, Claire Wang, Hunter He, Carol Wang, Zera Zhang, Jason Wang, Chonly Shen, Leo Zhang, Logan Chen, Qasim Meng, James Gong, Daniel Zhao, Penn Zheng, Owen Zhu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 Yuan3.0 Ultra通过LAEP算法提升预训练效率,实现万亿参数企业导向MoE大语言模型的高效训练与多领域性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12225 2026-01-09 cs.LG cs.AI cs.CL stat.ML 88%

Mining Intrinsic Rewards from LLM Hidden States for Efficient Best-of-N Sampling

从LLM隐藏状态中挖掘内在奖励以实现高效的Best-of-N采样

Jizhou Guo, Zhaomin Wu, Hanchen Yang, Philip S. Yu

机构 * Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) National University of Singapore(新加坡国立大学) Tongji University(同济大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SWIFT通过从LLM隐藏状态中挖掘内在奖励,实现高效Best-of-N采样,提升模型性能并减少计算成本。

Comments Accepted by KDD 2026 (Research Track). Project page: https://aster2024.github.io/swift-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14398 2025-11-18 cs.CL cs.AI cs.LG 88%

On the Limitations of Language Targeted Pruning: Investigating the Calibration Language Impact in Multilingual LLM Pruning

Simon Kurz, Jian-Jia Chen, Lucie Flek, Zhixue Zhao

机构 * Department of Computer Science, TU Dortmund University(图恩-多特蒙德大学计算机科学系) Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛国际信息科技中心,波恩大学) Computer Science School, University of Sheffield(谢菲尔德大学计算机科学学院) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments Accepted for publication in TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14686 2025-11-12 cs.CV 88%

From Semantics, Scene to Instance-awareness: Distilling Foundation Model for Grounded Open-vocabulary Situation Recognition

Chen Cai, Tianyi Liu, Jianjun Gao, Wenyang Liu, Kejun Wu, Ruoyu Wang, Yi Wang, Soo Chin Liew

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huazhong University of Science and Technology(华中科技大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏