arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1088 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1088 篇

2510.07651 2026-08-11 cs.CL cs.AI 版本更新 89%

OBCache: Optimal Brain KV Cache Pruning for Efficient Long-Context LLM Inference

OBCache: 面向高效长上下文LLM推理的最优脑KV缓存剪枝

Yuzhe Gu, Xiyu Liang, Jiaojiao Zhao, Enmao Diao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出OBCache框架,将缓存驱逐形式化为逐层结构化剪枝问题,基于最优脑损伤理论量化令牌显著性,通过输出感知分数改进现有驱逐策略,在长上下文任务中提升准确性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09904 2026-07-14 cs.LG cs.AI 版本更新 89%

Beyond Naïve Prompting: Strategies for Improved Context-aided Forecasting with LLMs

超越简单提示:改进LLMs上下文辅助预测的策略

Arjun Ashok, Andrew Robert Williams, Vincent Zhihao Zheng, Irina Rish, Nicolas Chapados, Étienne Marcotte, Valentina Zantedeschi, Alexandre Drouin

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出四种策略,从模型诊断、准确性和效率三个正交维度改进LLMs的上下文辅助预测,通过广泛实验揭示执行差距、性能提升和成本降低的解决方案。

Comments Published at TMLR - OpenReview link: https://openreview.net/forum?id=dkjHHFJkVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01708 2026-06-25 cs.DC cs.AI cs.LG 版本更新 89%

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip:超快无损KV压缩用于解耦的大语言模型服务

Yipin Guo, Siddharth Joshi

机构 * University of Notre Dame IN, USA(诺丁汉大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23277 2026-06-15 cs.CL cs.AI 版本更新 89%

Sentinel: Decoding Context Utilization via Attention Probing for Efficient LLM Context Compression

Sentinel: 通过注意力探测解码上下文利用以实现高效LLM上下文压缩

Yong Zhang, Heng Li, Yanwen Huang, Ning Cheng, Yang Guo, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao

机构 * Ping An Technology (Shenzhen) Co., Ltd., China(平安科技(深圳)有限公司,中国) University of Science and Technology of China(中国科学技术大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出Sentinel,一种轻量级句子级压缩框架,通过冻结LLM的头部注意力模式解码推理时上下文利用行为,使用单次非自回归前向传递实现压缩,在LongBench上以0.5B代理模型达到5倍压缩且性能与7B模型方法相当。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12993 2026-07-07 cs.AR 版本更新 89%

HPIM: Heterogeneous Processing-In-Memory-based Accelerator for Large Language Models Inference

HPIM:用于大语言模型推理的基于异构内存内处理的加速器

Cenlin Duan, Jianlei Yang, Rubing Yang, Yikun Wang, Yiou Wang, Lingkun Long, Yingjie Qi, Xiaolin He, Ao Zhou, Xueyan Wang, Weisheng Zhao

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 针对大语言模型推理挑战,提出HPIM,用软硬件协同设计,将工作负载依特性分至SRAM-PIM和HBM-PIM子系统,引入耦合管道策略,显著优于现有加速器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29813 2026-06-25 cs.SE 版本更新 89%

Compiling Code LLMs into Lightweight Executables

将代码LLM编译为轻量级可执行文件

Jieke Shi, Junda He, Zhou Yang, Chengran Yang, Mykhailo Klymenko, Thong Hoang, Xiwei Xu, Zhenchang Xing, David Lo

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Ditto框架,通过量化技术和LLVM编译优化,将代码LLM模型和推理程序编译为轻量级可执行文件,实现推理速度提升、内存和能耗降低,同时保持高精度。

Comments Accepted at the 34th ACM International Conference on the Foundations of Software Engineering (FSE 2026), 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03122 2026-06-19 cs.CL cs.AI cs.LG 版本更新 89%

From Construction to Injection: Edit-Based Fingerprints for Large Language Models

从构建到注入:面向大型语言模型的基于编辑的指纹

Yue Li, Xin Yi, Dongsheng Shi, Yongyi Cui, Gerard de Melo, Linlin Wang

机构 * East China Normal University(华东师范大学) Hasso Plattner Institute/University of Potsdam(哈索罗普拉特纳研究所/波茨坦大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出端到端注入指纹框架,通过代码混合指纹和多候选编辑方法,解决黑盒部署中指纹的不可感知性和鲁棒性挑战。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06295 2026-06-09 cs.LG cs.AI cs.CL 版本更新 89%

dLLM-Cache: Accelerating Diffusion Large Language Models with Adaptive Caching

dLLM-Cache:基于自适应缓存的扩散大语言模型加速

Zhiyuan Liu, Yicun Yang, Yaojie Zhang, Junjie Chen, Chang Zou, Qingyan Wei, Shaobo Wang, Yichen Zhu, Linfeng Zhang

机构 * Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型推理延迟高的问题,提出一种无需训练的自适应缓存框架dLLM-Cache,通过长间隔提示缓存和基于特征相似性的部分响应更新,实现高效中间计算复用,在保持输出质量的同时大幅降低FLOPs。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10317 2026-08-10 cs.RO cs.LG 版本更新 89%

Robot guide with multi-agent control and automatic scenario generation with LLM

基于多智能体控制与大语言模型自动场景生成的机器人引导系统

Elizaveta D. Moskovskaya, Anton D. Moscowsky

机构 * National Research Center "Kurchatov Institute"(国家研究快机构"库恰托夫研究所")

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究开发了结合多智能体资源管理与LLM自动场景生成的混合社交机器人控制架构,在MENTOR-1导游机器人上验证了其能提升长期讲故事任务中机器人交互的自然性与丰富度。

Comments 14 pages, 4 figures, 4 tables, 1 demo-video and repository link. There were major changes: an introduction, a review, and a new experiment. Some tables and figures have also been changed

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11083 2026-08-04 cs.LG cs.CR 版本更新 89%

Token-Efficient Change Detection in LLM APIs

LLM API中的令牌高效变化检测

Timothée Chauvin, Clément Lalanne, Erwan Le Merrer, Jean-Michel Loubes, François Taïani, Gilles Tredan

机构 * Université de Rennes, Inria, CNRS/IRISA(里昂大学、法国国家信息与自动化技术研究院、法国国家科学研究中心/IRISA) Equipe Regalia, Inria(Regalia团队、法国国家信息与自动化技术研究院) LAAS, CNRS(拉劳斯研究中心、法国国家科学研究中心) Univ Toulouse, INUC, UT2J, INSA Toulouse, TSE, CNRS, IMT(图卢兹大学、INUC、UT2J、图卢兹国家高等工业学院、TSE、法国国家科学研究中心、IMT)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出基于边界输入的黑盒变化检测方案B3IT,在仅观察输出令牌的条件下实现低成本、高性能的LLM变化检测。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05711 2026-07-16 cs.CL 版本更新 89%

Beyond tokens: a unified framework for latent communication in LLM-based multi-agent systems

超越Token:基于LLM的多智能体系统中潜在通信的统一框架

Yingzhuo Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一个三维统一框架(通信内容、发送-接收对齐、信息融合方式),系统分类2024-2026年间18种潜在通信方法,识别五种设计模式并揭示开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00086 2026-07-09 cs.CL 版本更新 89%

RIMRULE: Improving Tool-Using Language Agents via MDL-Guided Rule Learning

RIMRULE:通过MDL引导的规则学习改进使用工具的语言智能体

Xiang Gao, Yuguang Yao, Qi Zhang, Kaiwen Dong, Avinash Baidya, Ruocheng Guo, Hilaf Hasson, Kamalika Das

机构 * Intuit AI Research(Intuit AI研究)

专题命中 效率与部署 :language agent(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对大型语言模型在特定领域使用工具的难题,提出RIMRULE神经符号方法,通过从失败轨迹提炼规则并用MDL目标巩固,以动态注入规则提升性能,实验证明该方法能提高工具使用准确性,且规则具有跨架构可移植性。

Comments Published as a long paper in the main conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28565 2026-07-03 cs.PF cs.AI cs.AR 版本更新 89%

KernelSight-LM: A Kernel-Level LLM Inference Simulator

KernelSight-LM: 一种内核级LLM推理模拟器

Xiteng Yao, Taeho Kim, Hengzhi Pei, Xinle Liu, Kyle Ulrich, Leonard Lausen, Ashish Khetan, Xiang Song, George Karypis, Martin Herbordt

机构 * Amazon Web Services(亚马逊网络服务) Boston University(波士顿大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出KernelSight-LM,一种细粒度推理模拟器,通过分解服务步骤为屋顶线内核模型、通信模型和主机开销模型,并集成前缀缓存和连续批处理,实现跨GPU代际或少量目标数据下的精确延迟预测,支持硬件/软件协同设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22642 2026-06-23 cs.LG 版本更新 89%

Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning

压缩简单问题,探索困难问题:面向高效LLM推理的难度感知熵正则化

Qin-Wen Luo, Sheng Ren, Xiang Chen, Rui Liu, Jun Fang, Naiqiang Tan, Sheng-Jun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) College of Computer Science and Technology(计算机科学与技术学院) Didichuxing Co. Ltd(滴滴出行有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出CEEH方法,通过难度感知的熵正则化,在强化学习中对简单问题压缩推理长度,对困难问题保持探索空间,从而在减少响应长度的同时维持推理准确性。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11418 2026-06-16 cs.CL 版本更新 89%

CentroidKV: Efficient Long-Context LLM Inference via KV Cache Clustering

CentroidKV: 通过KV缓存聚类实现高效的长上下文LLM推理

Jie Hu, Shengnan Wang, Yutong He, Ping Gong, Jiawei Yi, Juncheng Zhang, Youhui Bai, Renhai Chen, Gong Zhang, Cheng Li, Kun Yuan

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出CentroidKV框架,通过在线聚类KV缓存减少内存占用,在保持性能的同时实现高达75%的缓存压缩和1.92倍解码加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16835 2026-06-15 cs.CR cs.LG 版本更新 89%

NeST: Neuron Selective Tuning for LLM Safety

NeST: 面向LLM安全的神经元选择性调优

Sasha Behrouzi, Lichao Wu, Mohamadreza Rostami, Ahmad-Reza Sadeghi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出NeST框架,通过激活探测识别安全相关前馈神经元并训练共享簇级更新,仅用普通恶意提示即可泛化防御多种越狱攻击,在14个模型上以极少参数实现接近全微调的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01609 2026-06-09 cs.CL 版本更新 89%

Swift-SVD: Theoretical Optimality Meets Practical Efficiency in Low-Rank LLM Compression

Swift-SVD:在低秩LLM压缩中理论最优与实用效率的结合

Ruoling Qi, Yirui Liu, Xuaner Wu, Xiangyu Wang, Ming Li, Chen Chen, Jian Chen, Yin Chen, Qizhen Weng

机构 * Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Swift-SVD框架,通过激活感知和闭式压缩方法,在保证理论最优的同时提升实用效率和数值稳定性,实验显示其在压缩精度和端到端压缩时间上有显著优势。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07725 2026-08-19 cs.CL cs.AI 版本更新 88%

SOD: Step-wise On-policy Distillation for Small Language Model Agents

SOD:分步式在线蒸馏用于小型语言模型代理

Qiyong Zhong, Mao Zheng, Mingyang Song, Xin Lin, Jie Sun, Houcheng Jiang, Xiang Wang, Junfeng Fang

机构 * Zhejiang University(浙江大学) Large Language Model Department, Tencent(腾讯大语言模型部门) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对小型语言模型中工具集成推理的稳定性问题,提出SOD分步式在线蒸馏框架,通过动态调整蒸馏强度缓解教师信号误导,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03089 2026-08-14 cs.LG cs.AI 版本更新 88%

Constitutional On-Policy Safe Distillation

宪法性在策略安全蒸馏

Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Yi Liu, Xingjun Ma, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团) Zhejiang University(浙江大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对在策略自蒸馏在安全对齐中因宪法条件导致教师分布收缩、表达能力下降的问题,提出宪法性在策略安全蒸馏(COPSD),通过交叉SFT冷启动校准教师分布,再进行宪法条件在策略蒸馏,在12个基准上实现了更优的安全-有用性权衡并降低安全税。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02068 2026-08-12 cs.CR cs.CL cs.LG 版本更新 88%

Robust and Secure Code Watermarking for Large Language Models via ML/Crypto Codesign

基于ML/密码学协同设计的大语言模型鲁棒安全代码水印

Ruisi Zhang, Neusha Javidnia, Nojan Sheybani, Farinaz Koushanfar

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究提出首个ML/密码学协同设计的RoSeMary框架,通过端到端训练结合CodeT5实现高质量代码水印,用零知识证明安全验证,兼具高检测准确率、抗攻击能力与高效性。

Comments accept to ACM TAISAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03873 2026-08-07 cs.LG cs.CL 版本更新 88%

SODA: Semi On-Policy Black-Box Distillation for Large Language Models

SODA:大语言模型的半在线盒式知识蒸馏

Xiwen Chen, Jingjing Wang, Wenhui Zhu, Peijie Qiu, Xuanzhao Dong, Yueyue Deng, Hejian Sang, Zhipeng Wang, Alborz Geramifard, Feng Luo

机构 * Clemson University(克莱姆森大学) LinkedIn(领英) Washington University in St. Louis(圣路易斯华盛顿大学) Arizona State University(亚利桑那州立大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出SODA,一种高效的半在线盒式知识蒸馏方法,通过对比教师最优响应与学生静态输出,实现高质量分布对齐,无需动态回放和对抗平衡,提升蒸馏效率和稳定性。

Comments Efficient Reasoning@COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28639 2026-08-05 cs.CL cs.AI cs.CY 版本更新 88%

The Asymmetric Effects of Knowledge Distillation on Bias in Small Language Models

知识蒸馏对小型语言模型偏见的非对称影响

Plawan Kumar Rath

机构 * Meta

专题命中 效率与部署 :language model(title,abstract);small language model(title);SFT(abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究发现知识蒸馏对小型语言模型偏见存在非对称影响,明确任务下提升上下文遵循能力,模糊任务下破坏弃权校准,提出PCCD协议可捕捉聚合指标遗漏的危害。

Comments 18 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01043 2026-07-30 cs.LG cs.AI 版本更新 88%

Low-Precision Training of Large Language Models: Methods, Challenges, and Opportunities

大语言模型的低精度训练:方法、挑战与机遇

Zhiwei Hao, Jianyuan Guo, Li Shen, Yong Luo, Han Hu, Guoxia Wang, Dianhai Yu, Yonggang Wen, Dacheng Tao

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(网络科学与技术学院,中山大学深圳校区) School of Computer Science, Wuhan University(计算机科学学院,武汉大学) Baidu Inc.(百度公司) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本综述全面梳理大语言模型低精度训练方法,按数值格式分类并探讨相关挑战、鲁棒性及研究方向,助力统一该领域研究视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21702 2026-07-28 cs.CL cs.AI 版本更新 88%

CSV-Decode: Certifiable Sub-Vocabulary Decoding for Efficient Large Language Model Inference

CSV-Decode: 可证的子词汇解码以实现高效的大型语言模型推理

Dong Liu, Shu Wang, Yanxuan Yu, Haisheng Wang, Ben Lengerich

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) College of Engineering, Columbia University(哥伦比亚大学工程学院) Department of Statistics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校统计学系)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CSV-Decode通过构建子词汇表实现高效的大语言模型推理,提供精确的top-k认证和ε-认证的softmax近似,显著提升速度并保持分布保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18046 2026-07-21 cs.LG cs.AI cs.CR 版本更新 88%

NanoZK: Privacy-Preserving Verifiable Inference for Large Language Models via Layerwise Zero-Knowledge Proofs

NANOZK:用于可验证大语言模型推理的分层零知识证明

Zhaohui Wang

机构 * USC Viterbi School of Engineering(USC维特里维学院工程学院)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 NANOZK通过分层零知识证明验证大语言模型推理,采用分层证明框架实现常数大小证明,提升可扩展性与并行证明效率,同时保持形式正确性。

Comments Extended version. The first 12 pages correspond to the ICICS 2026 (Springer LNCS) camera-ready paper. This version supersedes the earlier ICLR 2026 VeriFAI Workshop preprint and adds full security proofs, Halo2 circuit details, lookup-table derivations, extended experiments, verifier-cost analysis, GPU scaling, reproducibility instructions, and appendices omitted from the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21082 2026-07-13 cs.CL cs.LG stat.ML 版本更新 88%

Accelerating Large Language Model Inference with Self-Supervised Early Exits

通过自监督早期退出加速大语言模型推理

Florian Valade

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过在中间层添加自监督早期退出头加速大语言模型推理,评估多种置信度指标,实验表明可降成本保精度,还应用于推测性解码提出DSSD,高令牌接受率且少超参数调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18934 2026-07-02 cs.LG cs.AI 版本更新 88%

When Less is More: 8-bit Quantization Improves Continual Learning in Large Language Models

少即是多:8位量化改善大型语言模型的持续学习

Michael S. Zhang, Rishi A. Ruia, Arnav Kewalram, Saathvik Dharmapuram, Utkarsh Sharma, Kevin Zhu

机构 * Algoverse

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统研究量化精度(FP16、INT8、INT4)与重放缓冲区策略在大型语言模型持续学习中的交互,发现量化模型在后续任务上优于FP16,INT8在学习可塑性与知识保留间取得最佳平衡,量化噪声充当隐式正则化防止过拟合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21522 2026-06-09 cs.LG cond-mat.dis-nn cs.AI stat.ML 版本更新 88%

More Bang for the Buck: Improving the Inference of Large Language Models at a Fixed Budget using Reset and Discard (ReD)

更高效利用预算:使用重置与丢弃(ReD)方法在固定预算下提升大型语言模型的推理性能

Sagi Meir, Tommer D. Keidar, Noam Levi, Shlomi Reuveni, Barak Hirshberg

机构 * School of Chemistry, Tel Aviv University(特拉维夫大学化学系) The Center for Physics and Chemistry of Living Systems, Tel Aviv University(特拉维夫大学生命系统物理与化学中心) School of Physics and Astronomy, Tel Aviv University(特拉维夫大学物理与天文学系) The Center for Computational Molecular and Materials Science, Tel Aviv University(特拉维夫大学计算分子与材料科学中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对固定预算下大型语言模型推理的收益递减问题,提出重置与丢弃(ReD)查询方法,通过优化尝试分配提升覆盖率,并在编码、数学和推理基准上验证了其成本节约效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25699 2026-08-05 cs.AR 版本更新 88%

NVLLM: A 3D NAND-Centric Architecture Enabling Edge on-Device LLM Inference

NVLLM:一种以3D NAND为中心的架构, enabling 边缘设备上的LLM推理

Mingbo Hao, Changwei Yan, Haoyu Cui, Zhihao Yan, Yizhi Ding, Zhangrui Qian, Weiwei Shan

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 NVLLM通过将前馈网络计算移至Flash并利用轻量CMOS逻辑执行注意力,实现边缘设备上的高效LLM推理,其在参数规模达30B的模型上实现了显著的加速。

Comments Published in the Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026). This version includes additional supplementary material

Journal ref Proceedings of the 63rd ACM/IEEE Design Automation Conference (DAC 2026), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04595 2026-07-23 cs.AR 版本更新 88%

Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference

Harmonia:面向内存和计算效率的BFP基大语言模型推理算法-硬件协同设计

Xinyu Wang, Jieyu Li, Yanan Sun, Weifeng He

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 Harmonia通过算法-硬件协同设计实现所有层BFP激活,提升LLM推理的内存和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏