arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 752 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 142 篇

2606.09864 2026-08-11 cs.LG cs.AI cs.ET 版本更新 82%

Alignment Collapse Under KV Cache Quantization: Diagnosis and Mitigation

KV缓存量化下的对齐崩溃:诊断与缓解

Bruce Changlong Xu, Adarsh Kumarappan, Mu Zhou

机构 * Stanford University(斯坦福大学) California Institute of Technology(加利福尼亚理工学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现低比特KV缓存量化会无声破坏大模型的安全对齐,根源在于安全特征位于低维激活子空间,易受量化噪声影响;提出逐通道缩减(PCR)诊断方法,分类三种失效模式并指导缓解,无需训练即可恢复高达97%的对齐损失。

Comments Preprint. 61 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08377 2026-08-11 cs.AI cs.CL 版本更新 82%

SkillClaw: Let Skills Evolve Collectively with Agentic Evolver

SkillClaw: 让技能与代理进化者共同进化

Ziyu Ma, Shidong Yang, Yuxiang Ji, Xucong Wang, Yong Wang, Yiming Hu, Tongwen Huang, Xiangxiang Chu

机构 * DreamX Team(DreamX团队)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SkillClaw通过聚合多用户交互数据,实现技能的集体进化,提升代理在现实场景中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20114 2026-08-11 cs.IR cs.AI cs.HC cs.LG 版本更新 82%

TreeHop: Efficient Embedding-Level Query Rewriter

TreeHop:高效的嵌入层查询重写器

Zhonghao Li, Kunpeng Zhang, Jinghuai Ou, Shuliang Liu, Xuming Hu

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 TreeHop是一种无需LLM的嵌入层MHQA框架,通过精简循环降低计算开销,在四个开放域MHQA数据集上性能与先进RAG相当,参数仅为现有方案2.2%-29.4%,延迟降低92.8%-97.8%。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08033 2026-08-11 eess.SP 新提交 82%

WiFo-INR: A Wireless Foundation Model Based on Implicit Neural Representations

WiFo-INR:一种基于隐式神经表示的无线基础模型

Boxun Liu, Xuanyu Liu, Shijian Gao, Xiang Cheng, Liuqing Yang

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 本研究提出基于隐式神经表示的无线基础模型WiFo-INR,通过两阶段自监督预训练实现高效紧凑的CSI表示,在性能提升的同时降低延迟,可高效迁移至多任务并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20849 2026-08-11 cs.CL cs.AI cs.LG 版本更新 82%

Length-MAX Tokenizer for Language Models

用于语言模型的Length-MAX分词器

Dong Dong, Weijie Su

机构 * Dong Dong(董东) Weijie Su(苏伟杰)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Length-MAX分词器通过优化平均token长度,提高了语言模型的效率和下游任务性能。

Comments Accepted at Transactions on Machine Learning Research (TMLR). OpenReview: https://openreview.net/forum?id=CRjrpwGD9A

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09443 2026-08-11 cs.AI 新提交 81%

Coupled Graph--Policy Distillation for Personalized Medication Safety in Older Adults with Multimorbidity

面向多病老年患者个性化用药安全的耦合图-策略蒸馏方法

Zihan Wang, Anglin Liu, Rongyi Wang, Dantong Li, Yi Lu, Siqing Yuan, Hongxia Xu, Zhongtian Long, Jintai Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ATLAS框架与GeriMedBench基准,通过耦合图-策略蒸馏实现多病老年患者的个性化用药安全,在多基准测试中表现优于对比系统,获临床医生更高评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00549 2026-08-11 cs.LG 版本更新 81%

Beyond the Node: Clade-level Selection for Efficient MCTS in Automatic Heuristic Design

超越节点:用于自动启发式设计中高效MCTS的族级选择

Kezhao Lai, Yutao Lai, Hai-Lin Liu

机构 * School of Mathematics and Statistics, Guangdong University of Technology, China(数学与统计学学院,广东工业大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Clade-AHD通过族级贝叶斯信念替代节点级估计,有效解决自动启发式设计中MCTS的过度探索问题,提升决策可靠性并降低计算成本。

Comments v2 substantially expands the experimental evaluation with large-scale zero-shot benchmarks, broader baselines, and additional ablation and sensitivity analyses. Code: https://github.com/Mriya0306/Clade-AHD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11534 2026-08-11 cs.CV cs.CL cs.MM 版本更新 81%

HFS: Holistic Query-Aware Frame Selection for Efficient Video Understanding

HFS: 为高效视频推理的全局查询感知帧选择

Yiqing Yang, Yun Li, Daiqing Qi, Lehan Yang, Tianlong Wang, Wenhao Zhang, Sheng Li, Kin-man Lam

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :SLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 HFS提出一种端到端可训练的帧选择框架,通过任务自适应方法提升视频推理效率。

Comments Accepted to the Main Track of ACM Multimedia 2026 (ACM MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09703 2026-08-11 cs.AI cs.CL 新提交 81%

Matryoshka Language Model Suites

套娃语言模型套件

Nathan Godey, Yoav Artzi

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Matryoshka训练框架,将尺寸递增的子模型堆叠为端到端嵌套架构,训练含5亿、15亿、30亿参数子模型的套件,其性能与基线相当,训练计算量减少36%,推测解码吞吐量提升14-26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09444 2026-08-11 cs.LG cs.CL cs.DC 新提交 81%

Depth-adaptive Inference of Looped Language Models via Continuous Depth Batching

基于连续深度批处理的循环语言模型深度自适应推理

Kristian Schwethelm, Daniel Rueckert, Georgios Kaissis

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) Imperial College London(帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Potsdam(波茨坦大学) Hasso Plattner Institute for Digital Engineering(哈索·普拉特纳数字工程研究所)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文针对循环语言模型深度自适应推理中标准批处理失效的问题,提出连续深度批处理(CDB)方案,在两个模型上实现了接近理论上限的加速比,显著提升了吞吐量并降低了延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14363 2026-08-11 cs.CL cs.AI cs.CV 版本更新 81%

The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models

语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争

Akshay Paruchuri, Ishan Chatterjee, Henry Fuchs, Ehsan Adeli, Piotr Didyk

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) USI Lugano(卢加诺大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。

Comments 37 pages, 8 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26798 2026-08-11 cs.LG cs.AI 版本更新 81%

Explaining, Verifying, and Aligning Semantic Hierarchies in Vision-Language Model Embeddings

解释、验证和对齐视觉语言模型嵌入中的语义层次结构

Gesina Schwalbe, Mert Keser, Moritz Bayerkuhnlein, Edgar Heinert, Annika Mütze, Marvin Keller, Sparsh Tiwari, Georgii Mikriukov, Diedrich Wolter, Jae Hee Lee, Matthias Rottmann

机构 * University of Lübeck(吕贝克大学) Technical University of Munich(慕尼黑工业大学) AUMOVIO SE Osnabrück University(奥斯纳布吕克大学) Leibniz Institute for Agricultural Engineering and Bioeconomy(莱布尼茨农业工程与生物经济研究所) University of Hamburg(汉堡大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于解释、验证和对齐视觉语言模型嵌入中的语义层次结构,通过聚类和概念库匹配提取层次结构,并利用人类本体评估其合理性,最终提出基于本体的对齐方法以提升共享嵌入空间的语义对齐。

Comments camera-ready version of accepted IJCAI-ECAI 2026 paper including supplementary material; code: https://github.com/gesina/ontological-commitment

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08352 2026-08-11 cs.PL 新提交 80%

SimP: Unifying Syntax- and Semantic-Guided Techniques for Efficient Program Reduction

SimP:统一语法与语义引导技术的高效程序缩减方法

Ye Xiong, Xiangyu Gao, Qiaochu Chen, Mingyu Li, Haibo Chen

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 SimP框架结合传统与LLM式缩减技术,兼顾缩减效率与质量,且LLM成本可忽略,解决编译器漏洞调试中测试程序过大的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16598 2026-08-11 cs.CV 版本更新 80%

VisionSelector: End-to-End Learnable Visual Token Compression for Efficient Multimodal LLMs

VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩

Jiaying Zhu, Yurui Zhu, Xin Lu, Wenrui Yan, Dong Li, Kunlin Liu, Xueyang Fu, Zheng-Jun Zha

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09227 2026-08-11 cs.AI 新提交 79%

Omni2LoRA: Coherence-Preserving Parametric Memory for Efficient Omni Language Models

Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器

Puneet Mathur, Manan Suri, Dinesh Manocha

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09016 2026-08-11 cs.IR cs.LG 新提交 79%

PreGress: Ranking-Native Pre-training and Prompting for Graph Node Ranking

PreGress:面向图节点排序的原生排序预训练与提示学习框架

Lujie Ban, Jiasheng shi, Yingli Zhou, Kaiwen Xue, Daiyin Wang, Xubin Li, Shuanghua Li, Chenhao Ma

专题命中 效率与部署 :prompting(title,abstract);分类 cs.LG

AI总结 PreGress是首个原生排序预训练与提示学习框架,通过多任务预训练与轻量提示模块,在低开销下实现了多节点排序任务的优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08282 2026-08-11 cs.LG 新提交 79%

Stateful CARS: Exact Cross-History Reuse for Policy-Constrained LLM Agents

有状态CARS:策略约束大语言模型智能体的精确跨历史复用

Ibne Farabi Shihab, Md Najmus Swaqeeb, Abu Sa-Adat Mohamed Moon-Im Al Ahsan

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 效率与部署 :LLM(title);language model(abstract);分类 cs.LG

AI总结 本文针对受含义随观测和动作变化约束的工具使用语言模型智能体,提出有状态CARS方法,通过冻结状态-延续模式实现跨历史无效性证书复用,实验表明其精确性高但系统性能未优于官方CARS。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08256 2026-08-11 cs.CL 新提交 79%

AraSSM: A bidirectional state-space encoder for Arabic masked language modeling

AraSSM:面向阿拉伯语掩码语言建模的双向状态空间编码器

Ahmed Amine Aliane, Hassina Aliane, Nasredine Semmar

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 本文提出面向阿拉伯语的双向状态空间编码器AraSSM,经掩码语言建模预训练后,在四项阿拉伯语NLU基准上的表现接近或优于同规模Transformer,验证了消费级硬件训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08138 2026-08-11 cs.CV cs.LG 新提交 79%

EFFEKT: Efficient Federated Knowledge Transfer to Foundation Models

EFFEKT:面向基础模型的高效联邦知识迁移

Matteo Caligiuri, Francesco Barbato, Pietro Zanuttigh, Francesco Restuccia

机构 * Northeastern University(东北大学) University of Padua(帕多瓦大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 EFFEKT是一种联邦学习框架,通过双向跨蒸馏策略,结合轻量级客户端代理模型与服务器端基础模型,实现高效的领域特定LoRA适配器训练,在低功耗边缘设备上性能优于基线。

Comments 12 main content pages, 8 appendix pages; 3 main figures, 9 appendix figures; 8 main tables, 9 appendix tables; 1 main algorithm, 4 appendix algorithms; accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16305 2026-08-11 cs.CV cs.AI 版本更新 79%

LookME: Lookup-Based Multimodal Embeddings for Layer Injection in Vision-Language Models

LookME:用于视觉语言模型层注入的基于查找的多模态嵌入

Zeyu Xu, Xingzhong Hou, Pengkai Guo, Siling Lin, Xiao Xu, Menghua Zhai, Haoyu Chen, Yunke Zhang, Fei Huang

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 本文针对视觉语言模型在资源受限环境中部署的问题,提出LookME框架。通过分层两级查找方法和稀疏注入策略,实现基于查找的多模态嵌入增强,实验表明该方法优于仅文本的PLE风格方法,有效提升了模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02455 2026-08-11 cs.SD cs.CL eess.AS 版本更新 79%

Diagnostic-Driven Layer-Wise Compensation for Post-Training Quantization of Encoder-Decoder ASR Models

基于诊断的层间补偿用于编码器-解码器ASR模型的后训练量化

Xinyu Wang, Ziyu Zhao, Yajie Luo, Yihong Wu, Liheng Ma, Jingrui Tian, Lei Ding, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) University of Manitoba(曼尼托巴大学) Mila - Quebec AI Institute(魁北克AI研究院)

专题命中 效率与部署 :post-training(title,abstract);分类 cs.CL

AI总结 本文提出FADE框架,通过结合内在脆弱性评分和校准可靠性评分,为编码器-解码器ASR模型的各层分配适应性补偿系数,以平衡局部量化保真度与跨层误差校正,从而提升在3-4位精度下的词错误率性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09836 2026-08-11 cs.AI cs.CL 新提交 79%

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

失配很重要:超越token一致性的在线蒸馏

Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文针对在线蒸馏存在的退化一致性失效问题,提出TIDE方法修正师生失配,在数学推理基准上显著提升性能、缩短响应长度并减少格式错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07508 2026-08-11 cs.HC cs.AI cs.CL 新提交 79%

JaleesBench: Are AI Assistants Good Spiritual Company?

JaleesBench:AI助手能否成为良好的精神陪伴?

M. Waleed Kadous, Benjamin Olsen

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出JaleesBench基准测试,评估AI助手的精神陪伴能力,发现简单提示指导可提升通用模型的陪伴表现,领域微调助手的优势来自检索和提示层,还可用于改进现有宗教类AI助手。

Comments 21 pages, 8 figures, 4 tables. Open-source harness, scenario bank, proof texts, and full evaluation (model responses and both judges' verdicts): https://github.com/iaser-ai/jaleesbench . Interactive browser for inspecting scenarios, responses, and judge verdicts: https://s.iaser.ai/jb

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11505 2026-08-11 cs.LG cs.AI 版本更新 79%

Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update

代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式

Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02047 2026-08-11 cs.CL cs.AI 版本更新 79%

Goose: Anisotropic Speculation Trees for Training-Free Speculative Decoding

Goose:用于无训练推测解码的各向异性推测树

Tao Jin, Phuong Minh Nguyen, Naoya Inoue

机构 * Japan Advanced Institute of Science and Technology (JAIST)(日本先端科学技术大学院大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Goose通过构建适应性脊柱树,利用高接受率的上下文匹配令牌和低接受率的替代分支,实现无训练推测解码的各向异性树结构,提升解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18721 2026-08-11 cs.LG cs.AI 版本更新 79%

Towards Realistic Guarantees: A Probabilistic Certificate for SmoothLLM

迈向现实保证:一种概率证书用于SmoothLLM

Adarsh Kumarappan, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种概率框架,通过(k, ε)-unstable假设提升LLM对抗劫持攻击的安全性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01067 2026-08-11 cs.CV 版本更新 78%

ReACT-CLIP: Response-Aware Test-Time Defense for Vision--Language Models

ReACT-CLIP:面向视觉-语言模型的响应感知测试时防御

Hashmat Shadab Malik, Toluwani Aremu, Samuele Poppi, Muzammal Naseer, Salman Khan

专题命中 效率与部署 :language model(title,abstract)

AI总结 ReACT-CLIP是无需训练的响应感知测试时防御,通过跨噪声特征漂移与预测不稳定性得分动态调整修正强度,在多数据集上提升了CLIP类模型的对抗鲁棒性且保留干净准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16854 2026-08-11 cs.CV 版本更新 78%

Certainty Is Redundant: Token Sparsification for Efficient Camouflaged Object Detection with Vision Foundation Models

CATP:基于置信度的令牌修剪用于伪装目标检测

Yuhan Gao, Shuhao Kang, Xin He, Bing Li, Ming-Ming Cheng, Yun Liu

机构 * VCIP, College of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学) Academy for Advanced Interdisciplinary Studies, Nankai University(先进交叉学科研究院,南开大学) School of Computer Science and Engineering, Tianjin University of Technology(计算机科学与工程学院,天津工业大学) School of Information and Communication Engineering, UESTC(信息与通信工程学院,电子科技大学) Nankai International Advanced Research Institute, Shenzhen Futian(南开国际先进研究院,深圳福田)

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出CATP框架,通过分层修剪和双路径补偿机制提升伪装目标检测效率,减少计算量并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09185 2026-08-11 cs.DB cs.AI cs.SE 新提交 77%

SiriusDeliver: Automating Data Warehouse Delivery at Tencent

SiriusDeliver:腾讯的数据仓库交付自动化方案

Haining Xie, Xiaokai Zhou, Jiaming Yang, Siqi Shen, Ziwei Wang, Yifeng Zheng, Tengyue Xu, Yipeng Shi, Zefang Zong, Yang Li, Peng Chen, Jie Jiang, Debiao He, Xiao Yan, Jiawei Jiang

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 腾讯提出SiriusDeliver端到端交付自动化智能体,集成三类组件,经离线实验和腾讯云WeData大规模部署验证,可显著提升DW交付的成功率、效率,缩短交付时间与工程师工作量。

Comments 13 pages, 13 figures, 3 tables. Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09160 2026-08-11 cs.LG cs.DC 新提交 77%

SwiftQK: Fast and Communication-Efficient Tensor Parallelism for Query-Key Normalization

SwiftQK:面向查询-键归一化的快速且通信高效的张量并行方法

Gyudong Kim, Wonjun Han, Young Geun Kim

机构 * Korea University(高丽大学)

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SwiftQK是一种多GPU的RMSNorm核,通过仅交换标量归一化统计量并重叠归约与计算,大幅降低了张量并行下查询-键归一化的通信开销与延迟,提升了大型语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏