arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1088 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1088 篇

2606.21633 2026-08-04 cs.LG 版本更新 90%

HERALD: High-Throughput Block Diffusion LLM Serving via CPU-GPU Cooperative KV Cache Retrieval

HERALD: 通过CPU-GPU协同KV缓存检索实现高吞吐量块扩散LLM服务

Omin Kwon, Doyeon Kim, Jongseok Park, Seung Yul Lee, Ion Stoica, Jae W. Lee

机构 * Seoul National University(首尔国立大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对块扩散LLM中KV缓存随上下文增长导致吞吐量下降的问题,提出HERALD系统,利用块内去噪步骤间KV条目一致性,通过稀疏检索和计算重叠实现高精度低开销的KV卸载,在5-10%缓存预算下达到近无损精度,延迟降低1.59倍,吞吐量提升2.47倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07665 2026-08-04 cs.PL cs.AI 版本更新 90%

AgentCompile: An LLM-Guided Compiler for Direct CUDA Inference

AgentCompile:一种用于直接CUDA推理的LLM引导编译器

Xuanzhe Li, Ziyan Weng, Zhiyu Zhu, Junhui Hou

机构 * City University of Hong Kong (Dongguan)(香港城市大学(东莞)) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出AgentCompile,利用LLM提供语义建议,通过模板生成CUDA候选实现并验证,在多个Transformer模型上实现4-5.7倍加速。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25018 2026-08-03 cs.LG 版本更新 90%

Conformal Cascade: Distribution-Free Accuracy Guarantees for Multi-Tier LLM Inference

共形级联:多层大语言模型推理的无分布精度保证

Yifan Dou, Shikan Lian, Shibo Li

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对LLM级联推理成本高、置信分数校准不当等问题,提出共形级联框架,以共形预测集大小为推迟规则,提供无分布精度保证,在多基准测试中表现优于启发式级联,且无需模型训练,仅需黑盒API访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05150 2026-08-03 cs.SE cs.AI 版本更新 90%

Compiled AI: Deterministic Code Generation for LLM-Based Workflow Automation

编译AI:基于LLM的工作流自动化确定性代码生成

Geert Trooskens, Aaron Karlsberg, Anmol Sharma, Lamara De Brouwer, Max Van Puyvelde, Matthew Young, John Thickstun, Gil Alterovitz, Walter A. De Brouwer

机构 * XY.AI Labs, Palo Alto, CA(XY.AI实验室,帕洛阿尔托) Stanford University School of Medicine, Stanford, CA(斯坦福大学医学院,斯坦福) Cornell University, Department of Computer Science, Ithaca, NY(康奈尔大学计算机科学系,伊萨卡) Brigham and Women’s Hospital / Harvard Medical School, Boston, MA(布莱根妇女医院/哈佛医学院,波士顿)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究编译AI,一种大语言模型在编译阶段生成可执行代码,随后工作流确定性执行的范式。重点探讨其在高风险企业工作流中的应用,尤其在医疗领域,强调可靠性与可审计性。

Comments 14 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27744 2026-07-31 cs.AI 版本更新 90%

A Policy-Driven Runtime Layer for Agentic LLM Serving

一种面向智能体LLM服务的策略驱动运行时层

Rui Zhang, Chaeeun Kim, Liting Hu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对多智能体LLM系统中跨层策略难以高效实现的问题,提出在框架与引擎之间插入智能体运行时层,通过四个原语支持任意智能体感知策略,并在KV缓存策略CacheSage上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06256 2026-07-30 cs.AI 版本更新 90%

RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

RedKnot: 基于头部感知的KV重用和SegPagedAttention的高效长上下文LLM服务

Yang Liu, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Ruozhou He, Boyu Wang, Guanjie Chen, Tao Xie, Junhao Hu

机构 * Xiaohongshu Inc., China(小红书公司,中国) Peking University(北京大学) Huawei Cloud(华为云)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RedKnot系统,通过按KV头分解缓存并采用SegPagedAttention,实现位置无关的KV重用、前缀压缩、冷热分离和分布式放置,在不重训练模型的情况下提升资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12311 2026-07-27 cs.NI cs.CR cs.HC cs.LG 版本更新 90%

Cross-reality location privacy protection in 6G-enabled vehicular metaverses: an LLM-enhanced hybrid generative diffusion model-based approach

6G赋能车联网元宇宙中的跨现实位置隐私保护:一种基于LLM增强混合生成扩散模型的方法

Xiaofeng Luo, Jiayi He, Jiawen Kang, Ruichen Zhang, Zhaoshui He, Ekram Hossain, Dong In Kim

机构 * School of Automation, Guangdong University of Technology(自动化学院,广东技术大学) School of Computer Science and Engineering, Nanyang Technological University(计算机科学与工程学院,南洋理工大学) Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) Department of Electrical and Computer Engineering, Sungkyunkwan University(电气与计算机工程系,成均馆大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出了一种基于LLM增强混合生成扩散模型的方法,用于6G赋能车联网元宇宙中的跨现实位置隐私保护,通过混合动作优化平衡隐私保护、延迟降低和服务质量维护。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02187 2026-07-23 cs.CR cs.AI 版本更新 90%

Rewriting the Response Path: Silent Tampering and Provider-Signed Defense in BYOK LLM Agents

重写响应路径:BYOK LLM 代理中的静默篡改与提供者签名防御

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究BYOK LLM代理响应路径完整性问题,发现中继可篡改响应。提出sign-c服务器端方案,能认证执行承载字段和查询,本地垫片验证,加密保护机密性,防御有效拒绝篡改响应,误拒率为零,延迟开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11007 2026-07-14 cs.LG cs.DC 版本更新 90%

Device-Cloud Collaborative LLM Inference with Multi-Modal, Multi-Task, Multi-Turn Conversations

具有多模态、多任务、多轮对话的设备-云协作大语言模型推理

Liangqi Yuan, Dong-Jun Han, Shiqiang Wang, Christopher G. Brinton

机构 * School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science and Engineering, Yonsei University(延世大学计算机科学与工程系) Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型部署挑战,设计TMO设备-云推理系统,结合轻量级设备LLM和大规模云LLM,开发资源受限强化学习策略优化推理,贡献M4A1数据集,实验证明TMO在延迟、成本和响应质量方面效果显著。

Comments ACM MobiHoc 2025 (Best Paper Runner-Up) -> IEEE/ACM Transactions on Networking (extended journal version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14331 2026-07-03 cs.LG 版本更新 90%

LLM Priors for ERM over Programs

程序上经验风险最小化的LLM先验

Shivam Singhal, Priyadarsi Mishra, Eran Malach, Tomer Galanti

机构 * LLM Priors for ERM over Programs(LLM 优先级用于程序上的经验风险最小化)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出LLM-PV方法,利用预训练LLM作为先验,通过提议-验证机制实现程序类上的ERM选择,无需穷举枚举,在算法任务上从少量样本恢复规则并泛化到更长序列。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09735 2026-07-01 cs.AR cs.AI cs.DC cs.OS 版本更新 90%

KV-RM: Regularizing KV-Cache Movement for Static-Graph LLM Serving

KV-RM:为静态图LLM服务正则化KV缓存移动

Zhiqing Zhong, Zhijing Ye, Jian Zhang, Weijian Zheng, Bolun Sun, Xiaodong Yu

机构 * Stevens Institute of Technology(史蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Argonne National Laboratory(阿贡国家实验室) Northwestern University(西北大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出KV-RM,通过正则化KV缓存移动提升静态图LLM服务的灵活性,减少内存占用并降低延迟峰值。

Comments Withdrawn by the authors. The authors identified substantive errors that affect the interpretation of the results and the support for the main conclusions. The current version should not be relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19453 2026-07-01 cs.CL cs.GT 版本更新 90%

Beyond Scalar Rewards: Dense Feedback for LLM Policy Synthesis in Sequential Social Dilemmas

超越标量奖励:面向序列社会困境的LLM策略合成中的密集反馈

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi AI技术公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 本研究通过反馈工程,比较稀疏奖励与密集社会指标反馈对LLM在多智能体环境中生成程序化策略的影响,发现密集反馈能打破奖励别名,提升策略性能。

Comments Accepted to NExT-Game 2026: New Frontiers in Game-Theoretic Learning, ICML 2026 Workshop. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23088 2026-07-01 cs.CR cs.AI 版本更新 90%

From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching

从相似性到脆弱性:LLM语义缓存的密钥碰撞攻击

Zhixiang Zhang, Zesen Liu, Yuchong Xie, Quanfeng Huang, Dongdong She

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出语义缓存存在密钥碰撞攻击风险,通过CacheAttack框架在黑盒条件下实现86%的LLM响应劫持命中率,并能在不同嵌入模型间迁移,威胁智能体安全。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18266 2026-06-25 cs.LG 版本更新 90%

A Probabilistic Framework for LLM-Based Model Discovery

基于LLM的模型发现的概率框架

Stefan Wahl, Raphaela Schenk, Ali Farnoud, Jakob H. Macke, Daniel Gedon

机构 * Machine Learning in Science, University of Tübingen, Tübingen, Germany(图宾根大学机器学习科学系,图宾根,德国) Tübingen AI Center, Tübingen, Germany(图宾根人工智能中心,图宾根,德国) Department Empirical Inference, Max Planck Institute for Intelligent Systems, Tübingen, Germany(经验推断部门,智能系统马克斯·普朗克研究所,图宾根,德国)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 将模型发现重新定义为概率推理问题,提出基于序贯蒙特卡洛采样的ModelSMC算法,利用LLM迭代提出和优化候选模型,并通过似然加权选择,在真实科学系统中发现可解释机制并改进后验预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14141 2026-06-23 cs.AI 版本更新 90%

Distribution-Aware Algorithm Design with LLM Agents

具有LLM代理的分布感知算法设计

Saharsh Koganti, Priyadarsi Mishra, Pierfrancesco Beneventano, Tomer Galanti

机构 * Texas A&M University(德克萨斯大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了学习可执行求解器代码而非预测器的场景,提出求解器提示抽象,并证明其在正确性和运行时间上的泛化能力,通过LLM代码代理在多个组合优化问题上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23092 2026-06-18 cs.AI 版本更新 90%

Enhancing CVRP Solver through LLM-driven Automatic Heuristic Design

通过LLM驱动的自动启发式设计增强CVRP求解器

Zhuoliang Xie, Fei Liu, Zhenkun Wang, Qingfu Zhang

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AILS-AHD方法,结合进化搜索框架与大语言模型动态生成和优化破坏启发式,并引入加速机制,在中等和大规模CVRP实例上优于现有求解器,在CVRPLib大规模基准中10个实例上取得8个新最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15557 2026-06-18 cs.SE cs.CL 版本更新 90%

MORTAR: Multi-turn Metamorphic Testing for LLM-based Dialogue Systems

MORTAR:基于LLM的对话系统的多轮蜕变测试

Aaron Guoxiang Guo, Aldeida Aleti, Neelofar Neelofar, Chakkrit Tantithamthavorn, Yuanyuan Qi, Tsong Yueh Chen

机构 * Faculty of Information Technology, Monash University(墨尔本大学信息科技学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) School of Science, Computing and Emerging Technologies, Swinburne University of Technology(斯威本理工大学科学、计算与新兴技术学院)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 提出MORTAR方法,通过多轮蜕变关系自动化生成测试用例,解决LLM对话系统多轮测试中的预言问题,相比单轮测试每个用例发现更多且更高质量的缺陷。

Comments Accepted for publication in IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18897 2026-06-17 cs.DC cs.AI 版本更新 90%

Parallelizing Tool Execution and LLM Generation for Low-Latency Agent Serving

并行化工具执行与LLM生成以实现低延迟代理服务

Yifan Sui, Han Zhao, Rui Ma, Zhiyuan He, Hao Wang, Jianxun Li, Kaiqiang Xu, Kai Chen, Yuqing Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Microsoft Research(微软研究院) Stevens Institute of Technology(Stevens 工程学院) Google(谷歌) Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出PASTE系统,通过预测性执行未来工具调用与LLM生成并行,减少任务完成时间43.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06302 2026-06-16 cs.LG cs.SE 版本更新 90%

Tangram: Unlocking Non-Uniform KV Cache Compression for Efficient Multi-turn LLM Serving

Tangram: 解锁非均匀KV缓存以实现高效的多轮LLM服务

Hyungmin Kim, Minsoo Kim, Hongseok Kim, Jungwook Choi

机构 * Hanyang University(翰林大学) Rebellions Republic of Korea(Rebellions)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 针对多轮LLM服务中KV缓存线性增长导致的GPU内存和带宽压力,提出Tangram系统,通过确定性预算分配、头组页面和提前负载均衡三项技术实现非均匀KV缓存的高效管理,吞吐量提升达2.6倍。

Comments 13 pages. 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04547 2026-06-16 cs.IR cs.CL 版本更新 90%

Beyond Retrieval: Learning Compact User Representations for Scalable LLM Personalization

超越检索:学习紧凑用户表示以实现可扩展的LLM个性化

Heng Cao, Fan Zhang, Jian Yao, Yujie Zheng, Changlin Zhao, Lu Hao, Yuxuan Wei, Wangze Ni, Huaiyu Fu, Yuqian Sun, Xuyan Mo

机构 * Microsoft(微软公司) Shanghai International Studies University(上海国际问题研究大学) Zhejiang University(浙江大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TAP-PER框架,通过可学习的用户状态前缀嵌入编码用户偏好,避免显式提示构建和繁重的每用户适配器,在六个LaMP任务上优于基线方法,并显著减少参数开销。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09309 2026-06-16 cs.AI 版本更新 90%

Rescaling Confidence: What Scale Design Reveals About LLM Metacognition

重新缩放置信度:量表设计揭示LLM元认知

Yuyang Dai, Yuxia Wang

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学‘圣克莱门特·欧里德斯基’)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 研究LLM口头置信度受量表设计影响,发现0-20量表比标准0-100量表更有效提升元认知效率。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02908 2026-06-16 cs.LG cs.DC 版本更新 90%

Photon: Federated LLM Pre-Training

Photon: 联邦大语言模型预训练

Lorenzo Sani, Alex Iacob, Zeyu Cao, Royson Lee, Bill Marino, Yan Gao, Dongqi Cai, Zexi Li, Wanru Zhao, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Flower Labs(Flower实验室) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出Photon系统,首次实现联邦端到端LLM预训练,通过跨孤岛联邦学习在弱连接GPU上训练高达7B参数模型,通信量减少64-512倍,收敛速度比DiLoCo快2倍。

Comments 18 pages, 9 appendix pages, 12 figures, 3 algorithms, 12 tables

Journal ref Proceedings of Machine Learning and Systems 7 (MLSys 2025), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16120 2026-06-15 cs.AI 版本更新 90%

LLM-Powered AI Agent Systems and Their Applications in Industry

基于大语言模型的AI智能体系统及其工业应用

Guannan Liang, Qianqian Tong

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了从传统智能体到LLM驱动智能体的演进,分类为软件、物理和自适应混合系统,并讨论了在客服、软件开发、制造、教育、金融和医疗等领域的应用及挑战。

Comments This is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26940 2026-06-12 cs.CL 版本更新 90%

Select to Think: Unlocking SLM Potential with Local Sufficiency

Select to Think: 利用局部充分性解锁小语言模型潜力

Wenxuan Ye, Yangyang Zhang, Xueli An, Georg Carle, Yunpu Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :SLM(title,abstract);LLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 提出Select to Think (S2T)方法,通过将大语言模型角色从生成转为选择,并蒸馏选择逻辑到小语言模型,使其在推理时无需依赖大模型,显著提升性能。

Comments Accepted to ICML 2026. Code is available at https://github.com/YeRona/Select-to-Think

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17249 2026-06-09 cs.CR cs.AR cs.LG 版本更新 90%

Bit-Flip Vulnerability of Shared KV-Cache Blocks in LLM Serving Systems

LLM服务系统中共享KV缓存块的位翻转漏洞

Yuji Yamamoto, Satoshi Matsuura

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 研究揭示LLM服务系统中共享KV缓存块的位翻转漏洞,指出其具有静默分歧、选择性传播和持久累积特性,提出基于校验和的防护措施以限制累积损害。

Comments 12 pages, 4 figures. Accepted at SECRYPT 2026 (23rd International Conference on Security and Cryptography). Conference: https://secrypt.scitevents.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21788 2026-06-09 cs.DC cs.LG 版本更新 90%

Efficient Scaling of LLM Training with Flexible Context Parallelism

利用灵活上下文并行实现LLM训练的高效扩展

Yifan Niu, Han Xiao, Dongyi Liu, Wei Zhou, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对数据异构导致负载不均和通信冗余问题,提出自适应重配置通信组和上下文并行度的FCP策略,实现近线性加速比,最高达1.46倍吞吐提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20408 2026-06-09 cs.DC cs.AI 版本更新 90%

Meeting SLOs, Slashing Hours: Automated Enterprise LLM Optimization with OptiKIT

满足SLO,节省时间:使用OptiKIT实现企业级LLM自动化优化

Nicholas Santavas, Kareem Eissa, Patrycja Cieplicka, Piotr Florek, Matteo Nulli, Stefan Vasilev, Seyyed Hadi Hashemi, Antonios Gasteratos, Shahram Khadivi

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 提出OptiKIT分布式LLM优化框架,通过自动化复杂优化流程,为非专家团队提供动态资源分配和流水线执行,实现GPU吞吐量提升2倍以上,降低优化门槛。

Comments Accepted in MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00270 2026-08-11 cs.IR cs.AI cs.CL 版本更新 90%

LLMs Remember First, Forget Last: Dual-Process Interference in Large Language Models

Transformer 优先记住,最后遗忘:大型语言模型中的双过程干扰

Sourav Chattaraj, Kanak Raj

机构 * Thomson Reuters(汤姆森路透)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在面对冲突信息时的记忆保留机制,发现前瞻性干扰主导后置性干扰,揭示了Transformer注意力机制中的优先效应。

Comments NPIR, Springer book series: Lecture Notes in Networks and Systems, indexed by Scopus and Ei Compendex

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17974 2026-07-17 cs.LG cs.AI 版本更新 90%

Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models

广义Fisher加权奇异值分解:用于压缩大语言模型的可扩展克罗内克分解Fisher近似

Viktoriia Chekalina, Daniil Moskovskiy, Tatiana Matveeva, Andrey Kuznetsov, Evgeny Frolov

机构 * Applied AI Institute(应用人工智能研究所) Innopolis University(因诺普利斯大学) HSE University(俄罗斯高等经济大学)

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 研究针对大语言模型压缩,提出广义Fisher加权奇异值分解(GFWSVD)技术,通过考虑Fisher信息矩阵对角和非对角元素,引入可扩展的克罗内克分解近似算法,有效提升压缩效果,优于现有压缩基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07780 2026-07-16 cs.LG cs.CL 版本更新 90%

DarwinLM: Evolutionary Structured Pruning of Large Language Models

达尔文语言模型:大语言模型的进化结构化剪枝

Shengkun Tang, Oliver Sieberling, Eldar Kurtic, Zhiqiang Shen, Dan Alistarh

机构 * MBZUAI ETH Zurich(苏黎世联邦理工学院) ISTA Red Hat AI(红帽人工智能)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型计算成本高的问题,提出达尔文语言模型(DarwinLM),基于进化搜索过程,通过变异生成后代模型并经多步训练选择最优者,在多个模型上实验验证,实现结构化剪枝最优性能,压缩后训练所需数据更少。

Comments Accepted by COLM 2026 Code: https://github.com/IST-DASLab/DarwinLM

详情

展开后加载摘要…

URL PDF HTML 收藏