arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-02 至 2025-12-02 共收录 48 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 48 篇

2512.01672 2025-12-02 cs.LG cs.AI 92%

ICAD-LLM: One-for-All Anomaly Detection via In-Context Learning with Large Language Models

ICAD-LLM: 一种通过大语言模型上下文学习实现的通用异常检测方法

Zhongyuan Wu, Jingyuan Wang, Zexuan Cheng, Yilong Zhou, Weizhi Wang, Juhua Pu, Chao Li, Changqing Ma

专题命中 效率与部署 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ICAD-LLM通过大语言模型的上下文学习能力,实现跨领域和模态的通用异常检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00040 2025-12-02 cs.NI cs.AI 90%

Constrained Network Slice Assignment via Large Language Models

通过大语言模型实现受约束的网络切片分配

Sagar Sudhakara, Pankaj Rajak

机构 * University of Southern California(南加州大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文利用大语言模型实现网络切片分配,通过零样本提示生成初始分配方案,并结合优化求解器提升性能,实现高效的5G网络资源分配。

Comments Accepted at NeurIPS 2025 Workshop on AI and ML for Next-Generation Wireless Communications and Networking (AI4NextG), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00083 2025-12-02 cs.AR cs.DC 89%

LLaMCAT: Optimizing Large Language Model Inference with Cache Arbitration and Throttling

LLaMCAT:通过缓存仲裁和限流优化大语言模型推理

Zhongchun Zhou, Chengtao Lai, Wei Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 LLaMCAT通过缓存仲裁和限流技术优化大语言模型推理,实现1.26-1.58倍速度提升,填补LLM解码特定MSHR竞争的空白。

Comments Accepted to ICPP 2025

Journal ref In Proceedings of 54th International Conference on Parallel Processing (ICPP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01949 2025-12-02 cs.CV 88%

Script: Graph-Structured and Query-Conditioned Semantic Token Pruning for Multimodal Large Language Models

脚本:图结构和查询条件的语义令牌修剪用于多模态大语言模型

Zhongyu Yang, Dannong Xu, Wei Pang, Yingfang Yuan

机构 * BCML, Heriot-Watt University(赫瑞瓦德大学BCML中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 Script通过图结构和查询条件的语义令牌修剪,提升多模态大语言模型的效率和准确性,实现显著的性能提升。

Comments Published in Transactions on Machine Learning Research, Project in https://01yzzyu.github.io/script.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20015 2025-12-02 cs.AI cs.CL 86%

Efficient LLM-Jailbreaking via Multimodal-LLM Jailbreak

通过多模态大语言模型 jailbreak 实现高效的 LLM-jailbreaking

Haoxuan Ji, Zheng Lin, Zhenxing Niu, Xinbo Gao, Gang Hua

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种通过多模态大语言模型实现高效 LLM-jailbreaking 的方法,结合图像-文本语义匹配提升攻击成功率,并在效率和泛化能力上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01002 2025-12-02 cs.LG cs.DC 85%

Optimal Scheduling Algorithms for LLM Inference: Theory and Practice

LLM推理的最优调度算法:理论与实践

Agrim Bari, Parikshit Hegde, Gustavo de Veciana

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SLAI调度器,通过动态资源分配和实时测量优化LLM推理的吞吐量和延迟,减少TTFT并提高服务容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00119 2025-12-02 cs.CR cs.AI 85%

NetDeTox: Adversarial and Efficient Evasion of Hardware-Security GNNs via RL-LLM Orchestration

NetDeTox: 通过RL-LLM协同实现对硬件安全GNN的对抗性高效逃避

Zeng Wang, Minghao Shao, Akashdeep Saha, Ramesh Karri, Johann Knechtel, Muhammad Shafique, Ozgur Sinanoglu

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NetDeTox通过RL-LLM协同实现对硬件安全GNN的高效对抗性逃避,减少重写次数和面积开销,提升安全性方案的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01644 2025-12-02 cs.AR 85%

A Systematic Characterization of LLM Inference on GPUs

对GPU上LLM推理的系统性表征

Haonan Wang, Xuxin Xiao, Mingyu Yan, Zhuoyuan Zhu, Dengke Han, Duo Wang, Wenming Li, Xiaochun Ye, Cunchen Hu, Hongyang Chen, Guangyu Sun

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统性分析,揭示了GPU上LLM推理的四维框架,包括异质性观察、微架构分析、系统扩展原则和新兴范式边界,为LLM推理提供了新的优化方向和理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00335 2025-12-02 cs.AR 85%

Efficient Kernel Mapping and Comprehensive System Evaluation of LLM Acceleration on a CGLA

高效内核映射与LLM加速在CGLA上的综合系统评估

Takuto Ando, Yu Eto, Ayumu Takeuchi, Yasuhiko Nakashima

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种非AI专用的CGLA加速器,通过高效内核映射和综合系统评估,展示了其在LLM推断中的高能效和性能-能耗折中优势。

Comments This paper is published at IEEE Access

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18583 2025-12-02 cs.LG cs.PF 83%

PARD: Accelerating LLM Inference with Low-Cost PARallel Draft Model Adaptation

PARD:通过低成本并行草稿模型适应加速大语言模型推理

Zihao An, Huajun Bai, Ziqiong Liu, Dong Li, Emad Barsoum

机构 * Advanced Micro Devices, Inc.(先进微器件公司) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PARD通过低成本并行草稿模型适应技术,显著提升大语言模型推理速度,实现3.67倍加速。

Comments Submitted for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10205 2025-12-02 cs.LG 82%

AWP: Activation-Aware Weight Pruning and Quantization with Projected Gradient Descent

AWP: 基于激活感知的权重剪枝与量化方法(投影梯度下降)

Jing Liu, Toshiaki Koike-Akino, Ye Wang, Hassan Mansour, Matthew Brand

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 AWP通过投影梯度下降方法实现激活感知的权重剪枝与量化,优于现有LLM压缩技术。

Comments ICML 2025 workshop on Efficient Systems for Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00719 2025-12-02 cs.DC 82%

SIMPLE: Disaggregating Sampling from GPU Inference into a Decision Plane for Faster Distributed LLM Serving

SIMPLE: 将采样从GPU推理中分解到决策平面以实现更快的分布式LLM服务

Bohan Zhao, Zane Cao, Yongchao He

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract)

AI总结 SIMPLE通过将采样分解到CPU侧,结合序列并行和热点词汇采样,显著提升分布式LLM服务的吞吐量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01181 2025-12-02 cs.LG cs.AI cs.CV 81%

First On-Orbit Demonstration of a Geospatial Foundation Model

地球观测基础模型的首次在轨演示

Andrew Du, Roberto Del Prete, Alejandro Mousist, Nick Manser, Fabrice Marre, Andrew Barton, Carl Seubert, Gabriele Meoni, Tat-Jun Chin

机构 * SmartSat CRC Thales Alenia Space(泰雷兹阿莱尼亚空间)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种紧凑的地球观测基础模型,通过模型压缩和领域适应,在国际空间站实现了可靠的在轨推理,展示了在资源受限环境下高效执行地球观测任务的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05179 2025-12-02 cs.LG cs.AI cs.NI 81%

Evaluating Spatio-Temporal Forecasting Trade-offs Between Graph Neural Networks and Foundation Models

评估图神经网络与基础模型在时空预测中的权衡

Ragini Gupta, Naman Raina, Bo Chen, Li Chen, Claudiu Danilov, Josh Eckhardt, Keyshla Bernard, Klara Nahrstedt

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Louisiana at Lafayette(路易斯安那州立大学拉斐特分校) Boeing Research and Technology(波音研究与技术)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了不同模型在时空预测中的表现,发现STGNNs在稀疏部署中有效,而TSFMs在高频下表现良好,但空间覆盖减少时退化,Moirai模型表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06349 2025-12-02 cs.LG cs.AI cs.MA 81%

Flexible Swarm Learning May Outpace Foundation Models in Essential Tasks

灵活的群体学习可能在关键任务上超越基础模型

Moein E. Samadi, Andreas Schuppert

机构 * Institute for Computational Biomedicine, RWTH Aachen University(计算生物医学研究所,亚琛工业大学) Center for Computational Life Sciences, RWTH Aachen University(计算生命科学中心,亚琛工业大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种去中心化的群体学习架构,通过多个小代理网络实现自我适应,以在动态环境中超越传统基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01649 2025-12-02 eess.AS cs.LG cs.SD 79%

Safeguarding Privacy in Edge Speech Understanding with Tiny Foundation Models

在边缘语音理解中利用小型基础模型保护隐私

Afsara Benazir, Felix Xiaozhu Lin

机构 * Department of Computer Science(计算机科学系) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 SpeechShield通过在边缘设备上利用小型基础模型实现语音隐私保护,有效过滤敏感信息并提升转录性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00207 2025-12-02 cs.LG cs.AI 79%

Constructing Efficient Fact-Storing MLPs for Transformers

构建高效的事实存储MLP用于Transformer

Owen Dugan, Roberto Garcia, Ronny Junkins, Jerry Liu, Dylan Zinsley, Sabri Eyuboglu, Atri Rudra, Chris Ré

机构 * Computer Science Department, Stanford University(斯坦福大学计算机科学系) Institute for Computational & Mathematical Engineering, Stanford University(斯坦福大学计算与数学工程研究所) Computer Science Department, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Computer Science and Engineering Department, University at Buffalo(布法罗大学计算机科学与工程系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种改进的MLP构造框架,提升了事实存储效率和实用性,并揭示了MLP事实存储能力与Transformer实用性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14450 2025-12-02 cs.DC 78%

Hyperion: Hierarchical Scheduling for Parallel LLM Acceleration in Multi-tier Networks

Hyperion:多级网络中并行大语言模型加速的分层调度

Mulei Ma, Xinyi Xu, Minrui Xu, Zihan Chen, Yang Yang, Tony Q. S. Quek

专题命中 效率与部署 :LLM(title,abstract)

AI总结 Hyperion通过分层调度优化多级网络中大语言模型的并行加速,显著降低延迟并提升GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00948 2025-12-02 cs.HC 78%

Graph Queries from Natural Language using Constrained Language Models and Visual Editing

通过约束语言模型和视觉编辑进行自然语言图形查询

Benedikt Kantz, Kevin Innerebner, Peter Waldert, Stefan Lengauer, Elisabeth Lex, Tobias Schreck

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出了一种通过自然语言和视觉编辑生成知识图谱查询的方法,利用约束语言模型生成原型图,并在本体约束下生成有效SPARQL查询。

Comments 8 pages, 3 figures, 3 tables, accepted and presented at ICKG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01980 2025-12-02 cs.LG 77%

Low-Rank Prehab: Preparing Neural Networks for SVD Compression

低秩预准备:为SVD压缩准备神经网络

Haoran Qin, Shansita Sharma, Ali Abbasi, Chayne Thrash, Soheil Kolouri

机构 * Department of Computer Science, Vanderbilt University(计算机科学系,范德比尔特大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 低秩预准备通过在SVD压缩前优化权重结构,提升压缩后模型性能和恢复效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01953 2025-12-02 cs.LG 77%

KV Pareto: Systems-Level Optimization of KV Cache and Model Compression for Long Context Inference

KV Pareto: 系统层面优化KV缓存与模型压缩以实现长上下文推理

Sai Gokhale, Devleena Das, Rajeev Patwari, Ashish Sirasao, Elliott Delaye

机构 * Georgia Institute of Technology(佐治亚理工学院) Advanced Micro Devices (AMD)(先进微器件(AMD))

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 KV Pareto通过系统层面优化KV缓存与模型压缩,实现长上下文推理中的内存效率与准确率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01939 2025-12-02 cs.SE cs.AI 77%

An Empirical Study of Agent Developer Practices in AI Agent Frameworks

关于AI代理框架中代理开发者实践的实证研究

Yanlin Wang, Xinyi Xu, Jiachi Chen, Tingting Bi, Wenchao Gu, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) The University of Melbourne(墨尔本大学) Technical University of Munich(慕尼黑技术大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过实证研究分析了基于LLM的代理框架在开发效率、功能抽象、学习成本、性能优化和可维护性方面的差异,揭示了开发者在选择和使用框架时的挑战与需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21669 2025-12-02 cs.LG cs.DC 77%

DSD: A Distributed Speculative Decoding Solution for Edge-Cloud Agile Large Model Serving

DSD:一种用于边缘-云敏捷大模型服务的分布式推测解码方案

Fengze Yu, Leshu Li, Brad McDanel, Sai Qian Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 DSD提出了一种分布式推测解码框架,通过自适应窗口控制策略提升边缘-云环境下大模型服务的性能和扩展性。

Comments Correct to author's name from 'Saiqian Zhang' to 'Sai Qian Zhang'

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20285 2025-12-02 cs.AI 77%

Schema Matching on Graph: Iterative Graph Exploration for Efficient and Explainable Data Integration

图谱匹配:用于高效且可解释的数据整合的迭代图探索

Mingyu Jeon, Jaeyoung Suh, Suwan Cho

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SMoG通过迭代执行简单1跳SPARQL查询,实现高效且可解释的图谱匹配,适用于医疗数据整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00010 2025-12-02 cs.HC cs.AI 77%

Leveraging LLMs for Design Ideation: An AI Tool to Assist Creativity

利用LLMs进行设计构思:一种辅助创造力的AI工具

Rutvik Kokate, Pranati Kompella, Prasad Onkar

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种名为ALIA的AI工具,利用LLMs通过语音交互提升设计构思阶段的创造性潜力。

Comments 9 pages, 4 figures

Journal ref Responsible and Resilient Design for Society, Volume 4. ICoRD 2025, pp 579 to 589

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11679 2025-12-02 cs.CR cs.AI 77%

LLMs on support of privacy and security of mobile apps: state of the art and research directions

大型语言模型在支持移动应用隐私和安全中的作用:现状与研究方向

Tran Thanh Lam Nguyen, Barbara Carminati, Elena Ferrari

机构 * Department of Theoretical and Applied Science (DISTA)(理论与应用科学系) University of Insubria(因斯布里亚大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在移动应用安全和隐私保护中的应用,分析了其在缓解常见安全风险中的潜力及面临的挑战。

Comments I am writing to respectfully request the withdrawal of my recent submission to arXiv due to an authorship issue. The paper was submitted without the explicit consent of two co-authors. After internal discussion, they have expressed clear disagreement with the submission and raised concerns about unresolved academic inaccuracies in the current version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01546 2025-12-02 stat.ML cs.AI cs.CL cs.LG 75%

LPCD: Unified Framework from Layer-Wise to Submodule Quantization

LPCD:从层到子模块的统一框架

Yuma Ichikawa, Yudai Fujimoto, Akira Sakai

机构 * Fujitsu Limited(富士通株式会社) RIKEN Center for AIP(理化学研究所AIP研究中心) Institute of Science Tokyo(东京科学研究所) Tokai University(东海大学)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LPCD提出了一种统一的后训练量化框架,通过优化子模块和投影层量化器,提升复杂子模块的量化效率和兼容性。

Comments 21 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01147 2025-12-02 cs.LG 74%

Projection-Free CNN Pruning via Frank-Wolfe with Momentum: Sparser Models with Less Pretraining

基于动量的Frank-Wolfe方法的CNN剪枝:更稀疏的模型需更少预训练

Hamza ElMokhtar Shili, Natasha Patnaik, Isabelle Ruble, Kathryn Jarjoura, Daniel Suarez Aguirre

机构 * Rice University, Computer Science Department(Rice大学计算机科学系) Rice University, Computational Applied Math & Operations Research Department(Rice大学计算应用数学与运筹学系)

专题命中 效率与部署 :pretraining(title);分类 cs.LG

AI总结 本文提出基于动量的Frank-Wolfe方法用于CNN剪枝,发现该方法能生成更稀疏且更准确的模型,且预训练需求较低。

Comments Preliminary preprint; numerical experiments are still being validated and may be updated in future revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01252 2025-12-02 cs.LG cs.CV 70%

Efficient Training of Diffusion Mixture-of-Experts Models: A Practical Recipe

扩散混合专家模型的高效训练:一种实用配方

Yahui Liu, Yang Yue, Jingyuan Zhang, Chenxi Sun, Yang Zhou, Wencong Zeng, Ruiming Tang, Guorui Zhou

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种高效训练扩散混合专家模型的方法,通过优化架构配置提升模型性能,提供实用且高效的训练方案。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00722 2025-12-02 cs.AI 70%

SpeContext: Enabling Efficient Long-context Reasoning with Speculative Context Sparsity in LLMs

SpeContext: 通过推测上下文稀疏性在LLMs中实现高效的长上下文推理

Jiaming Xu, Jiayi Pan, Hanzhen Wang, Yongkang Zhou, Jiancai Ye, Yu Wang, Guohao Dai

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 SpeContext通过推测上下文稀疏性,在LLMs中实现高效的长上下文推理,显著提升云和边缘环境的吞吐量和速度,同时保持精度。

Comments Accepted by ASPLOS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏