arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12294 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2073 篇

2608.05303 2026-08-07 cs.AR cs.CL cs.LG 新提交 90%

EdgeXpert: An Edge Device for Memory-Efficient LLM Inference with Mixture-of-Experts and Speculative Decoding

EdgeXpert:一种基于混合专家与推测解码的内存高效型大语言模型推理边缘设备

Sangwoo Ha, Hyunwoo Seo, Yurim Jo, Youngjin Moon, Hoi-Jun Yoo

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 EdgeXpert是一款软硬件协同设计的LLM加速器,通过优化预填充与解码阶段的专家处理,解决推测解码与MoE的兼容性问题,在降低延迟与能耗的同时维持精度,适用于边缘设备的LLM推理。

Comments Accepted at the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03036 2026-08-05 cs.SE cs.AI cs.LG 新提交 90%

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

野外环境下的大语言模型服务:框架、方法与系统设计的实证研究

Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh, Heng Li

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02680 2026-08-05 cs.SE cs.AI cs.LG 新提交 90%

TraceCompiler: Skill-Guided Mining and Compilation of LLM Agent Traces into Mostly Deterministic Workflows

TraceCompiler:技能引导的LLM智能体轨迹挖掘与编译为近确定性工作流

Salma El Yadouni, Guanyi Li

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出TraceCompiler系统,通过技能引导挖掘含噪声的LLM智能体轨迹并编译为近确定性工作流,在T1、AppWorld数据集上验证了依赖恢复的高精度,实现了Venmo资金请求意图的调用减少。

Comments 17 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01975 2026-08-04 cs.SE cs.CL cs.LG cs.PF 新提交 90%

TELLER: Non-intrusive Cross-Layer Root-Cause Analysis for LLM Inference

TELLER:面向大语言模型推理的非侵入式跨层根因分析

Ruilin Xu, Junyi Li, Pengfei Chen, Zongxuan Xie

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 TELLER是面向LLM推理的非侵入式跨层根因分析框架,通过跟踪与日志结合实现异常定位与自然语言解释,在多节点GPU工作负载上兼具高效压缩与诊断性能,为LLM推理RCA提供实用支撑。

Comments 12 pages, 1 figure, 9 tables. Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01651 2026-08-04 cs.DC cs.CL cs.LG 新提交 90%

Bole: Efficient Tree Speculation for Hybrid-Attention Language Models

Bole:面向混合注意力语言模型的高效树推测解码

Li Wang, Yi Su, Xiabao Wu, Chiran You, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng, Fangxin Liu, Jie Zhang, Chen Tian, Chengying Huan

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 Bole是内核-运行时协同设计方案,通过优化树推测解码的线性注意力树验证与瞬态内存管理,显著提升混合注意力LLM的离线解码吞吐量与在线智能体工作负载的延迟性能。

Comments 14 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18265 2026-07-22 cs.AI cs.CL 新提交 90%

State Compression in Two-Agent LLM Relays: A Closed-World Study of Constraint Preservation

双智能体语言模型中继中的状态压缩:约束保留的封闭世界研究

Anantha Sharma, Sheeba Elizabeth John, Kaarthik Senthil Kumar, Saratsuhas Vijayababu

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究双智能体LLM中继中交接压缩问题,比较无压缩、叙述性总结、JSON提取、基于嵌入的修剪四种交接条件,发现交接表示影响下游可行性,JSON提取可行性准确率最高达0.96,结构化可审计表示利于约束检查。

Comments 8 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10661 2026-07-14 cs.CL cs.AI 新提交 90%

Unlocking Parallelism in Autoregressive Language Models via Speculative Decoding with Progressive Tree Drafting

通过渐进式树状草稿的推测性解码解锁自回归语言模型中的并行性

Zipeng Gao, Zhi Zheng, Qingrong Xia, Junda Lin, Ziwei Zhao, Tong Xu, Zhefeng Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出渐进式树状草稿(PTD)方法,通过结构化、引导式并行草稿策略利用模型并行潜力,结合渐进树结构与逐步修剪机制,在单次前向传播中引导LLM探索多条语义路径,实现高达2倍解码加速且无需训练、与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07321 2026-07-09 cs.AI cs.CL cs.MA 新提交 90%

From Atomic Actions to Standard Operating Procedures: Iterative Tool Optimization for Self-Evolving LLM Agents

从原子动作到标准操作程序:自进化语言模型智能体的迭代工具优化

Haipeng Ding, Yuexiang Xie, Zhewei Wei, Yaliang Li, Bolin Ding

机构 * Renmin University of China(中国人民大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有LLM智能体框架问题,提出将原子动作合成SOP实现自进化,介绍EvoSOP框架,经实验验证该框架能显著提升任务成功率、减少交互轮数,为自进化智能体开发提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06527 2026-07-08 cs.CL cs.AI 新提交 90%

RSF-GLLM: Bridging the Semantic Gap in Multi-Hop Knowledge Graph QA via Recurrent Soft-Flow and Decoupled LLM Generation

RSF-GLLM:通过循环软流和去耦语言模型生成弥合多跳知识图谱问答中的语义鸿沟

Sambaran Bandyopadhyay, Ananth Muppidi

机构 * Adobe Research(Adobe研究院) Adobe Systems(Adobe系统公司)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究多跳知识图谱问答中传统方法的语义鸿沟问题,提出RSF-GLLM框架,通过循环软流模块传播分数、引入正则化保证收敛,提取路径微调LLM,实验证明该方法性能优且推理效率高。

Comments Accepted for publication in ICML 2026 as a full research paper; 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00733 2026-07-02 cs.LG cs.AI 新提交 90%

LLM-Guided ODE Discovery and Parameter Inference from Small-Cohort Aggregate Data

LLM引导的ODE发现与小群体聚合数据的参数推断

Hanning Yang, Meropi Karakioulaki, Lennart Purucker, Tim Litwin, Cristina Has, Moritz Hess

机构 * Institute of Medical Biometry and Statistics, Faculty of Medicine and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院医学统计与生物统计研究所) Department of Dermatology, Medical Faculty and Medical Center, University of Freiburg(弗莱堡大学医学中心与医学院皮肤科) Prior Labs, University of Freiburg(弗莱堡大学Prior实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出AgentODE框架,利用LLM提出候选ODE结构,并通过工具增强的推理代理仅基于群体级汇总统计量迭代优化参数分布,实现从稀疏、噪声数据中发现可解释的ODE结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21869 2026-06-23 cs.CL cs.AI 新提交 90%

The Language-Energy Divide: Measuring Energy Costs of Multilingual LLM Inference

语言-能量鸿沟:衡量多语言大模型推理的能量成本

Naihao Deng, Alissa Shen, Yiming Feng, Joan Nwatu, Jae-Won Chung, Mosharaf Chowdhury, Yulong Chen, Rada Mihalcea

机构 * University of Michigan(密歇根大学) University of Cambridge(剑桥大学) University of Aberdeen(阿伯丁大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 系统研究多语言LLM推理的能量消耗,发现不同语言间每token能耗差异达8.3倍,总能耗差异达179倍,低资源语言能耗高且准确率低,建议将能量作为评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20640 2026-06-23 cs.AI cs.LG math.OC 新提交 90%

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

面向乘客导向自动驾驶的LLM可解释DRL框架

Ouided Braoui, Meriem Bouali, Nadir Farhi

机构 * LITAN, ESTIN(LITAN,ESTIN) Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09613 2026-06-23 cs.CL cs.AI 新提交 90%

AGENTSERVESIM: A Hardware-aware Simulator for Multi-Turn LLM Agent Serving

AGENTSERVESIM:面向多轮LLM智能体服务的硬件感知模拟器

Rakibul Hasan Rajib, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中佛罗里达大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出AGENTSERVESIM模拟器,通过程序编排器、工具模拟器、会话感知路由器和KV驻留模型等模块,在程序粒度上评估多轮LLM智能体服务策略,在CPU上以6%误差复现真实系统行为。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16100 2026-06-16 cs.CR cs.CL cs.LG 新提交 90%

Your "Pro" LLM Subscription May Actually Be "Free": Exposing Fingerprint Spoofing Risks in LLM Inference Services

你的“专业”LLM订阅可能实际上是“免费”的:揭示LLM推理服务中的指纹欺骗风险

Jiahao Zhang, Xiuyu Li, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出指纹欺骗攻击,恶意服务商通过参数高效微调弱模型模仿强模型,绕过用户指纹验证;理论证明用户资源限制导致指纹易被欺骗,并设计GhostPrint攻击框架,实验表明其能以低成本持续绕过主流指纹方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15652 2026-06-16 cs.LG cs.CL 新提交 90%

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

MosaicQuant: 基于内点-离点分离的统一4位LLM量化

Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

机构 * HKUST(香港科技大学) EPFL(瑞士联邦理工学院洛桑) MetaX Integrated Circuits Co., Ltd(MetaX集成电路有限公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出MosaicQuant,通过将权重矩阵量化为密集4位基分量和稀疏4位残差分量,结合ZipperEngine融合稀疏块计算,实现统一4位推理,在LLaMA3和Qwen3上保持近FP16精度并加速1.24倍。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15333 2026-06-16 cs.CL cs.LG 新提交 90%

Replay What Matters: Off-Policy Replay for Efficient LLM Reinforcement Unlearning

重放重要内容:面向高效LLM强化反学习的离策略重放

Zirui Pang, Chenlong Zhang, Haosheng Tan, Zhuoran Jin, Jiaheng Wei, Zixin Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Glasgow(格拉斯哥大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 针对LLM反学习中在线策略优化对困难样本利用不足的问题,提出ReRULE方法,通过离策略重放缓冲区存储并复用低奖励困难样本,在保持通用性的同时提升反学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08454 2026-06-09 cs.LG cs.CL 新提交 90%

Beyond Linear Activation Steering: Invertible Latent Transformations for Controlling LLM Behavior

超越线性激活引导:用于控制大语言模型行为的可逆潜在变换

Tuc Nguyen, Thai Le

机构 * Indiana University Bloomington(印第安纳大学伯明顿分校)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出INNSteer框架,通过可逆神经网络将LLM激活映射到潜在空间进行线性控制,再逆变换回原空间,实现非线性、输入依赖的激活引导,在多个模型和基准上优于现有方法。

Comments 36 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07419 2026-08-10 cs.LG 新提交 90%

Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration

超越事后温度缩放:用于大语言模型校准的双层优化方法

Ruochen Jin, Zhanliang Wang, Zongyu Dai, Jiancong Xiao, Bojian Hou

机构 * Dartmouth College(达特茅斯学院) University of Pennsylvania(宾夕法尼亚大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract,comments);large language model(abstract);分类 cs.LG

AI总结 针对LLM偏好对齐导致的过度自信与校准问题,提出基于双层优化的校准方法,通过最大化预测分布熵实现,在多项选择与开放式问答任务中提升了校准效果与域外泛化能力。

Comments Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17104 2026-06-17 cs.AR cs.AI cs.DC 新提交 90%

Prefill/Decode-Aware Evaluation of LLM Inference on Emerging AI Accelerators

新兴AI加速器上LLM推理的Prefill/Decode感知评估

Shun Usami, Venkatram Vishwanath, E. Wes Bethel

机构 * Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) Argonne National Laboratory(阿贡国家实验室) Lawrence Berkeley National Laboratory(伯克利国家实验室)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分离测量Prefill和Decode阶段,评估GPU与新兴AI加速器在Llama2-7B模型上的推理性能,发现GPU在计算密集的Prefill阶段占优,而GroqRack在Decode延迟上更优,但GPU随批处理增大在吞吐上反超。

Comments 8 pages, 5 figures. Accepted to the Workshop on HPC for AI Foundation Models & LLMs for Science (HPAI4S'26), co-located with IEEE IPDPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08744 2026-08-11 cs.CL cs.AI cs.CE cs.ET cs.LG 新提交 90%

Can We Optimize the Performance-Carbon Emission Break-Even Point?: The Quest for Greener LLMs

我们能否优化性能-碳排放盈亏平衡点?——探寻更环保的大语言模型(LLM)

Sourav Das, Tanmay Joshi, Kripabandhu Ghosh

专题命中 效率与部署 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探究能否通过将感知碳排放的联合损失机制用于微调,在Gemmc-2 2B等三类LLM上实现推理性能与碳排放的盈亏平衡,发现碳排放项作用随任务结构变化,提出轻量正则化方案。

Comments 13 Pages, 6 Figures, Submitted to ARR Cycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08188 2026-08-11 cs.AI cs.CL cs.LG 新提交 90%

Quantization Degradation in Large Language Models: A Signal-Noise Perspective

大语言模型中的量化退化:一种信号-噪声视角

Chenxi Zhou, Pengfei Cao, Jinyu Ye, Bohan Yu, Haida Yu, Jiang Li, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Inner Mongolia University(内蒙古大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究从信号-噪声视角,系统分析了不同位宽、量化方法等因素下大语言模型量化退化的规律,揭示了退化源于源端误差产生与跨层累积的共同作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28341 2026-07-31 cs.CV 新提交 90%

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

捕捉令牌趋势以实现多模态大语言模型中无需训练的令牌剪枝

Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) Xiamen Ocean Vocational College(厦门海洋职业技术学院) Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对多模态大语言模型现有无训练剪枝方法忽略令牌重要性动态变化的问题,提出趋势感知剪枝框架,通过捕捉注意力流动量实现动态修正,大幅减少视觉令牌且保持性能,实现高效多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18640 2026-07-22 eess.SP 新提交 90%

Semantic-Aware Data-Aided Channel Estimation with Large Language Models for MIMO Systems

用于MIMO系统的基于大语言模型的语义感知数据辅助信道估计

Sojeong Park, Jaehyun Choi, Hyun Jong Yang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对MIMO系统,提出基于大语言模型的语义感知数据辅助信道估计框架,利用语义信息进行可靠符号选择与校正,采用两层机制,仿真表明该框架在归一化均方误差和误码率上优于传统方案,接近理想估计器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07142 2026-07-09 cs.NI 新提交 90%

Small Language Model-based Control for BBR over Low Earth Orbit Satellite Internet

基于小语言模型的低地球轨道卫星互联网上的BBR控制

Rakshitha De Silva, Shiva Raj Pokhrel, Jonathan Kua

专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 研究低地球轨道卫星互联网中BBR控制问题,提出基于小语言模型的自适应框架,结合多种技术生成可行步调动作,实验表明该框架能在保持吞吐量优势时大幅减少重传,降低计算成本。

Comments 10 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04749 2026-07-07 cs.DC 新提交 90%

Direct Model State Migration for Elastic Training of Large Language Models

用于大语言模型弹性训练的直接模型状态迁移

Weijian Liu, Mingzhen Li, Rui Kang, Chen Sun, Guangming Tan, Weile Jia

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究大语言模型训练适应共享集群动态资源的问题,提出无检查点状态迁移框架ETC,利用状态局部性和通信合并减少GPU间数据移动,相比基于检查点的方案降低迁移开销,实现高效弹性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31016 2026-07-01 cs.NI 新提交 90%

Beyond Wireless Security: Covert Communications in Large Language Model-enabled Edge Networks

超越无线安全:大语言模型赋能边缘网络中的隐蔽通信

Yuanai Xie, Jiaxin Chen, Zhaozhi Liu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对大语言模型赋能边缘网络面临的安全威胁,提出一种隐蔽通信与计算方法,在严格安全约束下最小化总延迟,兼顾隐私保护与任务执行效率。

Comments Accepted for publication in IEEE Communications Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10415 2026-06-10 cs.DC 新提交 90%

RATrain: A Resource-Aware Training Runtime for Large Language Models on Bandwidth-Constrained Heterogeneous Supercomputing Platforms

RATrain:面向带宽受限异构超级计算平台的大语言模型资源感知训练运行时

Yao Lu, Shiqing Ma, Zhongzhi Luan, Gen Li, Jiaxing Qi, Bin Han, Hailong Yang, Depei Qian

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对显存层级化、DDR容量有限且集群间通信受限的MT-3000平台,提出资源感知训练运行时RATrain,通过训练状态生命周期调度和资源感知规划器,实现高达1.35倍加速和97.0%的扩展效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07335 2026-06-08 cs.CR 新提交 90%

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics

通过流形轨迹动力学防御大语言模型的越狱攻击

Hangtao Zhang, Yucheng Zhao, Sishun Liu, Ziqi Zhou, Zeyu Ye, Wei Wan, Minghui Li, Shengshan Hu, Yanjun Zhang, Yi Liu, Leo Yu Zhang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。

Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20988 2026-08-24 cs.LG cs.AI 新提交 90%

Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models

面向大语言模型量化鲁棒性的雅可比引导噪声注入

Deepanshu Pandey, Arnav Chavan, Nahush Lele, Sankalp Dayal, Deepak Gupta

机构 * Amazon(亚马逊)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对大语言模型量化时自注意力机制对离散化误差敏感的问题,提出雅可比引导噪声注入训练策略,在低比特量化下显著提升了模型在图像分类与语言建模任务中的性能。

Comments Accepted at AdaptFM: Resource-Adaptive Foundation Model Inference, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24650 2026-08-26 cs.AR cs.AI 新提交 90%

Simthesizer: An Agent-Driven Simulation Framework for LLM Serving Systems

Simthesizer:面向LLM服务系统的智能体驱动仿真框架

Wonung Kim, Hyunmin Choi, Minsu Kim, Jaehong Cho, Yeongwook Kim, Jongse Park

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Borg框架,通过智能体驱动仿真器开发缩小LLM服务系统与仿真器的差距,其构建的扩展吞吐量误差更低,仿真速度显著优于现有仿真器。

详情

展开后加载摘要…

URL PDF HTML 收藏