arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22313 篇

2511.08905 2026-03-20 cs.CR cs.AI 85%

iSeal: Encrypted Fingerprinting for Reliable LLM Ownership Verification

iSeal:用于可靠LLM所有权验证的加密指纹法

Zixun Xiong, Gaoyi Wu, Qingyang Yu, Mingyu Derek Ma, Lingfeng Yao, Miao Pan, Xiaojiang Du, Hao Wang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 iSeal通过在模型和外部模块中注入独特特征,结合纠错机制和相似性验证策略,实现对模型窃贼全程控制下的可靠LLM所有权验证,有效抵御指纹反学习和响应操控等攻击。

Comments Accepted by AAAI 2026

Journal ref Proc. AAAI Conf. Artif. Intell. 40(42): 23984-23992, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22689 2026-03-20 cs.CL 85%

Rule-Based Explanations for Retrieval-Augmented LLM Systems

基于规则的检索增强型大语言模型解释

Joel Rorseth, Parke Godfrey, Lukasz Golab, Divesh Srivastava, Jarek Szlichta

机构 * University of Waterloo(滑铁卢大学) York University(约克大学) AT&T Chief Data Office(AT&T首席数据办公室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出用规则解释检索增强型大语言模型,通过优化方法提高规则生成效率,通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17468 2026-03-19 cs.LG 85%

Efficient Soft Actor-Critic with LLM-Based Action-Level Guidance for Continuous Control

高效软演员-评论家与基于大语言模型的动作级指导在连续控制中的应用

Hao Ma, Zhiqiang Pu, Xiaolin Ai, Huimu Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) Institute of Automation, Chinese Academy of Sciences, Beijing 100190, China(中国科学院自动化研究所,北京100190,中国)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GuidedSAC算法,利用大语言模型提供动作级指导,提升连续控制中的探索效率,并通过理论分析和实验验证其收敛性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17435 2026-03-19 cs.DC cs.AR cs.LG cs.PF 85%

ZipServ: Fast and Memory-Efficient LLM Inference with Hardware-Aware Lossless Compression

ZipServ: 一种快速且内存高效的LLM推理方法,结合硬件感知的无损压缩

Ruibo Fan, Xiangrui Yu, Xinglin Pan, Zeyu Li, Weile Luo, Qiang Wang, Wei Wang, Xiaowen Chu

机构 * The Hong Kong University of Science(香港科学与技术大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ZipServ通过硬件感知的无损压缩技术,提升LLM推理效率,减少内存占用,实现比cuBLAS快2.21倍的内核速度和1.22倍的端到端推理加速。

Comments ASPLOS'26 Accepted Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16104 2026-03-18 cs.MA cs.AI cs.DB 85%

Efficient LLM Serving for Agentic Workflows: A Data Systems Perspective

高效代理工作流的LLM服务:数据系统视角

Noppanat Wadlom, Junyi Shen, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从数据系统视角重新思考LLM和服务,提出Helium框架,通过主动缓存和缓存感知调度提升代理工作流效率,实现1.56倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15712 2026-03-18 cond-mat.mtrl-sci cs.AI 85%

LLM-Driven Discovery of High-Entropy Catalysts via Retrieval-Augmented Generation

通过检索增强生成发现高效熵催化剂

AI Scientists, Xinyi Lin, Danqing Yin, Ying Guo

机构 * School of Biomedical Sciences, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学生物医学科学学院,利卡申医学学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文展示如何利用大语言模型加速催化剂发现,通过检索增强生成框架生成250多个候选催化剂,其中82%具有热力学稳定性,同时满足多目标约束,最佳催化剂在性能和成本上均有显著提升。

Journal ref Open Conference of AI Agents for Science 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14283 2026-03-17 cs.CR cs.AI 85%

AEX: Non-Intrusive Multi-Hop Attestation and Provenance for LLM APIs

AEX:非侵入式多跳认证与溯源用于LLM API

Yongjie Guan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AEX为现有JSON基于LLM API提供非侵入式认证扩展,通过添加签名顶层认证对象,绑定客户端可见请求投影到完整响应或流式输出,支持真实部署并防止转换输出被误认为源流前缀。

Comments 29 pages total; 6 figures; 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14110 2026-03-17 cs.LG 85%

SVD Contextual Sparsity Predictors for Fast LLM Inference

基于SVD的上下文稀疏性预测器用于快速LLM推理

Georgii Serbin, Kirill Koshkin, Zhongao Sun, Anastasiya Bistrigova, C. C. Korikov

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种无需训练的快速稀疏模式预测方法,利用截断感知SVD和阈值校准算法,加速ReGLUFFN的LLM推理,实验显示在保持低精度损失下,解码时间减少1.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23586 2026-03-17 cs.SE cs.AI 85%

Reducing Cost of LLM Agents with Trajectory Reduction

通过轨迹缩减降低LLM代理的成本

Yuan-An Xiao, Pengfei Gao, Chao Peng, Yingfei Xiong

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AgentDiet方法,通过减少LLM代理轨迹中的冗余信息,降低计算成本,实验显示可减少输入token和总计算成本达39.9%-59.7%和21.1%-35.9%。

Comments 22 pages, 5 figures; accepted for FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12752 2026-03-16 cs.IR cs.LG 85%

Taming the Long Tail: Efficient Item-wise Sharpness-Aware Minimization for LLM-based Recommender Systems

驯服长尾:面向基于大语言模型的推荐系统的高效项级锐度感知最小化

Jiaming Zhang, Yuyuan Li, Xiaohua Feng, Li Zhang, Longfei Li, Jun Zhou, Chaochao Chen

机构 * Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了基于大语言模型的推荐系统在长尾问题中的表现,提出EISAM框架通过项级锐度感知最小化提升尾部项目推荐性能,理论分析证明其有效性,并在三个真实数据集上验证了其效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12740 2026-03-16 cs.AI 85%

ToolTree: Efficient LLM Agent Tool Planning via Dual-Feedback Monte Carlo Tree Search and Bidirectional Pruning

ToolTree: 通过双反馈蒙特卡洛树搜索与双向剪枝实现高效的LLM代理工具规划

Shuo Yang, Soyeon Caren Han, Yihao Ding, Shuhe Wang, Eduard Hoy

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息学院) School of Physics, Mathematics and Computing, The University of Western Australia(西澳大学物理、数学与计算学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ToolTree,一种基于蒙特卡洛树搜索的工具规划方法,通过双阶段LLM评估和双向剪枝机制,提升工具使用序列的适应性和效率,实验表明其在多种基准测试中性能提升约10%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12465 2026-03-16 cs.DC cs.LG cs.PF 85%

TaxBreak: Unmasking the Hidden Costs of LLM Inference Through Overhead Decomposition

TaxBreak: 通过开销分解揭示LLM推理的隐藏成本

Prabhu Vellaisamy, Shreesh Tripathi, Vignesh Natarajan, Surya Santhan Thenarasu, Shawn Blanton, John P. Shen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TaxBreak通过分解主机可见的编排开销,识别优化应针对软件栈还是设备侧工作负载,揭示LLM推理中隐藏的成本问题。

Comments Accepted at IEEE ISPASS 2026. Copyright assigned to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13165 2026-03-16 cs.IR cs.AI 85%

Asynchronous Verified Semantic Caching for Tiered LLM Architectures

异步验证语义缓存用于分层大语言模型架构

Asmit Kumar Singh, Haozhe Wang, Laxmi Naga Santosh Attaluri, Tak Chiam, Weihua Zhu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Krites异步缓存策略,通过LLM判断扩展静态缓存覆盖范围,提升静态缓存命中率,减少推理成本和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02620 2026-03-16 cs.CR cs.LG 85%

Verifying LLM Inference to Detect Model Weight Exfiltration

验证大语言模型推理以检测模型权重外泄

Roy Rinberg, Adam Karvonen, Alexander Hoover, Daniel Reuter, Keri Warr

机构 * Harvard University(哈佛大学) ML Alignment & Theory Scholars (MATS)(对齐与理论学者(MATS)) Stevens Institute of Technology(史蒂文斯理工学院) Anthropic

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过验证LLM推理来检测模型权重外泄,通过安全游戏形式化外泄问题,提出可证明缓解隐写外泄的验证框架,并评估了不同参数规模的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10900 2026-03-13 cs.IR cs.AI 85%

Tuning-Free LLM Can Build A Strong Recommender Under Sparse Connectivity And Knowledge Gap Via Extracting Intent

无需调优的LLM可通过提取意图在稀疏连接和知识缺口下构建强大的推荐系统

Wenqing Zheng, Noah Fatsi, Daniel Barcklow, Dmitri Kalaev, Steven Yao, Owen Reinert, C. Bayan Bruss, Daniele Rosa

机构 * Capital One

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出IKGR,一种基于LLM的意图知识图推荐系统,通过提取意图构建意图中心知识图,缓解稀疏性和冷启动问题,实现高效推荐。

Comments Accepted in Learning on Graphs (LoG) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01914 2026-03-12 cs.CL 85%

AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth

AdaPonderLM: 带令牌级自适应深度的门控沉思语言模型

Shixiang Song, He Li, Zitong Wang, Boyi Zeng, Feichen Song, Yixuan Wang, Zhiqin John Xu, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 AdaPonderLM通过自适应深度和令牌级门控机制,在保持语言建模性能的同时减少推理计算,实现高效自监督训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09723 2026-03-12 cs.HC cs.CL 85%

AgentA/B: Automated and Scalable Web A/BTesting with Interactive LLM Agents

AgentA/B: 基于交互式LLM代理的自动化和可扩展的网页A/B测试

Yuxuan Lu, Ting-Yao Hsu, Hansu Gu, Limeng Cui, Yaochen Xie, William Headden, Bingsheng Yao, Akash Veeragouni, Jiapeng Liu, Sreyashi Nag, Jessie Wang, Dakuo Wang

机构 * Northeastern University(东北大学) Pennsylvania State University(宾夕法尼亚州立大学) Amazon USA(亚马逊美国)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AgentA/B通过交互式LLM代理实现自动化和可扩展的网页A/B测试,模拟用户行为以评估网页设计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08475 2026-03-10 cs.RO cs.AI 85%

R2F: Repurposing Ray Frontiers for LLM-free Object Navigation

R2F:利用射线前沿进行无需大语言模型的对象导航

Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13824 2026-03-10 cs.LG 85%

ELSA: Efficient LLM-Centric Split Aggregation for Privacy-Aware Hierarchical Federated Learning over the Network Edge

ELSA: 面向网络边缘的隐私感知分层联邦学习的高效LLM中心分割聚合

Xiaohong Yang, Tong Xie, Minghui Liwang, Chikai Shang, Yang Lu, Zhenzhen Jiao, Liqun Fu, Seyyedali Hosseinalipour

机构 * School of Informatics, Xiamen University(厦门大学信息学院) National University of Singapore(新加坡国立大学) Teleinfo iF-Labs, China Academy of Information and Communications Technology(Teleinfo iF-Labs,中国信息通信技术研究院) Department of Electrical Engineering, University at Buffalo-SUNY(电气工程系,布法罗大学-纽约州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ELSA通过任务无关聚类、动态模型分割和轻量通信方案,实现网络边缘隐私保护下的高效LLM微调。

Comments 11 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12474 2026-03-09 cs.CV cs.CL cs.GR 85%

Co-Layout: LLM-driven Co-optimization for Interior Layout

Co-Layout: 基于大语言模型的室内布局联合优化

Chucheng Xiang, Ruchao Bao, Biyin Feng, Wenzheng Wu, Zhongyuan Liu, Yirui Guan, Ligang Liu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于大语言模型和整数规划的联合优化方法,用于提升室内布局和家具摆放的自动化设计效率与质量。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05692 2026-03-09 cs.DC cs.LG cs.PF 85%

Parallelization Strategies for Dense LLM Deployment: Navigating Through Application-Specific Tradeoffs and Bottlenecks

密集大语言模型部署的并行策略:在应用特定的权衡和瓶颈中导航

Burak Topcu, Musa Oguzhan Cim, Poovaiah Palangappa, Meena Arunachalam, Mahmut Taylan Kandemir

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了密集LLM部署中并行策略对延迟和吞吐量的权衡影响,提出通过混合TP和PP优化性能。

Comments 17 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04716 2026-03-06 cs.DC cs.IT cs.LG math.IT 85%

SLO-Aware Compute Resource Allocation for Prefill-Decode Disaggregated LLM Inference

面向预填解码 disaggregated LLM 推理的 SLO 意识计算资源分配

Luchang Li, Dongfang Li, Bozhao Gong, Yu Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种结合理论建模与实证基准测试的混合方法,用于在 SLO 约束下优化预填解码 disaggregated LLM 推理的计算资源分配。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01574 2026-03-03 cs.CR cs.AI 85%

DualSentinel: A Lightweight Framework for Detecting Targeted Attacks in Black-box LLM via Dual Entropy Lull Pattern

DualSentinel: 一种用于通过双熵低谷模式检测黑盒LLM中针对性攻击的轻量级框架

Xiaoyi Pang, Xuanyi Hao, Pengyu Liu, Qi Luo, Song Guo, Zhibo Wang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) School of Cyber Science and Technology(网络安全科学与技术学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DualSentinel通过双熵低谷模式检测黑盒LLM中的针对性攻击,提供高效且准确的防御方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08166 2026-03-03 cs.AI 85%

ZeroDVFS: Zero-Shot LLM-Guided Core and Frequency Allocation for Embedded Platforms

ZeroDVFS: 面向嵌入式平台的零样本LLM引导的核心与频率分配

Mohammad Pivezhandi, Mahdi Banisharif, Abusayeed Saifullah, Ali Jannesari

机构 * Wayne State University(韦恩州立大学) Iowa State University(爱荷华州立大学) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ZeroDVFS通过基于模型的强化学习和LLM引导的语义特征提取,实现嵌入式平台的零样本核心与频率分配,显著提升能效和任务完成效率。

Comments 56 pages, 14 figures, 18 tables (including appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06238 2026-03-03 cs.IR cs.AI 85%

Token-Efficient Item Representation via Images for LLM Recommender Systems

通过图像实现高效的物品表示用于LLM推荐系统

Kibum Kim, Sein Kim, Hongseok Kang, Jiwan Kim, Heewoong Noh, Yeonjun In, Kanghoon Yoon, Jinoh Oh, Julian McAuley, Chanyoung Park

机构 * KAIST(韩国科学技术院) Amazon Alexa(亚马逊Alexa) UC San Diego(加州大学圣地亚哥分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出I-LLMRec方法,通过利用图像替代文本描述,提高LLM推荐系统的效率和有效性,同时增强对噪声的鲁棒性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17551 2026-03-02 cs.PF cs.LG 85%

GreenServ: Energy-Efficient Context-Aware Dynamic Routing for Multi-Model LLM Inference

GreenServ: 多模型LLM推理中的节能上下文感知动态路由

Thomas Ziller, Shashikant Ilager, Alessandro Tundo, Ezio Bartocci, Leonardo Mariani, Ivona Brandic

机构 * University of Amsterdam(阿姆斯特丹大学) University of Milano-Bicocca(米兰-比科卡大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 GreenServ通过动态上下文感知路由优化多模型LLM推理的能耗与准确率平衡。

Comments Paper under submisison

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23330 2026-02-27 cs.AI q-fin.TR 85%

Toward Expert Investment Teams:A Multi-Agent LLM System with Fine-Grained Trading Tasks

迈向专家投资团队:一个具有细粒度交易任务的多智能体LLM系统

Kunihiro Miyazaki, Takanobu Kawahara, Stephen Roberts, Stefan Zohren

机构 * Japan Digital Design, Inc.(日本数字设计公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种多智能体LLM交易框架,通过细粒度任务分解提升风险调整后的回报,并通过分析输出与决策偏好的一致性提高系统性能。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22681 2026-02-27 cs.LG 85%

Accelerating LLM Pre-Training through Flat-Direction Dynamics Enhancement

通过平坦方向动力学增强加速大语言模型预训练

Shuchen Zhu, Rizhen Hu, Mingze Wang, Mou Sun, Xue Wang, Kun Yuan, Zaiwen Wen

机构 * Peking University(北京大学) Zhejiang Lab, Zhejiang(浙江实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LITE通过增强平坦方向动力学提升大语言模型预训练效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22617 2026-02-27 cs.LG 85%

Semantic Tube Prediction: Beating LLM Data Efficiency with JEPA

语义管预测:通过JEPA超越LLM数据效率

Hai Huang, Yann LeCun, Randall Balestriero

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出语义管预测(STP)方法,通过几何先验提升LLM的数据效率,实验证明其在NL-RX-SYNTH数据集上以16倍更少数据达到基线准确率。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22261 2026-02-27 cs.LG 85%

Sustainable LLM Inference using Context-Aware Model Switching

利用上下文感知的模型切换实现可持续的LLM推理

Yuvarani, Akashdeep Singh, Zahra Fathanah, Salsabila Harlen, Syeikha Syafura Al-Zahra binti Zahari, Hema Subramaniam

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种基于上下文感知的模型切换方法,通过动态选择适合的模型来降低LLM推理的能量消耗,实验表明可减少67.5%的能耗并保持高质量响应。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏