arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22313 篇

2504.20068 2025-12-23 cs.DC cs.LG cs.SY eess.SY 85%

JITServe: SLO-aware LLM Serving with Imprecise Request Information

JITServe: 带有服务级别目标的LLM服务系统

Wei Zhang, Zhiyu Wu, Yi Mu, Rui Ning, Banruo Liu, Nikhil Sarda, Myungjin Lee, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 JITServe通过即时调度和优化资源分配,提升LLM服务吞吐量并实现资源节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04133 2025-12-19 cs.AI 85%

TRiSM for Agentic AI: A Review of Trust, Risk, and Security Management in LLM-based Agentic Multi-Agent Systems

TRiSM 用于代理 AI:对基于 LLM 的代理多代理系统中信任、风险和安全管理的综述

Shaina Raza, Ranjan Sapkota, Manoj Karkee, Christos Emmanouilidis

机构 * Vector Institute, Toronto, Canada(向量研究所) Cornell University, USA(康奈尔大学) University of Groningen, Netherlands(格罗宁根大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了基于 LLM 的代理多代理系统中信任、风险和安全管理的框架与方法,提出新的评估指标并探讨了安全与隐私增强策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16317 2025-12-19 cs.AI 85%

Design and Evaluation of Cost-Aware PoQ for Decentralized LLM Inference

去中心化大语言模型推理的成本感知PoQ设计与评估

Arther Tian, Alex Ding, Frank Chen, Alan Wu, Aaron Chan, Bruce Zhang

机构 * DGrid AI

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种成本感知的PoQ框架,通过整合效率测量和统一评估流程,提升去中心化LLM推理的经济可持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16134 2025-12-19 cs.DC cs.LG 85%

Staggered Batch Scheduling: Co-optimizing Time-to-First-Token and Throughput for High-Efficiency LLM Inference

交错批次调度:协同优化时间到第一个令牌和吞吐量以实现高效的大语言模型推理

Jian Tian, Shuailong Li, Yang Cao, Wenbo Cui, Minghan Zhu, Wenkang Wu, Jianming Zhang, Yanpeng Wang, Zhiwen Xiao, Zhenyu Hou, Dou Shen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出交错批次调度方法,通过缓冲请求优化执行批次,降低TTFT并提升吞吐量,应用于高效大语言模型推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15343 2025-12-18 cs.HC cs.AI cs.CY 85%

Exploring User Acceptance and Concerns toward LLM-powered Conversational Agents in Immersive Extended Reality

探索沉浸式扩展现实中基于大语言模型的对话代理用户接受度与担忧

Efe Bozkir, Enkelejda Kasneci

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了沉浸式扩展现实中基于大语言模型的对话代理的用户接受度与担忧,发现熟悉度和性别影响接受度,位置数据敏感性最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14417 2025-12-17 cs.AI 85%

PortAgent: LLM-driven Vehicle Dispatching Agent for Port Terminals

PortAgent: 基于大语言模型的港口终端车辆调度代理

Jia Hu, Junqi Li, Weimeng Lin, Peng Jia, Yuxiong Ji, Jintao Lai

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PortAgent利用大语言模型实现港口终端车辆调度系统的自动化迁移,无需专家参与,降低数据需求并加快部署速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13704 2025-12-17 cs.AI 85%

Adjudicator: Correcting Noisy Labels with a KG-Informed Council of LLM Agents

Adjudicator: 通过知识图谱指导的LLM代理委员会校正噪声标签

Doohee You, Sundeep Paul

机构 * Trusted Engagement \& AI Solutions 500 west 2nd street Trust \& Safety Google

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Adjudicator通过知识图谱指导的LLM代理委员会校正噪声标签,实现高精度数据验证,显著提升F1分数。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13438 2025-12-16 cs.SE cs.AI 85%

From User Interface to Agent Interface: Efficiency Optimization of UI Representations for LLM Agents

从用户界面到代理界面:UI表示的效率优化以提升LLM代理性能

Dezhi Ran, Zhi Gong, Yuzhe Guo, Mengzhou Wu, Yuan Cao, Haochuan Lu, Hengyu Zhang, Xia Zeng, Gang Cao, Liangchao Yao, Yuetang Deng, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(HCST关键实验室(PKU),教育部) SCS, Peking University(SCS,北京大学) Tencent Inc.(腾讯公司) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 UIFormer通过约束优化和结构分解,优化LLM代理的UI表示效率,实现令牌减少与性能提升的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08808 2025-12-16 cs.LG 85%

TinyGraphEstimator: Adapting Lightweight Language Models for Graph Structure Inference

TinyGraphEstimator: 为图结构推断适应轻量级语言模型

Michal Podstawski

机构 * NASK National Research Institute(波兰国家研究 institute)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.LG

AI总结 本文提出TinyGraphEstimator数据集,评估轻量级语言模型在图结构推断中的能力,通过LoRA技术实现参数调优,证明小型模型在图推理任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11920 2025-12-16 cs.AI 85%

CXL-SpecKV: A Disaggregated FPGA Speculative KV-Cache for Datacenter LLM Serving

CXL-SpecKV: 一种基于FPGA的分散式KV缓存用于数据中心LLM服务

Dong Liu, Yanxuan Yu

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CXL-SpecKV通过FPGA加速和内存分散技术,提升数据中心LLM服务的吞吐量和内存效率。

Comments Accepted to FPGA'26 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04752 2025-12-15 cs.LG 85%

RLHFSpec: Breaking the Efficiency Bottleneck in RLHF Training via Adaptive Drafting

RLHFSpec: 通过自适应草稿打破RLHF训练的效率瓶颈

Siqi Wang, Hailong Yang, Junjie Zhu, Xuezhu Wang, Yufan Xu, Depei Qian

专题命中 效率与部署 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RLHFSpec通过自适应草稿策略和高效样本再分配,提升RLHF训练效率,缓解生成瓶颈,提高整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09012 2025-12-15 cs.SE cs.AI 85%

Software Engineering and Foundation Models: Insights from Industry Blogs Using a Jury of Foundation Models

软件工程与基础模型:基于行业博客的见解,利用基础模型的 jury

Hao Li, Cor-Paul Bezemer, Ahmed E. Hassan

机构 * Queen’s University(女王大学) University of Alberta(阿尔伯塔大学)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析行业博客,探讨了基础模型在软件工程中的应用与影响,提出了未来研究方向。

Comments ICSE-SEIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06747 2025-12-09 cs.CR cs.AI 85%

PrivLLMSwarm: Privacy-Preserving LLM-Driven UAV Swarms for Secure IoT Surveillance

PrivLLMSwarm: 用于安全物联网监控的隐私保护大语言模型驱动的无人机群

Jifar Wakuma Ayana, Huang Qiming

机构 * Department of Information and Communication Engineering, School of Computer and Communication Engineering, University of Science and Technology Beijing(信息与通信工程系,计算机与通信工程学院,北京科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PrivLLMSwarm通过安全多方计算实现隐私保护的大语言模型驱动无人机群,实现高准确性和低延迟的加密推理,适用于隐私敏感的物联网应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06590 2025-12-09 cs.IR cs.AI cs.MA 85%

Towards Efficient Hypergraph and Multi-LLM Agent Recommender Systems

迈向高效超图和多LLM代理推荐系统

Tendai Mukande, Esraa Ali, Annalina Caputo, Ruihai Dong, Noel OConnor

机构 * Research Ireland ML-LABS Dublin City University(都柏林城市大学) ADAPT Centre(ADAPT中心) School of Computing(计算学院) Insight Research Ireland Centre for Data Analytics(Insight Research Ireland 数据分析中心) University College Dublin(都柏林大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HGLMRec通过超图编码器和多LLM代理机制,提升推荐系统在计算效率和推荐质量上的表现。

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05341 2025-12-08 cs.LG cs.AR 85%

When Forgetting Builds Reliability: LLM Unlearning for Reliable Hardware Code Generation

当遗忘构建可靠性:用于可靠硬件代码生成的LLM去学习

Yiwen Liang, Qiufeng Li, Shikai Wang, Weidong Cao

机构 * Department of ECE, The George Washington University(电子工程系,乔治·华盛顿大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种针对LLM硬件代码生成的去学习框架,通过语法保持策略和细粒度损失机制有效去除不良知识,提升代码生成的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09665 2025-12-08 cs.LG 85%

LMCache: An Efficient KV Cache Layer for Enterprise-Scale LLM Inference

LMCache: 一种高效的键值缓存层用于企业级大语言模型推理

Yuhan Liu, Yihua Cheng, Jiayi Yao, Yuwei An, Xiaokun Chen, Shaoting Feng, Yuyang Huang, Samuel Shen, Rui Zhang, Kuntai Du, Junchen Jiang

机构 * Tensormesh Inc.(Tensormesh公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LMCache是一种高效的键值缓存解决方案,通过优化数据移动和模块化设计,提升大语言模型推理的性能和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01472 2025-12-08 cs.LG 85%

LLM-NAS: LLM-driven Hardware-Aware Neural Architecture Search

LLM-NAS: 基于大语言模型的硬件感知神经架构搜索

Hengyi Zhu, Grace Li Zhang, Shaoyi Huang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLM-NAS通过引入复杂度驱动的分区引擎、架构提示共进化操作符和零成本预测器,实现高精度低延迟的神经架构搜索,显著降低搜索成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04108 2025-12-05 cs.CY cs.AI cs.HC q-fin.CP 85%

Responsible LLM Deployment for High-Stake Decisions by Decentralized Technologies and Human-AI Interactions

通过去中心化技术和人机交互实现高风险决策的负责任LLM部署

Swati Sachan, Theo Miller, Mai Phuong Nguyen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出通过去中心化技术和人机交互实现LLM在高风险决策中的负责任部署,通过多次迭代评估不确定样本并确保解释的稳定性,以提高安全性和责任追溯能力。

Comments IEEE International Conference on Human-Machine Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07675 2025-12-03 cs.MA cs.AI cs.DC 85%

DynTaskMAS: A Dynamic Task Graph-driven Framework for Asynchronous and Parallel LLM-based Multi-Agent Systems

DynTaskMAS: 一种基于动态任务图的异步和并行LLM多智能体系统框架

Junwei Yu, Yepeng Ding, Hiroyuki Sato

机构 * The University of Tokyo(东京大学) Hiroshima University(广岛大学) National Institute of Informatics(国家信息研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DynTaskMAS通过动态任务图框架提升基于LLM的多智能体系统在异步并行任务处理中的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01002 2025-12-02 cs.LG cs.DC 85%

Optimal Scheduling Algorithms for LLM Inference: Theory and Practice

LLM推理的最优调度算法:理论与实践

Agrim Bari, Parikshit Hegde, Gustavo de Veciana

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SLAI调度器,通过动态资源分配和实时测量优化LLM推理的吞吐量和延迟,减少TTFT并提高服务容量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00119 2025-12-02 cs.CR cs.AI 85%

NetDeTox: Adversarial and Efficient Evasion of Hardware-Security GNNs via RL-LLM Orchestration

NetDeTox: 通过RL-LLM协同实现对硬件安全GNN的对抗性高效逃避

Zeng Wang, Minghao Shao, Akashdeep Saha, Ramesh Karri, Johann Knechtel, Muhammad Shafique, Ozgur Sinanoglu

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NetDeTox通过RL-LLM协同实现对硬件安全GNN的高效对抗性逃避,减少重写次数和面积开销,提升安全性方案的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20576 2025-12-01 cs.DB cs.CL 85%

OmniRouter: Budget and Performance Controllable Multi-LLM Routing

OmniRouter: 可预算和性能控制的多LLM路由

Kai Mei, Wujiang Xu, Minghao Guo, Shuhang Lin, Yongfeng Zhang

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OmniRouter通过受约束优化方法实现多LLM路由,平衡成本与性能,提升响应准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19657 2025-12-01 cs.LG 85%

LLMEasyQuant: Scalable Quantization for Parallel and Distributed LLM Inference

LLMEasyQuant: 用于并行和分布式LLM推理的可扩展量化

Dong Liu, Yanxuan Yu

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LLMEasyQuant通过模块化和系统感知的量化框架,实现高效低比特LLM推理,支持多种量化方法并优化多GPU和分布式环境下的性能。

Comments Accepted as International Conference of Computational Optimization 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20662 2025-11-27 cs.CL 85%

Democratizing LLM Efficiency: From Hyperscale Optimizations to Universal Deployability

让大语言模型效率普及:从超大规模优化到通用部署

Hen-Hsen Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过改进LLM的效率方法,使其在有限资源和专业知识下仍能有效运作,以实现更广泛的部署和公平性。

Comments 8 pages, accepted as a Blue Sky Talk in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17041 2025-11-27 cs.IR cs.AI 85%

CLLMRec: LLM-powered Cognitive-Aware Concept Recommendation via Semantic Alignment and Prerequisite Knowledge Distillation

CLLMRec: 基于大语言模型的认知感知概念推荐:通过语义对齐和先决知识蒸馏

Xiangrui Xiong, Yichuan Lu, Zifei Pan, Chang Sun

机构 * Xihua University, Chengdu 610039, China(西华大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CLLMRec通过语义对齐和先决知识蒸馏,利用大语言模型实现认知感知的概念推荐,无需依赖结构化知识图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17264 2025-11-27 cs.LG cs.DC 85%

No Request Left Behind: Tackling Heterogeneity in Long-Context LLM Inference with Medha

没有被遗漏的请求:通过Medha解决长上下文LLM推理中的异质性

Amey Agrawal, Haoran Qiu, Junda Chen, Íñigo Goiri, Chaojie Zhang, Rayyan Shahid, Ramachandran Ramjee, Alexey Tumanov, Esha Choukse

机构 * Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院) UC San Diego(圣地亚哥大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Medha 通过引入细粒度抢占式调度和新型并行策略,有效解决长上下文LLM推理中的异质性问题,显著提升系统吞吐量和响应效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15815 2025-11-26 cs.AI 85%

Attention Pruning: Automated Fairness Repair of Language Models via Surrogate Simulated Annealing

注意力剪枝:通过代理模拟退火实现语言模型的自动公平性修复

Vishnu Asutosh Dasu, Md Rafi ur Rashid, Vipul Gupta, Saeid Tizpaz-Niari, Gang Tan

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Illinois(伊利诺伊大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出注意力剪枝方法,通过代理模拟退火在LLMs中减少偏见,提升公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19483 2025-11-26 cs.SE cs.AI 85%

Z-Space: A Multi-Agent Tool Orchestration Framework for Enterprise-Grade LLM Automation

Z-Space:面向企业级LLM自动化的一种多智能体工具协调框架

Qingsong He, Jing Nan, Jiayu Jiao, Liangjie Tang, Xiaodong Xu, Mengmeng Sun, Qingyao Wang, Minghui Yan

机构 * Rajax Network Technology (ele.me)(Rajax网络技术(ele.me))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Z-Space通过多智能体协作框架提升企业级LLM自动化工具调用效率与准确性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19368 2025-11-25 cs.LG cs.NI 85%

LLM-Driven Stationarity-Aware Expert Demonstrations for Multi-Agent Reinforcement Learning in Mobile Systems

基于大语言模型的站稳意识专家示范的多智能体强化学习在移动系统中的应用

Tianyang Duan, Zongyuan Zhang, Zheng Lin, Songxiao Guo, Xiuxian Guan, Guangyu Wu, Zihan Fang, Haotian Meng, Xia Du, Ji-Zhe Zhou, Heming Cui, Jun Luo, Yue Gao

机构 * Division of Computer Science, The University of Hong Kong(计算机科学系,香港大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学) Department of Computer Science and Technology, Peking University(计算机科学与技术系,北京大学) Department of Computer Science, City University of Hong Kong(计算机科学系,城市大学) China Unicom Digital Technology, China Unicom co.,Ltd(中国联合数字技术,中国联合有限公司) School of Computer and Information Engineering, Xiamen University of Technology(计算机与信息工程学院,厦门理工学院) School of Computer Science, Engineering Research Center of Machine Learning and Industry Intelligence, Sichuan University(计算机科学学院,机器学习与工业智能工程研究中心,四川大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Institute of Space Internet, Fudan University(空间互联网研究院,复旦大学) School of Computer Science, Fudan University(计算机科学学院,复旦大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出RELED框架,通过大语言模型驱动的专家示范与自主探索相结合,提升多智能体强化学习在移动系统中的性能和稳定性。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18632 2025-11-25 cs.LG 85%

The Locally Deployable Virtual Doctor: LLM Based Human Interface for Automated Anamnesis and Database Conversion

本地可部署的虚拟医生:基于LLM的人机接口用于自动化病史采集和数据库转换

Jan Benedikt Ruhland, Doguhan Bahcivan, Jan-Peter Sowa, Ali Canbay, Dominik Heider

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MedChat是一种本地可部署的虚拟医生框架,结合LLM和扩散模型,实现自动化病史采集和数据库转换,兼顾隐私保护与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏