arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22368 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22368 篇

2512.01644 2025-12-02 cs.AR 85%

A Systematic Characterization of LLM Inference on GPUs

对GPU上LLM推理的系统性表征

Haonan Wang, Xuxin Xiao, Mingyu Yan, Zhuoyuan Zhu, Dengke Han, Duo Wang, Wenming Li, Xiaochun Ye, Cunchen Hu, Hongyang Chen, Guangyu Sun

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统性分析,揭示了GPU上LLM推理的四维框架,包括异质性观察、微架构分析、系统扩展原则和新兴范式边界,为LLM推理提供了新的优化方向和理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00335 2025-12-02 cs.AR 85%

Efficient Kernel Mapping and Comprehensive System Evaluation of LLM Acceleration on a CGLA

高效内核映射与LLM加速在CGLA上的综合系统评估

Takuto Ando, Yu Eto, Ayumu Takeuchi, Yasuhiko Nakashima

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种非AI专用的CGLA加速器,通过高效内核映射和综合系统评估,展示了其在LLM推断中的高能效和性能-能耗折中优势。

Comments This paper is published at IEEE Access

Journal ref IEEE Access, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22933 2025-12-01 eess.SP 85%

RAG-Empowered LLM-Driven Dynamic Radio Resource Management in Open 6G RAN

基于RAG的LLM驱动的开放6G RAN动态无线电资源管理

Onur Salan, Burak Çırağ, Onur Sever, İbrahim Hökelek, Ali Görçin, Hakan Ali Çırpan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于RAG的LLM驱动的O-RAN动态资源管理框架,通过双代理机制实现网络切片的自适应控制,提升计算效率和SLA合规性。

Comments Submitted to possible IEEE conferences

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22118 2025-12-01 cs.SE 85%

Statistical Independence Aware Caching for LLM Workflows

面向LLM工作流的统计独立性感知缓存

Yihan Dai, Dimitrios Stamatios Bouras, Haoxiang Jia, Sergey Mechtaev

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Mnimi通过封装统计约束在LLM引用类型中,提升代码修复工作流的可重复性、调试效率和统计正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14909 2025-11-26 cs.LG cs.AI cs.CL 85%

Mixture of Attention Spans: Optimizing LLM Inference Efficiency with Heterogeneous Sliding-Window Lengths

注意力跨度混合:通过异质滑动窗口长度优化LLM推理效率

Tianyu Fu, Haofeng Huang, Xuefei Ning, Genghan Zhang, Boju Chen, Tianqi Wu, Hongyi Wang, Zixiao Huang, Shiyao Li, Shengen Yan, Guohao Dai, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MoA通过异质滑动窗口长度优化LLM推理效率,提升上下文长度和检索准确率,减少内存消耗并提高吞吐量。

Comments Published at CoLM'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19523 2025-11-26 cs.CR 85%

EAGER: Edge-Aligned LLM Defense for Robust, Efficient, and Accurate Cybersecurity Question Answering

EAGER: 边缘对齐的LLM防御方法用于鲁棒、高效且准确的网络安全问答

Onat Gungor, Roshan Sood, Jiasheng Zhou, Tajana Rosing

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 EAGER通过参数高效量化与领域偏好对齐,提升网络安全问答的鲁棒性、效率和准确性,降低对抗攻击成功率并优化响应延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18270 2025-11-25 cs.RO 85%

Skypilot: Fine-Tuning LLM with Physical Grounding for AAV Coverage Search

Skypilot: 通过物理现实 grounding 提升 LLM 在 AAV 覆盖搜索中的微调

Zhongkai Chen, Yihao Sun, Chao Yan, Han Zhou, Xiaojia Xiang, Jie Jiang

机构 * College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学) College of Automation Engineering, Nanjing University of Aeronautics and Astronautics(自动化工程学院,南京航空航天大学) China Academy of Launch Vehicle Technology(中国运载火箭技术研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Skypilot通过结合MCTS和物理感知奖励函数,提升LLM在AAV覆盖搜索中的微调效果,实现高效且高质量的决策与路径规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08250 2025-11-25 cs.SE 85%

Hybrid LLM Routing for Efficient App Feedback Classification

混合LLM路由用于高效应用反馈分类

Yasaman Abedini, Abbas Heydarnoori

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出混合LLM路由策略,通过轻量模型处理低复杂度反馈,高容量LLM处理模糊情况,提升应用反馈分类的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16414 2025-11-21 cs.IR 85%

An Efficient LLM-based Evolutional Recommendation with Locate-Forget-Update Paradigm

一种基于LLM的高效进化推荐方法:定位-遗忘-更新范式

Hao Liu, Le Wu, Min Hou, Han Wu, Kun Zhang, Xin Li, Si Wei

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 EvoRec通过定位-遗忘-更新范式高效处理LLM推荐系统中用户偏好的演变,减少计算资源消耗并保持推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04420 2025-11-21 cs.LG cs.AI cs.CL 85%

KVTuner: Sensitivity-Aware Layer-Wise Mixed-Precision KV Cache Quantization for Efficient and Nearly Lossless LLM Inference

KVTuner: 一种面向层间敏感性的混合精度KV缓存量化方法,用于高效且接近无损的LLM推理

Xing Li, Zeyu Xing, Yiming Li, Linping Qu, Hui-Ling Zhen, Wulong Liu, Yiwu Yao, Sinno Jialin Pan, Mingxuan Yuan

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) The Chinese University of Hong Kong(香港中文大学) Huawei Computing Product Line(华为计算产品线)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVTuner通过多目标优化实现高效且接近无损的LLM推理,适用于不同模型和约束条件。

Comments Accepted by ICML25. Code: https://github.com/cmd2001/KVTuner

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16046 2025-11-21 eess.AS 85%

Train Short, Infer Long: Speech-LLM Enables Zero-Shot Streamable Joint ASR and Diarization on Long Audio

训练短音频,推断长音频:Speech-LLM实现长音频零样本联合语音识别与说话人识别

Mohan Shi, Xiong Xiao, Ruchao Fan, Shaoshi Ling, Jinyu Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Speech-LLM通过短音频训练实现长音频零样本联合语音识别与说话人识别,优于现有基线方法。

Comments Submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15665 2025-11-20 cs.SE 85%

Quantum-Guided Test Case Minimization for LLM-Based Code Generation

Huixiang Zhang, Mahzabeen Emu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments This is a preprint version, full paper has been accepted in IEEE CASCON 2025 and will appear on lEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15389 2025-11-20 cs.IR 85%

Unveiling Inference Scaling for Difference-Aware User Modeling in LLM Personalization

Suyu Chen, Yimeng Bai, Yulong Huang, Xiaoyan Zhao, Yang Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06247 2025-11-20 cs.DC 85%

Optimizing Long-context LLM Serving via Fine-grained Sequence Parallelism

Cong Li, Yuzhe Yang, Xuegui Zheng, Qifan Yang, Yijin Guan, Size Zheng, Li-Wen Chang, Shufan Liu, Xin Liu, Guangyu Sun

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments The paper has been withdrawn to align with the internal publication policies of the affiliated organization. We plan to resubmit after obtaining the necessary approvals

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18544 2025-11-19 cs.DC 85%

SLICE: SLO-Driven Scheduling for LLM Inference on Edge Computing Devices

Will Chow

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments This work has been submitted to the IEEE for possible publication. This version is temporarily hosted anonymously for double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11617 2025-11-18 cs.DC 85%

AnchorTP: Resilient LLM Inference with State-Preserving Elastic Tensor Parallelism

Wendong Xu, Chujie Chen, He Xiao, Kuan Li, Jing Xiong, Chen Zhang, Wenyong Zhou, Chaofan Tao, Yang Bai, Bei Yu, Ngai Wong

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments accpeted paper by Design, Automation and Test in Europe Conference (DATE'26). 8 pages in total with 6 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11225 2025-11-18 cs.CL cs.AI cs.LG 85%

HAPO: Training Language Models to Reason Concisely via History-Aware Policy Optimization

Chengyu Huang, Zhengxin Zhang, Claire Cardie

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11248 2025-11-17 cs.AR 85%

T-MAN: Enabling End-to-End Low-Bit LLM Inference on NPUs via Unified Table Lookup

Jianyu Wei, Qingtao Li, Shijie Cao, Lingxiao Ma, Zixu Hao, Yanyong Zhang, Xiaoyan Hu, Ting Cao

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14397 2025-11-17 cs.AR 85%

LIMINAL: Exploring The Frontiers of LLM Decode Performance

Michael Davies, Neal Crago, Karthikeyan Sankaralingam, Christos Kozyrakis

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09883 2025-11-14 cs.CV 85%

HCC-3D: Hierarchical Compensatory Compression for 98% 3D Token Reduction in Vision-Language Models

Liheng Zhang, Jin Wang, Hui Li, Bingfeng Zhang, Weifeng Liu

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14617 2025-11-14 cs.DC 85%

SageServe: Optimizing LLM Serving on Cloud Data Centers with Forecast Aware Auto-Scaling

Shashwat Jaiswal, Kunal Jain, Yogesh Simmhan, Anjaly Parayil, Ankur Mallick, Rujia Wang, Renee St. Amant, Chetan Bansal, Victor Rühle, Anoop Kulkarni, Steve Kofsky, Saravan Rajmohan

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 25 pages, 16 figures, 2 tables. The workload traces, our simulator harness and the SageServe scheduler are available at https://github.com/shashwatj07/SageServe

Journal ref Proceedings of the ACM on Measurement and Analysis of Computing Systems, Vol. 9, No. 3, Article 61. December 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09223 2025-11-13 cs.SE 85%

AILINKPREVIEWER: Enhancing Code Reviews with LLM-Powered Link Previews

Panya Trakoolgerntong, Tao Xiao, Masanari Kondo, Chaiyong Ragkhitwetsagul, Morakot Choetkiertikul, Pattaraporn Sangaroonsilp, Yasutaka Kamei

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09084 2025-11-13 eess.AS 85%

Towards Effective and Efficient Non-autoregressive decoders for Conformer and LLM-based ASR using Block-based Attention Mask

Tianzi Wang, Xurong Xie, Zengrui Jin, Mengzhe Geng, Jiajun Deng, Zhaoqing Li, Shoukang Hu, Shujie Hu, Guinan Li, Mingyu Cui, Helen Meng, Xunying Liu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by regular paper in the IEEE Transactions on Audio, Speech and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04277 2025-11-13 cs.LG cs.AI cs.CL stat.AP 85%

Beyond the Hype: Embeddings vs. Prompting for Multiclass Classification Tasks

Marios Kokkodis, Richard Demsyn-Jones, Vijay Raghavan

机构 * Thumbtack(Thumbtack公司)

专题命中 效率与部署 :prompting(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07585 2025-11-12 cs.LG cs.AI cs.CL stat.ML 85%

LLM Output Drift: Cross-Provider Validation & Mitigation for Financial Workflows

Raffi Khatchadourian, Rolando Franco

机构 * IBM -- Financial Services Market(IBM金融服务市场)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 11 pages, 5 figures. To appear in AI4F @ ACM ICAIF '25, November 15-18, 2025, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07422 2025-11-12 cs.DC 85%

From Attention to Disaggregation: Tracing the Evolution of LLM Inference

Madabattula Rajesh Kumar, Srinivasa Rao Aravilli, Mustafa Saify, Shashank Srivastava

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07049 2025-11-11 cs.CV cs.CR 85%

From Pretrain to Pain: Adversarial Vulnerability of Video Foundation Models Without Task Knowledge

Hui Lu, Yi Yu, Song Xia, Yiming Yang, Deepu Rajan, Boon Poh Ng, Alex Kot, Xudong Jiang

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)

Comments AAAI 2026 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07035 2025-11-11 cs.OS 85%

GoCkpt: Gradient-Assisted Multi-Step overlapped Checkpointing for Efficient LLM Training

Keyao Zhang, Yiquan Chen, Zhuo Hu, Wenhai Lin, Jiexiong Xu, Wenzhi Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments 12 pages, 10 figures, 1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10225 2025-11-11 cs.AR 85%

ISAAC: Intelligent, Scalable, Agile, and Accelerated CPU Verification via LLM-aided FPGA Parallelism

Jialin Sun, Yuchen Hu, Dean You, Yushu Du, Hui Wang, Xinwei Fang, Weiwei Shan, Nan Guan, Zhe Jiang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments require revision, update later

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04576 2025-11-10 eess.SP 85%

Communication-Efficient Collaborative LLM Inference via Distributed Speculative Decoding

Ce Zheng, Tingting Yang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted in the Seventeenth International Conference on Wireless Communications and Signal Processing Oct. 23-25, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏