arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22313 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22313 篇

2601.10004 2026-01-16 cs.CR cs.LG 85%

SoK: Privacy-aware LLM in Healthcare: Threat Model, Privacy Techniques, Challenges and Recommendations

SoK:面向医疗的隐私保护大语言模型:威胁模型、隐私技术、挑战与建议

Mohoshin Ara Tahera, Karamveer Singh Sidhu, Shuvalaxmi Dass, Sajal Saha

机构 * University of Louisiana at Lafayette, Lafayette, LA, USA(路易斯安那州立大学拉斐特分校) University of Northern British Columbia, Canada(北部BC大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文系统分析了医疗领域大语言模型的隐私保护问题,探讨了威胁模型、隐私技术及挑战,并提出针对不同阶段的防护建议和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19670 2026-01-16 cs.CL 85%

CoSense-LLM: Semantics at the Edge with Cost- and Uncertainty-Aware Cloud-Edge Cooperation

CoSense-LLM:在成本和不确定性意识下实现边缘语义的云边协作

Hasan Akgul, Mari Eplik, Javier Rojas, Aina Binti Abdullah, Pieter van der Merwe

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CoSense-LLM通过边缘优先设计,在成本和不确定性意识下实现云边协作,以提供紧凑的语义标记和隐私保护。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19385 2026-01-15 cs.LG 85%

Beyond Uniform SVD:Dual-Level Optimization across Columns and Modules for LLM Compression

超越统一SVD:跨列和模块的双层优化用于LLM压缩

Lin Xv, Xian Gao, Ting Li, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Duo-SVD通过双层优化提升LLM压缩效率,有效解决分解误差差异和权重矩阵重要性评估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08742 2026-01-14 cs.CL 85%

Inferring Latent Intentions: Attributional Natural Language Inference in LLM Agents

推断潜在意图:在LLM代理中进行归因性自然语言推理

Xin Quan, Jiafeng Xiong, Marco Valentino, André Freitas

机构 * University of Manchester(曼彻斯特大学) University of Sheffield(谢菲尔德大学) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, University of Manchester(国家生物标志物中心,CRUK-MI,曼彻斯特大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出归因性NLI框架,通过文本游戏实验展示其在多智能体环境中提升LLM推理能力的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07469 2026-01-13 cs.AI 85%

Knowledge Distillation for LLM-Based Human Activity Recognition in Homes

用于家庭中基于大语言模型的人活动识别的知识蒸馏

Julien Cumin, Oussama Er-Rahmany, Xi Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了利用大语言模型进行家庭中的人活动识别,并通过知识蒸馏技术提升小型模型性能,实现参数减少50倍的同时保持高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06959 2026-01-13 cs.LG 85%

HAS-VQ: Hessian-Adaptive Sparse Vector Quantization for High-Fidelity LLM Compression

HAS-VQ:Hessian自适应稀疏向量量化用于高保真大语言模型压缩

Vladimer Khasia

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 HAS-VQ通过Hessian自适应稀疏向量量化实现大语言模型的高保真压缩,优于整数基线并实现无损压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11343 2026-01-13 cs.CL 85%

SpecDetect: Simple, Fast, and Training-Free Detection of LLM-Generated Text via Spectral Analysis

SpecDetect: 一种简单、快速且无需训练的LLM生成文本检测方法通过频谱分析

Haitong Luo, Weiyao Zhang, Suhang Wang, Wenji Zou, Chungang Lin, Xuying Meng, Yujun Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SpecDetect通过频谱分析技术,利用DFT总能量检测LLM生成文本,具有高效、快速且无需训练的特点。

Comments AAAI'26 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02620 2026-01-13 cs.DC cs.AI 85%

FlowSpec: Continuous Pipelined Speculative Decoding for Efficient Distributed LLM Inference

FlowSpec: 基于流水线的连续推测解码用于高效分布式大语言模型推理

Xing Liu, Lizhuo Luo, Ming Tang, Chao Huang, Xu Chen

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) School of Computing, Montclair State University(蒙特克莱尔州立大学计算机学院) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FlowSpec提出了一种基于流水线的树状推测解码框架,通过三个关键技术提升分布式大语言模型推理效率。

Comments 11 pages, and the last one is the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15779 2026-01-12 cs.CL 85%

Reservoir Computing as a Language Model

回声计算作为语言模型

Felix Köster, Atsushi Uchida

机构 * Department of Information and Computer Sciences, Saitama University(信息与计算机科学系,上野大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文比较了回声计算与Transformer在字符级语言建模中的表现,发现Transformer在预测质量上更优,而回声计算在能效方面更具优势。

Comments 8 pages, 5 figures, 1 table Code available at: https://github.com/fekoester/Shakespeare_Res and https://github.com/fekoester/LAERC

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17189 2026-01-09 cs.AI 85%

Talking with Tables for Better LLM Factual Data Interactions

通过表格对话提升大语言模型事实数据交互

Jio Oh, Geon Heo, Seungjun Oh, Hyunjin Kim, JinYeong Bak, Jindong Wang, Xing Xie, Steven Euijong Whang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) William & Mary(威廉与玛丽学院) SKKU

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过表格结构提升大语言模型在事实数据交互中的性能,展示表格在信息检索和数据操作中的有效性,并验证其在不同任务中的鲁棒性和效率。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04170 2026-01-08 cs.AI 85%

Agent Drift: Quantifying Behavioral Degradation in Multi-Agent LLM Systems Over Extended Interactions

智能体漂移:多智能体大语言模型系统在长时间交互中的行为退化量化

Abhishek Rath

机构 * Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出智能体漂移概念,通过理论框架和量化指标,探讨多智能体系统在长时间交互中的行为退化问题,并提出缓解策略以提升系统稳定性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03874 2026-01-08 cs.CL 85%

Evaluating Small Decoder-Only Language Models for Grammar Correction and Text Simplification

评估小型解码器-only语言模型在语法纠正和文本简化中的表现

Anthony Lamelas

机构 * New York University(纽约大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本文评估了小型解码器-only语言模型在语法纠正和文本简化任务中的性能,发现其在效率上有优势,但性能仍低于现有大型语言模型,需进一步改进以缩小差距。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03281 2026-01-08 eess.SY cs.AI cs.SY 85%

$α^3$-Bench: A Unified Benchmark of Safety, Robustness, and Efficiency for LLM-Based UAV Agents over 6G Networks

$α^3$-Bench:一种统一的安全性、鲁棒性和效率评估基准,用于基于大语言模型的无人机代理在6G网络中的自主性

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿联酋大学) Khalifa University of Science and Technology(科技大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出$α^3$-Bench,用于评估基于LLM的无人机代理在6G网络中的安全性、鲁棒性和效率,通过多轮对话推理和控制问题测试其性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15755 2026-01-08 cs.AI cs.SE 85%

Multi-Agent LLM Orchestration Achieves Deterministic, High-Quality Decision Support for Incident Response

多智能体大语言模型协调实现确定性、高质量的事件响应决策支持

Philip Drammeh

机构 * Philip Drammeh, M.Eng(菲利普·德拉梅, 工程硕士)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 多智能体大语言模型协调显著提升事件响应的确定性和质量,实现100%可操作建议率,为生产环境提供可靠决策支持。

Comments 10 pages, 4 tables. v2: Expanded limitations, added threats to validity, clarified agent definition, added reproducibility notes, updated Phase 2 timeline with current models (GPT-5.2, Claude Sonnet 4.5, Llama 3.3 70B). No changes to experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02006 2026-01-08 cs.DC cs.LG 85%

MorphServe: Efficient and Workload-Aware LLM Serving via Runtime Quantized Layer Swapping and KV Cache Resizing

MorphServe: 通过运行时量化层交换和KV缓存调整实现高效且负载感知的LLM服务

Zhaoyuan Su, Zeyu Zhang, Tingfeng Lan, Zirui Wang, Haiying Shen, Juncheng Yang, Yue Cheng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 MorphServe通过运行时量化层交换和KV缓存调整,有效提升动态负载下的LLM服务效率和稳定性。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02875 2026-01-07 cs.CL 85%

Revisiting Data Compression with Language Modeling

重新审视语言模型在数据压缩中的应用

Chen-Han Tsai

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本文探讨了使用大型语言模型进行数据压缩的潜力,展示了在enwik9数据集上达到18%的调整压缩率,并探讨了LLM在压缩非英语数据、代码和字节流序列中的应用。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02695 2026-01-07 cs.CL cs.MA 85%

EvoRoute: Experience-Driven Self-Routing LLM Agent Systems

EvoRoute: 基于经验的自我路由LLM代理系统

Guibin Zhang, Haiyang Yu, Kaiming Yang, Bingli Wu, Fei Huang, Yongbin Li, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Tongyi Lab(通义实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 EvoRoute通过动态选择最优LLM模型,解决代理系统在性能、成本和延迟间的平衡问题,显著提升效率并降低成本

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00454 2026-01-07 cs.CL 85%

Learning an Efficient Multi-Turn Dialogue Evaluator from Multiple LLM Judges

从多个LLM裁判中学习高效的多轮对话评估器

Yuqi Tang, Kehua Feng, Yunfeng Wang, Zhiwen Chen, Chengfei Lv, Gang Yu, Qiang Zhang, Keyan Ding, Huajun Chen

机构 * ZJU–UIUC Institute(浙大UIUC研究院) ZJU–Hangzhou Global Scientific and Technological Innovation Center(浙大杭州全球科技创新中心) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种高效多轮对话评估器,通过整合多个LLM裁判的偏好知识,减少计算开销并提升评估效率与鲁棒性。

Comments 20 pages, 4 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17120 2026-01-06 cs.DC cs.AI 85%

BucketServe: Bucket-Based Dynamic Batching for Smart and Efficient LLM Inference Serving

BucketServe: 基于桶的动态分组以实现智能高效的LLM推理服务

Wanyi Zheng, Minxian Xu, Shengye Song, Kejiang Ye

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 BucketServe通过基于桶的动态分组优化LLM推理性能,提升吞吐量并确保服务等级目标合规。

Comments 9 pages

Journal ref IEEE SmartData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01299 2026-01-06 cs.CL 85%

La RoSA: Enhancing LLM Efficiency via Layerwise Rotated Sparse Activation

LaRoSA:通过分层旋转稀疏激活提升大语言模型效率

Kai Liu, Bowen Xu, Shaoyu Wu, Xin Chen, Hao Zhou, Yongliang Tao, Lulu Hu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LaRoSA通过分层旋转稀疏激活技术,提升大语言模型效率,实现稳定的加速效果和较低的性能损失。

Comments ICML 2025 Acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00227 2026-01-05 cs.AI 85%

FlashInfer-Bench: Building the Virtuous Cycle for AI-driven LLM Systems

FlashInfer-Bench: 构建 AI 驱动的 LLM 系统的良性循环

Shanli Xing, Yiyan Zhai, Alexander Jiang, Yixin Dong, Yong Wu, Zihao Ye, Charlie Ruan, Yingyi Huang, Yineng Zhang, Liangsheng Yin, Aksara Bayyapu, Luis Ceze, Tianqi Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FlashInfer-Bench 提出了一种闭环框架,用于评估和部署 AI 生成的 GPU 内核,以提升大规模语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11651 2026-01-05 cs.LG cs.DC 85%

70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)

Tianyi Zhang, Mohsen Hariri, Shaochen Zhong, Vipin Chaudhary, Yang Sui, Xia Hu, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06364 2026-01-05 cs.LG 85%

Sketch to Adapt: Fine-Tunable Sketches for Efficient LLM Adaptation

草图以适应:用于高效大语言模型适应的可调节草图

Tianyi Zhang, Junda Su, Aditya Desai, Oscar Wu, Zhaozhuo Xu, Anshumali Shrivastava

机构 * Rice University, Houston, TX(里士满大学) University of California, Berkeley, Berkeley, CA(加州大学伯克利分校) Stevens Institute of Technology, Hoboken, NJ(史蒂文斯理工学院) ThirdAI Corp.(ThirdAI公司) Ken Kennedy Institute(肯尼迪研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SketchTune通过压缩和适应一体化的方法,实现更高效的大语言模型适应,优于现有PEFT方法。

Comments Published in ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23184 2025-12-30 cs.AI econ.EM 85%

From Model Choice to Model Belief: Establishing a New Measure for LLM-Based Research

从模型选择到模型信念:为基于大语言模型的研究建立新的度量标准

Hongshen Sun, Juanjuan Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出模型信念作为LLM研究的新度量标准,通过需求估计实验展示其在提高估计精度和降低计算成本方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23029 2025-12-30 cs.DC cs.AI 85%

Viability and Performance of a Private LLM Server for SMBs: A Benchmark Analysis of Qwen3-30B on Consumer-Grade Hardware

私有LLM服务器的可行性和性能:基于Qwen3-30B在消费级硬件上的基准分析

Alex Khalil, Guillaume Heilles, Maria Parraga, Simon Heilles

机构 * UCLouvain(列日大学) Universidad Espíritu Santo(圣灵大学) DENEM Labs(DENEM实验室)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文基于Qwen3-30B在消费级硬件上评估私有LLM服务器的可行性和性能,证明其在成本和隐私方面对SMBs的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18564 2025-12-29 cs.AI 85%

Vox Deorum: A Hybrid LLM Architecture for 4X / Grand Strategy Game AI -- Lessons from Civilization V

Vox Deorum:一种用于4X/大战略游戏AI的混合LLM架构——来自《文明V》的启示

John Chen, Sihan Cheng, Can Gurkan, Ryan Lay, Moez Salahuddin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Independent Researcher(独立研究者)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Vox Deorum提出了一种混合LLM架构用于4X游戏AI,通过宏观战略推理与子系统协同,展示了LLM在复杂游戏中的应用潜力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21571 2025-12-29 cs.DC cs.LG 85%

nncase: An End-to-End Compiler for Efficient LLM Deployment on Heterogeneous Storage Architectures

nncase:一种面向异构存储架构高效大语言模型部署的端到端编译器

Hui Guo, Qihang Zheng, Chenghai Huo, Dongliang Guo, Haoqi Yang, Yang Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 nncase通过端到端编译框架实现高效大语言模型部署,整合三个核心模块提升异构存储架构下的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21352 2025-12-29 cs.SE cs.AI cs.MA 85%

Multi-Agent LLM Committees for Autonomous Software Beta Testing

多智能体大语言模型委员会用于自主软件Beta测试

Sumanth Bharadwaj Hachalli Karanam, Dhiwahar Adhithya Kennady

机构 * New York University(纽约大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 多智能体大语言模型委员会通过三轮投票协议实现自主软件Beta测试,显著提高任务成功率和漏洞检测效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12284 2025-12-25 eess.IV cs.AI cs.AR cs.CV cs.MM 85%

V-Rex: Real-Time Streaming Video LLM Acceleration via Dynamic KV Cache Retrieval

V-Rex: 通过动态KV缓存检索实现实时视频大语言模型加速

Donghyuk Kim, Sejeong Yang, Wonjin Shin, Joo-Young Kim

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 V-Rex通过动态KV缓存检索算法和硬件加速器,实现边缘设备上的实时视频LLM推理,显著提升速度和能效。

Comments 14 pages, 20 figures, conference, accepted by HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19682 2025-12-24 cs.CL 85%

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

GenEnv:LLM代理与环境模拟器之间的难度对齐共进化

Jiacheng Guo, Ling Yang, Peter Chen, Qixin Xiao, Yinjie Wang, Xinzhe Juan, Jiahao Qiu, Ke Shen, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) University of Michigan(密歇根大学) University of Chicago(芝加哥大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GenEnv通过动态生成任务与代理能力对齐的共进化机制,在减少数据使用量的同时显著提升代理性能。

Comments Our codes are available at https://github.com/Gen-Verse/GenEnv

详情

展开后加载摘要…

URL PDF HTML 收藏