arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-28 至 2026-01-28 共收录 49 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 49 篇

2503.07103 2026-01-28 cs.SE 91%

Evaluating the Impact of Post-Training Quantization on Large Language Models for Code Generation

评估后训练量化对代码生成大语言模型的影响

Alessandro Giagnorio, Antonio Mastropaolo, Saima Afrin, Massimiliano Di Penta, Gabriele Bavota

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(title);LLM(abstract)

AI总结 本文研究了大语言模型在代码生成中的量化影响,通过更大型的模型和最新量化技术,发现4位精度可显著降低内存占用而不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19611 2026-01-28 cs.LG cs.AI cs.CL 90%

Explicit Multi-head Attention for Inter-head Interaction in Large Language Models

显式多头注意力机制用于大语言模型中头间的交互

Runyu Peng, Yunhua Zhou, Demin Song, Kai Lv, Bo Wang, Qipeng Guo, Xipeng Qiu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出显式多头注意力机制,通过显式建模头间交互提升注意力性能,实现更高效的参数利用和内存压缩,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07253 2026-01-28 eess.AS cs.CV cs.SD 89%

Omni-AVSR: Towards Unified Multimodal Speech Recognition with Large Language Models

Omni-AVSR:迈向基于大语言模型的统一多模态语音识别

Umberto Cappellazzo, Xubo Liu, Pingchuan Ma, Stavros Petridis, Maja Pantic

机构 * Imperial College London, UK(伦敦帝国理工学院) University of Surrey, UK(萨里大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Omni-AVSR通过统一多模态语音识别框架,结合高效多粒度训练与参数高效适应,实现跨任务协同,降低资源消耗并提升鲁棒性。

Comments Accepted to IEEE ICASSP 2026 (camera-ready version). Project website (code and model weights): https://umbertocappellazzo.github.io/Omni-AVSR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19026 2026-01-28 cs.LG cs.AR cs.CL 88%

Is Finer Better? The Limits of Microscaling Formats in Large Language Models

更细更好吗?微缩格式在大语言模型中的局限性

Andrea Fasoli, Monodeep Kar, Chi-Chun Liu, Swagath Venkataramani, Viji Srinivasan, Leland Chang, Naigang Wang

机构 * IBM Research, USA(IBM研究院,美国)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现微缩格式中块大小过小会导致模型输出退化,提出 FP8 无符号 E5M3 作为更高效的硬件友好格式,提升大语言模型的压缩性能。

Comments 31 pages, 17 figures, 3 tables; accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19255 2026-01-28 cs.LG cs.AI 86%

LLM-Assisted Logic Rule Learning: Scaling Human Expertise for Time Series Anomaly Detection

基于大语言模型的逻辑规则学习:扩展人类专业知识用于时间序列异常检测

Haoting Zhang, Shekhar Jain

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型学习逻辑规则,用于提升供应链时间序列异常检测的准确性和可解释性,通过三阶段框架实现专家知识的系统编码与自动化优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12619 2026-01-28 cs.LG cs.AI cs.DC 86%

BootSeer: Analyzing and Mitigating Initialization Bottlenecks in Large-Scale LLM Training

BootSeer:分析和缓解大规模大语言模型训练中的初始化瓶颈

Rui Li, Xiaoyun Zhi, Jinxin Chi, Menghan Yu, Lixin Huang, Jia Zhu, Weilun Zhang, Xing Ma, Wenjia Liu, Zhicheng Zhu, Daowen Luo, Zuquan Song, Xin Yin, Chao Xiang, Shuguang Wang, Wencong Xiao, Gene Cooperman

机构 * Northeastern University(东北大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 BootSeer通过优化容器镜像加载、依赖安装和模型检查点恢复,显著减少大规模LLM训练的启动开销。

Comments 18 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19847 2026-01-28 cs.CL 85%

Identifying and Transferring Reasoning-Critical Neurons: Improving LLM Inference Reliability via Activation Steering

识别并转移推理关键神经元:通过激活引导提升LLM推理可靠性

Fangan Dong, Zuming Yan, Xuri Ge, Zhiwei Xu, Mengqi Zhang, Xuanang Chen, Ben He, Xin Xin, Zhumin Chen, Ying Zhou

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出AdaRAS,通过识别并引导推理关键神经元提升LLM推理可靠性,实验显示在数学和编程基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19278 2026-01-28 cs.CL 85%

DART: Diffusion-Inspired Speculative Decoding for Fast LLM Inference

DART:基于扩散的推测解码用于快速大语言模型推理

Fuliang Liu, Xue Li, Ketai Zhao, Yinxi Gao, Ziyan Zhou, Zhonghui Zhang, Zhibin Wang, Wanchun Dou, Sheng Zhong, Chen Tian

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DART通过并行生成和高效树修剪算法,提升大语言模型推理速度,比EAGLE3快30%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19260 2026-01-28 cs.SE 85%

"ENERGY STAR" LLM-Enabled Software Engineering Tools

ENERGY STAR LLM赋能的软件工程工具

Himon Thakur, Armin Moin

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文研究LLM赋能的软件工程工具的能效,通过结合RAG与PETs提升代码生成的质量和效率,验证核心理念并提供未来分析的证明。

Comments CAIN 2026 - 5th International Conference on AI Engineering - Software Engineering for AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21313 2026-01-28 cs.IR 85%

Towards On-Device Personalization: Cloud-device Collaborative Data Augmentation for Efficient On-device Language Model

面向设备端个性化:云-设备协同数据增强用于高效设备端语言模型

Zhaofeng Zhong, Wei Yuan, Liang Qu, Tong Chen, Hao Wang, Xiangyu Zhao, Hongzhi Yin

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 提出CDCDA-PLM框架,通过云-设备协同数据增强实现高效设备端个性化语言模型部署,解决数据稀缺和网络依赖问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19221 2026-01-28 cs.CL 84%

DREAMSTATE: Diffusing States and Parameters for Recurrent Large Language Models

DREAMSTATE: 用于循环大语言模型的扩散状态和参数

Liu Xiao

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

AI总结 DREAMSTATE通过扩散模型实现RNN状态的生成与编辑,结合RNN局部优势与全局上下文适应性,提出混合架构提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19622 2026-01-28 cs.AI math.OC 83%

Algorithmic Prompt-Augmentation for Efficient LLM-Based Heuristic Design for A* Search

算法提示增强用于高效基于LLM的A*搜索启发式设计

Thomas Bömer, Nico Koltermann, Max Disselnmeyer, Bastian Amberg, Anne Meyer

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) TU Dortmund University(多特蒙德技术大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出A-CEoH算法,通过提示增强策略自动设计A*搜索的启发函数,提升启发式质量并优于专家设计。

Comments accepted at EvoStar conference; Code: https://github.com/tb-git-tud/a-ceoh-evolution-of-heuristics?tab=readme-ov-file

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14852 2026-01-28 cs.DC cs.AI cs.CL cs.LG cs.PF 82%

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

代理计划缓存:用于快速且低成本LLM代理的测试时间内存

Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Agentic Plan Caching通过测试时间内存提取并重用结构化计划模板,降低LLM代理服务成本和延迟,提升效率。

Comments NeurIPS 2025. 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19214 2026-01-28 cs.CL cs.AI 81%

A Hybrid Supervised-LLM Pipeline for Actionable Suggestion Mining in Unstructured Customer Reviews

一种混合监督-大语言模型管道用于无结构客户评论中的可操作建议挖掘

Aakash Trivedi, Aniket Upadhyay, Pratik Narang, Dhruv Kumar, Praveen Kumar

机构 * Department of Computer Science & Information Systems, Birla Institute of Technology and Science, Pilani, India(印度比拉理工学院计算机科学与信息系统系) Birdeye Inc.(Birdeye公司)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种混合监督-大语言模型管道,用于从无结构客户评论中精准提取可操作建议,通过结合RoBERTa分类器和指令调优的LLM,提升提取准确性和聚类一致性,同时揭示领域适应与部署挑战。

Comments Accepted to EACL 2026 Industry Track (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21850 2026-01-28 cs.CV cs.CL 79%

SCoPE VLM: Selective Context Processing for Efficient Document Navigation in Vision-Language Models

SCoPE VLM:面向视觉语言模型高效文档导航的 selective context processing

Gyubeum Lim, Yemo Koo, Vijay Krishna Madisetti

机构 * Georgia Institute of Technology(佐治亚理工学院) Konkuk University(韩国康克伦大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL

AI总结 SCoPE VLM通过引入滚动链机制和定制强化学习方法,实现高效文档导航,提升视觉语言模型在多页文档问答中的代理阅读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-01-28 cs.CR cs.AI cs.CV 79%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 12 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19375 2026-01-28 cs.LG cs.AI 79%

Selective Steering: Norm-Preserving Control Through Discriminative Layer Selection

选择性引导:通过判别层选择实现的范数保持控制

Quy-Anh Dang, Chris Ngo

机构 * VNU University of Science(越南国家科学大学) Knovel Engineering Lab(Knovel工程实验室)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 选择性引导通过判别层选择和范数保持旋转,实现对LLM行为的可控稳定修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18999 2026-01-28 cs.LG cs.AI 79%

Randomization Boosts KV Caching, Learning Balances Query Load: A Joint Perspective

随机化提升KV缓存,学习平衡查询负载:一种联合视角

Fangzhou Wu, Sandeep Silwal, Qiuyi, Zhang

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一的数学模型,结合随机化缓存淘汰与学习方法,以平衡查询负载和缓存命中率,实验表明在多个基准上性能提升显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19563 2026-01-28 cs.DC 78%

Modular Foundation Model Inference at the Edge: Network-Aware Microservice Optimization

边缘侧模块化基础模型推理:网络感知的微服务优化

Juan Zhu, Zixin Wang, Shenghui Song, Jun Zhang, Khaled Ben Letaief

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 本文提出了一种基于微服务的边缘侧基础模型推理框架,通过网络感知的双层部署策略,利用核心服务与轻量服务的功能不对称性,实现稳健的服务质量保障与高效的任务完成。

Comments 4 figures. Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19605 2026-01-28 cs.CL 77%

Decompose-and-Formalise: Recursively Verifiable Natural Language Inference

分解与形式化:可递归验证的自然语言推理

Xin Quan, Marco Valentino, Louise A. Dennis, André Freitas

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Idiap Research Institute(Idiap研究 institute) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出分解与形式化框架,通过自底向上的验证和局部诊断引导细化,提升自然语言推理的解释验证效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19451 2026-01-28 cs.CL 77%

Dynamic Multi-Expert Projectors with Stabilized Routing for Multilingual Speech Recognition

动态多专家投影器与稳定路由用于多语言语音识别

Isha Pandey, Ashish Mittal, Vartul Bahuguna, Ganesh Ramakrishnan

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SMEAR-MoE通过稳定多专家投影器实现多语言语音识别的高效跨语言共享与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19367 2026-01-28 cs.CR cs.LG 77%

CHEHAB RL: Learning to Optimize Fully Homomorphic Encryption Computations

CHEHAB RL: 学习优化完全同态加密计算

Bilel Sefsaf, Abderraouf Dandani, Abdessamed Seddiki, Arab Mohammed, Eduardo Chielle, Michail Maniatakos, Riyadh Baghdadi

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 CHEHAB RL通过深度强化学习自动优化FHE代码,提升执行速度和减少噪声,编译过程更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06917 2026-01-28 cs.LG cs.DS stat.ML 77%

Sample-Efficient Optimization over Generative Priors via Coarse Learnability

通过粗粒学习能力实现生成先验的高效优化

Pranjal Awasthi, Sreenivas Gollapudi, Ravi Kumar, Kamesh Munagala

机构 * Google Research(谷歌研究)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出粗粒学习能力假设,设计迭代算法在多项式样本内近似目标分布,为深度生成先验的基于模型优化提供样本复杂度保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11811 2026-01-28 cs.CL 77%

Less is More: Compact Clue Selection for Efficient Retrieval-Augmented Generation Reasoning

少即是多:为高效检索增强生成推理设计的紧凑线索选择

Qianchi Zhang, Hainan Zhang, Liang Pang, Yongxin Tong, Hongwei Zheng, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CompSelect通过紧凑线索选择机制提升RAG推理效率,减少LLM推理成本,优化线索提取与排序。

Comments Accepted to the ACM Web Conference 2026 (WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18909 2026-01-28 cs.LG 77%

How Is Uncertainty Propagated in Knowledge Distillation?

知识蒸馏中不确定性是如何传播的?

Ziyao Cui, Jian Pei

机构 * Duke University(杜克大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究探讨了知识蒸馏中不确定性的传播机制,提出两种方差感知策略以提高蒸馏效果,展示了在不同模型类别中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12479 2026-01-28 cs.DC cs.CE cs.SY econ.GN eess.SY q-fin.EC 76%

Cloud and AI Infrastructure Cost Optimization: A Comprehensive Review of Strategies and Case Studies

云计算与人工智能基础设施成本优化:策略与案例研究的全面综述

Saurabh Deochake

专题命中 效率与部署 :LLM(abstract,comments);large language model(abstract);language model(abstract)

AI总结 本文综述了云计算与人工智能基础设施成本优化策略与案例,探讨了AI工作负载管理及成本节约方法。

Comments Version 2. Significantly expanded to include AI/ML infrastructure and GPU cost optimization. Updated with 2025 industry data and new case studies on LLM inference costs. Title updated from "Cloud Cost Optimization: A Comprehensive Review of Strategies and Case Studies" to reflect broader scope

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13597 2026-01-28 cs.SE 75%

AI IDEs or Autonomous Agents? Measuring the Impact of Coding Agents on Software Development

AI集成开发环境还是自主代理?衡量编码代理对软件开发的影响

Shyam Agarwal, Hao He, Bogdan Vasilescu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨了基于LLM的编码代理对软件开发的影响,发现其在提升开发速度方面效果有限,但对软件质量产生持续负面影响,强调了需加强质量保障和选择性部署自主代理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19739 2026-01-28 cs.CL cs.AI 73%

TokenSeek: Memory Efficient Fine Tuning via Instance-Aware Token Ditching

TokenSeek: 通过实例感知的令牌丢弃实现内存高效的微调

Runjia Zeng, Qifan Wang, Qiang Guan, Ruixiang Tang, Lifu Huang, Zhenting Wang, Xueling Zhang, Cheng Han, Dongfang Liu

机构 * Rochester Institute of Technology(罗切斯特理工学院) Meta AI Kent State University(肯特州立大学) Rutgers University(罗格斯大学) UC Davis(加州大学戴维斯分校) Accenture(安永) University of Missouri-Kansas City(密苏里大学堪萨斯城分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TokenSeek通过实例感知的令牌丢弃技术,在保持性能的同时显著降低微调的内存消耗。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19613 2026-01-28 cs.CL cs.AI 73%

Up to 36x Speedup: Mask-based Parallel Inference Paradigm for Key Information Extraction in MLLMs

最高36倍提速:面向MLLMs关键信息提取的基于掩码的并行推断范式

Xinzhong Wang, Ya Guo, Jing Li, Huan Chen, Yi Tu, Yijie Hong, Gongshen Liu, Huijia Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Info Security Lab, Ant Group(蚂蚁集团信息安全部实验室) Inner Mongolia Research Institute, Shanghai Jiao Tong University(内蒙古研究院,上海交通大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于掩码的并行推断范式,通过并行生成提升MLLMs关键信息提取的效率,实现最高36倍的提速。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19503 2026-01-28 cs.CL cs.AI 73%

GradPruner: Gradient-Guided Layer Pruning Enabling Efficient Fine-Tuning and Inference for LLMs

GradPruner: 通过梯度引导的层剪枝实现LLM高效微调与推理

Wei Huang, Anda Cheng, Yinggui Wang

机构 * Ant Group Beijing, China(蚂蚁集团北京)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GradPruner通过梯度引导的层剪枝技术,在保持高精度的同时实现LLM微调和推理的高效优化。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏