arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22531 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22531 篇

2506.11087 2026-02-17 cs.LG cs.AI cs.CL 80%

Enhancing Delta Compression in LLMs via SVD-based Quantization Error Minimization

通过基于SVD的量化误差最小化增强LLM中的delta压缩

Boya Xiong, Shuo Wang, Weifeng Ge, Guanhua Chen, Yun Chen

机构 * Shanghai University of Finance(上海财经大学) Tsinghua University(清华大学) Fudan University(复旦大学) Southern University of Science(南方科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PrinMix通过基于SVD的量化误差最小化方法,提升LLM中delta压缩的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08634 2026-02-17 cs.CL cs.AI cs.LG 80%

When Attention Collapses: How Degenerate Layers in LLMs Enable Smaller, Stronger Models

当注意力崩溃:LLMs中的退化层如何使小型模型更强大

Sunny Sanyal, Ravid Shwartz-Ziv, Alexandros G. Dimakis, Sujay Sanghavi

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) UC Berkeley(伯克利加州大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Inheritune通过继承预训练模型的早期层来构建更小但更强的语言模型,实现模型压缩与性能的平衡。

Comments Published in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12936 2026-02-16 cs.CV 80%

Unleashing MLLMs on the Edge: A Unified Framework for Cross-Modal ReID via Adaptive SVD Distillation

在边缘侧释放MLLMs:通过自适应SVD蒸馏实现跨模态重识别的统一框架

Hongbo Jiang, Jie Li, Xinqi Cai, Tianyu Xie, Yunhang Shen, Pingyang Dai, Liujuan Cao

机构 * Tencent Youtu Lab, Shanghai, China(腾讯优图实验室,上海,中国) Xiamen University, Media Analytics(厦门大学,媒体分析) Computing Lab, Department of Artificial Intelligence, School of Informatics, Xiamen, China(计算实验室,人工智能系,信息学院,厦门,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);SFT(abstract);prompting(abstract)

AI总结 本文提出MLLMEmbed-ReID框架,通过自适应SVD蒸馏实现跨模态重识别的统一部署,结合云-边缘架构提升性能与效率。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12685 2026-02-16 cs.CL cs.AI cs.LG 80%

ToolACE-MT: Non-Autoregressive Generation for Agentic Multi-Turn Interaction

ToolACE-MT:非自回归生成用于代理多轮交互

Xingshan Zeng, Weiwen Liu, Lingzhi Wang, Liangyou Li, Fei Mi, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Shanghai Jiao Tong University(上海交通大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ToolACE-MT通过非自回归生成方法高效构建高质量多轮代理对话,解决传统自回归方法效率低下的问题。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06976 2026-02-10 cs.CL cs.AI cs.LG cs.PL 80%

Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks

弥合知识鸿沟:在推理时获取不熟悉编程语言以完成编码任务

Chen Shen, Wei Cheng, Jingyue Yang, Huan Zhang, Yuhan Wu, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学,中国)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ILA-agent框架,通过推理时动态交互获取不熟悉编程语言,提升编码任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14982 2026-02-06 cs.LG cs.AI cs.CL stat.ML 80%

In-context Time Series Predictor

上下文时间序列预测器

Jiecheng Lu, Yan Sun, Shihao Yang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于上下文的时间序列预测方法,通过将时间序列预测任务转化为输入标记,提高了参数效率并减少了过拟合问题。

Comments Camera-ready version. Accepted at ICLR 2025

Journal ref Proceedings of the Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13771 2026-02-06 cs.LG cs.AI cs.CL 80%

LittleBit: Ultra Low-Bit Quantization via Latent Factorization

LittleBit:通过潜在因子分解实现超低比特量化

Banseok Lee, Dongkyu Kim, Youngcheon You, Youngmin Kim

机构 * Samsung Research(三星研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LittleBit通过潜在因子分解实现超低比特量化,实现高达31倍的内存压缩,同时在亚1比特域内提升模型性能,达到FP16的11.6倍推理加速。

Comments Accepted to NeurIPS 2025. Banseok Lee and Dongkyu Kim contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12728 2026-02-04 cs.CV cs.MM 80%

SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation

SpecFLASH: 一种基于潜在引导的半自回归推测解码框架,用于高效多模态生成

Zihua Wang, Ruibo Li, Haozhe Du, Joey Tianyi Zhou, Yu Zhang, Xu Yang

机构 * Southeast University, Nanjing, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学) A STAR Centre for Frontier AI Research (CFAR), Singapore(A STAR前沿人工智能研究中心)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 SpecFLASH是一种针对多模态生成的高效推测解码框架,通过潜在引导的token压缩和半自回归解码方案,显著提升视觉任务的解码速度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01762 2026-02-03 cs.AI cs.CL cs.LG 80%

PRISM: Parametrically Refactoring Inference for Speculative Sampling Draft Models

PRISM: 参数化重构推理用于推测采样草案模型

Xuliang Wang, Yuetao Chen, Maochan Zhen, Fang Liu, Xinzhou Zheng, Xingwu Liu, Hong Xu, Ming Li

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PRISM通过参数化重构推理方法,有效解耦模型容量与推理成本,提升LLM解码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20615 2026-02-03 cs.SE 80%

DRAINCODE: Stealthy Energy Consumption Attacks on Retrieval-Augmented Code Generation via Context Poisoning

DRAINCODE: 通过上下文污染对基于检索增强的代码生成进行隐秘的能量消耗攻击

Yanlin Wang, Jiadong Wu, Tianyue Jiang, Mingwei Liu, Jiachi Chen, Chong Wang, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 DrainCode通过上下文污染攻击,显著增加LLM的延迟和能耗,揭示了RAG代码生成系统在安全性和资源约束下的潜在风险。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09397 2026-01-26 cs.LG cs.AI cs.CC cs.CL 80%

On Fine-Grained I/O Complexity of Attention Backward Passes

关于注意力反向传递中细粒度I/O复杂度

Xiaoyu Li, Yingyu Liang, Zhenmei Shi, Zhao Song, Song Yue, Jiahao Zhang

机构 * Department of XXX, University of YYY, Location, Country(YYY大学XXX系) School of ZZZ, Institute of WWW, Location, Country(WWW研究所ZZZ学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了注意力机制中细粒度I/O复杂度,提出了一种在小缓存环境下优于现有方法的算法,并为高效LLM训练和推理提供了理论指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15352 2026-01-23 cs.SE 80%

A Prompt-Based Framework for Loop Vulnerability Detection Using Local LLMs

基于提示的本地LLM循环漏洞检测框架

Adeyemi Adeseye, Aisvarya Adeseye

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出基于本地LLM的循环漏洞检测框架,利用提示技术提高代码分析的准确性和安全性,验证Phi模型在性能上的优势。

Comments Accepted and Waiting to be published ICAI'25: 27th International Conference on Artificial Intelligence https://american-cse.org/csce2025/conferences-ICAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20075 2026-01-19 cs.AI cs.CL cs.CR cs.LG 80%

LLMs can hide text in other text of the same length

LLMs可通过相同长度的文本隐藏信息

Antonio Norelli, Michael Bronstein

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Calgacus协议,利用LLM在相同长度文本中隐藏信息,揭示了文本与意图脱钩的潜在风险,引发对AI安全和理解的深刻反思。

Comments 21 pages, main paper 9 pages. v5 contains an Italian translation of this paper by the author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23564 2026-01-07 cs.AI cs.CL cs.LG 80%

ReCode: Unify Plan and Action for Universal Granularity Control

ReCode:统一计划与行动以实现通用粒度控制

Zhaoyang Yu, Jiayi Zhang, Huixue Su, Yufan Zhao, Yifan Wu, Mingyi Deng, Jinyu Xiang, Yizhang Lin, Lingxiao Tang, Yuyu Luo, Bang Liu, Chenglin Wu

机构 * DeepWisdom The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReCode通过递归代码生成统一规划与行动,实现通用粒度控制,提升智能体在不同决策粒度上的灵活性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10304 2026-01-06 cs.LG cs.AI cs.CL 80%

Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting

通过回顾轨迹重写实现LM代理的样本高效在线学习

Michael Y. Hu, Benjamin Van Durme, Jacob Andreas, Harsh Jhamtani

机构 * New York University(纽约大学) Microsoft(微软)

专题命中 效率与部署 :language model(abstract);prompting(abstract);language agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ECHO通过回顾轨迹重写提升LM代理的样本效率,有效利用过去经验以更快适应新环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00022 2026-01-06 cs.CL cs.AI cs.LG 80%

KVCrush: Key value cache size-reduction using similarity in head-behaviour

KVCrush: 利用头部行为相似性进行键值缓存尺寸缩减

Gopi Krishna Jha, Sameh Gobriel, Liubov Talamanova, Nilesh Jain

机构 * Intel Corporation(英特尔公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVCrush通过利用头部行为相似性,减少KV缓存尺寸并提升模型精度,兼容多种实际部署方案。

Journal ref Proceedings of the 17th Asian Conference on Machine Learning (2025), PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16970 2025-12-22 cs.AI cs.CL cs.LG cs.MA 80%

PAACE: A Plan-Aware Automated Agent Context Engineering Framework

PAACE:一种计划感知的自动代理上下文工程框架

Kamer Ali Yuksel

机构 * Kamer Ali Yuksel(独立研究者)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PAACE通过计划感知的上下文工程框架提升LLM代理的准确性并减少上下文负载,实现高效多步骤任务处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09963 2025-12-16 cs.DC 80%

GoodSpeed: Optimizing Fair Goodput with Adaptive Speculative Decoding in Distributed Edge Inference

GoodSpeed: 通过自适应猜测解码优化公平的好吞吐量在分布式边缘推断中

Phuong Tran, Tzu-Hao Liu, Long Tan Le, Tung-Anh Nguyen, Van Quan La, Eason Yu, Han Shu, Choong Seon Hong, Nguyen H. Tran

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 GOODSPEED通过自适应猜测解码优化分布式边缘推断中的公平好吞吐量,采用梯度调度算法实现资源高效分配。

Comments Accepted at INFOCOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08266 2025-12-10 cs.SE 80%

Token Sugar: Making Source Code Sweeter for LLMs through Token-Efficient Shorthand

Token Sugar:通过高效的token缩写使源代码更甜

Zhensu Sun, Chengran Yang, Xiaoning Du, Zhou Yang, Li Li, David Lo

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 Token Sugar通过高效的token缩写减少源代码的token数量,提升LLM在代码生成中的效率和性能。

Comments Accepted by ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23856 2025-12-10 cs.CL cs.AI cs.HC cs.LG 80%

OMNIGUARD: An Efficient Approach for AI Safety Moderation Across Languages and Modalities

OMNIGUARD:一种跨语言和模态的高效AI安全审查方法

Sahil Verma, Keegan Hines, Jeff Bilmes, Charlotte Siska, Luke Zettlemoyer, Hila Gonen, Chandan Singh

机构 * University of Washington(华盛顿大学) Microsoft(微软公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Omniguard提出了一种跨语言和模态的高效方法,通过构建语言或模态无关的分类器提升有害提示检测的准确率,并在多语言、图像和音频提示任务中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16543 2025-12-09 cs.IR cs.AI cs.CL cs.LG 80%

The Oracle and The Prism: A Decoupled and Efficient Framework for Generative Recommendation Explanation

oracle 与 prism:一种解耦且高效的生成推荐解释框架

Jiaheng Zhang, Daqiang Zhang

机构 * Sun Yat-sen University(中山大学) School of Software Engineer Tong ji University(同济大学软件工程学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 prism 通过解耦推荐过程和蒸馏技术,提升可解释推荐系统的效率与可信度。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22217 2025-12-01 cs.NI 80%

Optimizing NetGPT via Routing-Based Synergy and Reinforcement Learning

通过基于路由的协同与强化学习优化NetGPT

Yuxuan Chen, Rongpeng Li, Xianfu Chen, Celimuge Wu, Chenghui Peng, Zhifeng Zhao, Honggang Zhang

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 NetGPT通过云边协同与强化学习优化,实现动态路由与边缘自改进,提升复杂请求处理效率与成本控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01457 2025-12-01 cs.LG cs.AI cs.CL 80%

Beyond Introspection: Reinforcing Thinking via Externalist Behavioral Feedback

超越内省:通过外部主义行为反馈强化思维

Diji Yang, Linda Zeng, Kezhen Chen, Yi Zhang

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DRR框架,通过外部主义行为反馈提升LLM推理质量,无需修改基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10652 2025-11-17 cs.CL cs.AI cs.HC cs.LG 80%

Cognitively-Inspired Episodic Memory Architectures for Accurate and Efficient Character AI

Rafael Arias Gonzalez, Steve DiPaola

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07482 2025-11-12 cs.LG cs.AI cs.CL 80%

Alignment-Constrained Dynamic Pruning for LLMs: Identifying and Preserving Alignment-Critical Circuits

Dev Patel, Gabrielle Gervacio, Diekola Raimi, Kevin Zhu, Ryan Lagasse, Gabriel Grand, Ashwinee Panda, Maheep Chaudhary

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03825 2025-11-07 cs.AI cs.CL cs.CR cs.LG 80%

How Different Tokenization Algorithms Impact LLMs and Transformer Models for Binary Code Analysis

Ahmed Mostafa, Raisul Arefin Nahid, Samuel Mulder

机构 * Ahmed Mostafa, 1Raisul Arefin, Samuel Mulder(未知)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Publication Notice. This paper was published in the BAR 2025 Workshop (with NDSS 2025) and is for research and educational use. Copyright \c{opyright} 2025 Internet Society. All rights reserved. Personal/classroom reproduction is permitted with this notice and full paper citation. All other uses, including commercial, require prior written permission from the Internet Society

Journal ref https://www.ndss-symposium.org/wp-content/uploads/bar2025-final13.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08436 2025-11-06 cs.CL cs.AI cs.LG 80%

From Haystack to Needle: Label Space Reduction for Zero-shot Classification

Nathan Vandemoortele, Bram Steenwinckel, Femke Ongenae, Sofie Van Hoecke

机构 * IDLab, Ghent University - imec(IDLab,根特大学 - imec)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Add acknowledgment

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02358 2025-11-05 cs.CL cs.AI cs.IR cs.LG cs.MM 80%

Let Multimodal Embedders Learn When to Augment Query via Adaptive Query Augmentation

Wongyu Kim, Hochang Lee, Sanghak Lee, Yoonsung Kim, Jaehyun Park

机构 * NC AI(NC人工智能)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to MMGenSR Workshop (CIKM 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00086 2025-11-04 cs.LG cs.AI cs.CL 80%

Generalizing Test-time Compute-optimal Scaling as an Optimizable Graph

Fali Wang, Jihai Chen, Shuhua Yang, Runxue Bao, Tianxiang Zhao, Zhiwei Zhang, Xianfeng Tang, Hui Liu, Qi He, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Pittsburgh(匹兹堡大学) Amazon(亚马逊) Microsoft(微软)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23603 2025-11-04 cs.CV 80%

PixelRefer: A Unified Framework for Spatio-Temporal Object Referring with Arbitrary Granularity

Yuqian Yuan, Wenqiao Zhang, Xin Li, Shihao Wang, Kehan Li, Wentong Li, Jun Xiao, Lei Zhang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云图研究院) Hupan Lab(鸿篇实验室) The Hong Kong Polytechnic University(香港理工大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏