arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22405 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22405 篇

2605.11864 2026-05-13 cs.IR cs.AI cs.CV cs.MM 84%

Very Efficient Listwise Multimodal Reranking for Long Documents

非常高效的长文档多模态重排序方法

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute (MTRI)(马杰拉技术研究院(MTRI))

专题命中 效率与部署 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出ZipRerank,通过轻量级查询-图像早期交互机制和单次前向传递消除自回归解码,实现高效多模态重排序,实验表明其在MMDocIR基准上性能优异且显著降低LLM推理延迟。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12131 2026-05-13 cs.LG cs.DC 84%

BOOST: BOttleneck-Optimized Scalable Training Framework for Low-Rank Large Language Models

BOOST:用于低秩大语言模型的瓶颈优化可扩展训练框架

Zhengyang Wang, Ziyue Liu, Ruijie Zhang, Avinash Maurya, Paul Hovland, Bogdan Nicolae, Franck Cappello, Zheng Zhang

机构 * Anonymous Authors(匿名作者)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

AI总结 BOOST通过引入瓶颈感知张量并行和优化技术,提升低秩瓶颈架构的训练效率,实现1.46-1.91倍的速度提升,同时减少通信开销和GPU利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10793 2026-05-12 cs.LG 84%

ConQuR: Corner Aligned Activation Quantization via Optimized Rotations for LLMs

ConQuR:通过优化旋转实现的角对齐激活量化用于大语言模型

Chayne Thrash, Ali Abbasi, Soheil Kolouri

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出一种轻量级后训练旋转校准方法,通过学习正交旋转将归一化激活对齐超立方体的角落,提高激活能量在维度上的分布均匀性,避免端到端训练和大规模激活存储。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23074 2026-05-12 cs.CR cs.CL 84%

Fast-MIA: Efficient and Scalable Membership Inference for LLMs

Fast-MIA:高效且可扩展的大型语言模型成员推断

Hiromu Takahashi, Shotaro Ishihara

机构 * Independent Researcher(独立研究者) Nikkei Inc.(日本 Nikkei 公司)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Fast-MIA库,通过高吞吐量批量推理和交叉方法缓存架构,提升LLM成员推断攻击的效率与可扩展性,支持统一框架和灵活配置,促进可重复的隐私风险审计研究。

Comments ACL 2026 System Demonstrations

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26334 2026-04-30 cs.DC cs.AR cs.LG 84%

Efficient, VRAM-Constrained xLM Inference on Clients

高效、受限于VRAM的xLM客户端推断

Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

机构 * Microsoft Corporation(微软公司) NVIDIA Corporation(英伟达公司)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出pipelined sharding技术,通过CPU-GPU混合调度优化xLM在客户端的高效推断,提升TTFT和TPS性能,适用于LLM和VLM。

Comments Accepted at MLSys 2026 (Industry Track). 17 pages, 7 figures, 9 tables. Code and artifacts available at: https://github.com/deepshnv/pipeshard-mlsys26-ae

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13903 2026-04-28 cs.CR cs.AI cs.DC 84%

CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment

CoreGuard: 保障边缘部署中大语言模型的基础能力免受模型窃取攻击

Qinfeng Li, Tianyue Luo, Xuhong Zhang, Yangfan Xie, Zhiqiang Shen, Lijun Zhang, Yier Jin, Hao Peng, Xinkui Zhao, Xianwei Zhu, Jianwei Yin

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Washington University in St. Louis(圣路易斯华盛顿大学) University of Science and Technology of China(中国科学技术大学) College of Computer Science and Technology, Zhejiang Normal University(浙江师范大学计算机科学与技术学院) China Electronics Technology Design and Research Institute(中国电子技术设计与研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CoreGuard,一种高效的边缘部署LLM保护方法,通过减少计算和通信开销实现上界安全保护,防止模型窃取和滥用。

Comments Accepted by NeurIPS 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07173 2026-04-20 cs.LG 84%

Improving the Throughput of Diffusion-based Large Language Models via a Training-Free Confidence-Aware Calibration

通过训练无关的置信度感知校准提高扩散式大语言模型的吞吐量

Jucheng Shen, Gaurav Sarkar, Yeonju Ro, Sharath Nittur Sridhar, Zhangyang Wang, Aditya Akella, Souvik Kundu

机构 * Rice University(里士大学) Intel(英特尔) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

AI总结 本文提出CadLLM,一种无需训练的加速扩散式大语言模型(dLLMs)推理吞吐量的方法。通过动态调整生成块大小、步长和阈值,结合置信度控制,减少softmax开销,提升吞吐量。

Comments 12 pages, 3 figures. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14210 2026-04-17 cs.CL cs.SE 84%

Chinese Language Is Not More Efficient Than English in Vibe Coding: A Preliminary Study on Token Cost and Problem-Solving Rate

中文并非在 vibe 编码中比英语更高效:关于 token 成本和问题解决率的初步研究

Simiao Ren, Xingyu Shen, Yuchen Zhou, Dennis, Ng, Ankit Raj

专题命中 效率与部署 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本文通过 SWE-bench Lite 评估中文在 LLM 编码任务中的 token 效率,发现中文并无效率优势,且成功率低于英语,提示语言切换未必带来成本节约。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05044 2026-04-15 cs.AI 84%

WebFactory: Automated Compression of Foundational Language Intelligence into Grounded Web Agents

WebFactory:自动化将基础语言智能压缩为 grounded Web agents

Sicheng Fan, Qingyun Shi, Shengze Xu, Shengbo Cai, Tieyong Zeng, Li Ling, Yanyi Shang, Dehan Kong

机构 * Fudan University(复旦大学) IMean AI The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 WebFactory 提出了一种自动化闭环强化学习流程,将大语言模型的潜在知识高效压缩为可操作的 agent 行为,实现了数据效率和泛化能力的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22911 2026-04-14 cs.CV cs.AI 84%

ForestPrune: High-ratio Visual Token Compression for Video Multimodal Large Language Models via Spatial-Temporal Forest Modeling

ForestPrune: 通过时空森林建模实现视频多模态大语言模型的高比率视觉令牌压缩

Shaobo Ju, Baiyang Song, Tao Chen, Jiapeng Zhang, Qiong Wu, Chao Chang, HuaiXi Wang, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 本文提出ForestPrune,一种无需训练的视频MLLM令牌压缩方法,通过时空森林建模实现高效高比率压缩,实验表明其在视频任务中效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06912 2026-04-09 cs.CV cs.AI 84%

Q-Zoom: Query-Aware Adaptive Perception for Efficient Multimodal Large Language Models

Q-Zoom:基于查询的自适应感知以实现高效多模态大语言模型

Yuheng Shi, Xiaohuan Pei, Linfeng Wen, Minjing Dong, Chang Xu

机构 * University of Sydney(悉尼大学) Sun Yat-sen University(中山大学) City University of Hong Kong(香港城市大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 Q-Zoom通过高效粗到细的框架优化多模态大语言模型的高分辨率感知,提升推理速度并保持精度,实验表明其在文档识别和高分辨率场景中表现优异。

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05865 2026-04-08 cs.AI cs.PL 84%

JTON: A Token-Efficient JSON Superset with Zen Grid Tabular Encoding for Large Language Models

JTON: 一种高效的JSON超集,采用Zen Grid表格编码以适应大语言模型

Gowthamkumar Nandakishore

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 本文提出JTON,一种高效的JSON超集,通过Zen Grid表格编码减少冗余,提升大语言模型处理结构化数据的效率与准确性。

Comments 20 pages, 13 figures, 14 tables. Code and test suite available at https://github.com/gowthamkumar-nandakishore/JTON

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03291 2026-04-07 cs.AR cs.AI 84%

RAGnaroX: A Secure, Local-Hosted ChatOps Assistant Using Small Language Models

RAGnaroX:一种使用小型语言模型的安全、本地托管的ChatOps助手

Benedikt Dornauer, Mircea-Cristian Racasan

机构 * University of Innsbruck(因斯布鲁克大学) c.c.com Moser GmbH(c.c.com Moser有限公司)

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.AI

AI总结 RAGnaroX是一种基于本地硬件的高效ChatOps助手,采用Rust实现,提供可审计的本地解决方案,通过模块化数据摄入、混合检索和函数调用实现灵活安全的部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00586 2026-04-02 cs.CL 84%

More Human, More Efficient: Aligning Annotations with Quantized SLMs

更人性化、更高效:将注释与量化小型语言模型对齐

Jiayu Wang, Junyoung Lee

机构 * Home Team Science and Technology Agency(内政团队科技局)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出通过量化小型语言模型在有限人类注释数据上进行微调,以获得高对齐性和确定性的评估与注释方法,提升了注释一致性并展示了其在情感分类任务中的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18274 2026-03-10 cs.LG 84%

Structural Inference: Interpreting Small Language Models with Susceptibilities

结构推断:通过易感性解释小型语言模型

Garrett Baker, George Wang, Jesse Hoogland, Daniel Murfet

专题命中 效率与部署 :language model(title);small language model(title);分类 cs.LG

AI总结 通过易感性分析,研究如何利用线性响应框架解释小型语言模型的功能模块结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01454 2026-03-03 cs.CV cs.AI 84%

VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models

VidDoS:针对基于视频的大语言模型的通用拒绝服务攻击

Duoxun Tang, Dasen Dai, Jiyao Wang, Xiao Yang, Jianyu Wang, Siqi Cai

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Shenzhen Loop Area Institute, China(深圳环园院) McGill University(麦吉尔大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 VidDoS是一种针对视频大语言模型的通用拒绝服务攻击方法,通过通用优化生成实例无关的触发器,导致模型推理延迟和token扩展显著增加,引发安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08818 2026-02-10 cs.LG 84%

FlexMoRE: A Flexible Mixture of Rank-heterogeneous Experts for Efficient Federatedly-trained Large Language Models

FlexMoRE: 一种灵活的秩异质专家混合模型,用于高效联邦训练的大型语言模型

Annemette Brok Pirchert, Jacob Nielsen, Mogens Henrik From, Lukas Galke Poech, Peter Schneider-Kamp

机构 * University of Southern Denmark(南丹麦大学) Ordbogen A/S(Ordbogen公司)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

AI总结 FlexMoRE通过灵活的秩异质专家混合模型,在联邦训练的大型语言模型中实现更高效的性能,使用低秩适配器替代完整专家,提升任务表现并减少参数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05400 2026-02-10 cs.CL 84%

OPUS: Towards Efficient and Principled Data Selection in Large Language Model Pre-training in Every Iteration

OPUS:在每次迭代中实现大语言模型预训练中的高效且原则性的数据选择

Shaobo Wang, Xuan Ouyang, Tianyi Xu, Yuzheng Hu, Jialin Liu, Guo Chen, Tianyu Zhang, Junhao Zheng, Kexin Yang, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

机构 * SJTU(上海交通大学) Alibaba(阿里巴巴)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

AI总结 OPUS通过在优化器诱导的更新空间中动态选择数据,提升大语言模型预训练的效率和效果,尤其在数据稀缺和低质量情况下表现优异。

Comments 45 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19221 2026-01-28 cs.CL 84%

DREAMSTATE: Diffusing States and Parameters for Recurrent Large Language Models

DREAMSTATE: 用于循环大语言模型的扩散状态和参数

Liu Xiao

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

AI总结 DREAMSTATE通过扩散模型实现RNN状态的生成与编辑,结合RNN局部优势与全局上下文适应性,提出混合架构提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04037 2026-01-23 cs.AI 84%

Evolving in Tasks: Empowering the Multi-modality Large Language Model as the Computer Use Agent

任务演化:使多模态大语言模型成为计算机使用代理

Yuhao Cheng, Liang Tang, Shuxian Li, Yukang Huo, Tiaonan Duan, Kaer Huang, Yanzhe Jing, Yiqiang Yan

机构 * Lenovo Research(联想研究) China Agricultural University(中国农业大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 本文提出自演化代理(SEA),通过数据生成、强化学习和模型增强三个创新,使7B参数模型在计算机使用任务中超越同类模型并接近更大规模模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11997 2025-12-16 cs.AI 84%

Log Anomaly Detection with Large Language Models via Knowledge-Enriched Fusion

通过知识增强融合进行大规模语言模型的日志异常检测

Anfeng Peng, Ajesh Koyatan Chathoth, Stephen Lee

机构 * University of Pittsburgh(匹兹堡大学) Eaton Corporation(埃顿公司)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

AI总结 EnrichLog通过知识增强融合技术,提升日志异常检测的准确性和可解释性,适用于实际系统部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21450 2025-11-04 cs.LG 84%

ParaRNN: Unlocking Parallel Training of Nonlinear RNNs for Large Language Models

Federico Danieli, Pau Rodriguez, Miguel Sarabia, Xavier Suau, Luca Zappella

机构 * Apple(苹果公司)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11252 2025-11-04 cs.SE cs.AI 84%

Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation

Chengze Li, Yitong Zhang, Jia Li, Liyi Cai, Ge Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09004 2025-10-13 cs.CL 84%

Decoupling Safety into Orthogonal Subspace: Cost-Efficient and Performance-Preserving Alignment for Large Language Models

Yutao Mou, Xiaoling Zhou, Yuxiao Luo, Shikun Zhang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08034 2025-10-10 cs.AI 84%

AILoRA: Function-Aware Asymmetric Initialization for Low-Rank Adaptation of Large Language Models

Xiaoshuang Ji, Zhendong Zhao, Xiaoyan Gu, Xiaojun Chen, Xin Zhao, Zeyao Liu

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI

Comments Submitted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07203 2025-10-09 cs.CL 84%

Sunflower: A New Approach To Expanding Coverage of African Languages in Large Language Models

Benjamin Akera, Evelyn Nafula Ouma, Gilbert Yiga, Patrick Walukagga, Phionah Natukunda, Trevor Saaka, Solomon Nsumba, Lilian Teddy Nabukeera, Joel Muhanguzi, Imran Sekalala, Nimpamya Janat Namara, Engineer Bainomugisha, Ernest Mwebaze, John Quinn

机构 * Sunbird AI

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16597 2025-09-23 cs.CL 84%

MCP: A Control-Theoretic Orchestration Framework for Synergistic Efficiency and Interpretability in Multimodal Large Language Models

Luyan Zhang

机构 * Northeastern University(东北大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

Comments 13 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00085 2025-09-23 cs.CL 84%

Efficient Beam Search for Large Language Models Using Trie-Based Decoding

Brian J Chan, MaoXun Huang, Jui-Hung Cheng, Chao-Ting Chen, Hen-Hsen Huang

机构 * Department of Computer Science, National Chengchi University(国立成功大学计算机科学系) Department of Computer Science, Cornell University(康奈尔大学计算机科学系) Institute of Information Science, Academia Sinica(中华科学研究院资讯研究所)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

Comments 13 pages, accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05584 2025-09-09 cs.LG cs.CV cs.PF 84%

ProfilingAgent: Profiling-Guided Agentic Reasoning for Adaptive Model Optimization

Sadegh Jafari, Aishwarya Sarkar, Mohiuddin Bilwal, Ali Jannesari

机构 * Department of Computer Science(计算机科学系) Iowa State University(爱荷华州立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 13 pages, 3 figures, 5 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05690 2025-08-15 cs.CR cs.DB cs.LG 84%

Leveraging large language models for SQL behavior-based database intrusion detection

Meital Shlezinger, Shay Akirav, Lei Zhou, Liang Guo, Avi Kessel, Guoliang Li

机构 * Huawei Tel Aviv Research Center(华为特拉维夫研究中心) Huawei Technologies Co. LTD(华为技术有限公司) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏