arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 22280 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 22280 篇

2606.04238 2026-06-04 cs.LG cs.AI 86%

Recover-LoRA for Aggressive Quantization: Reclaiming Accuracy in 2-Bit Language Models via Low-Rank Adaptation with Knowledge Distillation on Synthetic Data

Recover-LoRA 用于激进量化:通过低秩适配与合成数据知识蒸馏恢复2比特语言模型的精度

Devleena Das, Rajeev Patwari, Elliott Delaye, Ashish Sirasao

机构 * Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对2比特激进量化导致的大语言模型精度严重下降问题,提出Recover-LoRA方法,结合选择性混合精度策略(仅MLP的gate和up层量化为2比特)和基于合成数据蒸馏的低秩适配训练,在Qwen3-4B上以1万合成样本在12个基准中恢复9个基准80-95%的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04063 2026-06-04 cs.LG cs.AI 86%

LLM Compression with Jointly Optimizing Architectural and Quantization choices

联合优化架构与量化选择的大语言模型压缩

Hoang-Loc La, Truong-Thanh Le, Amir Taherkordi, Phuong Hoai Ha

机构 * UiT The Arctic University of Norway(UiT北莫斯科斯大学) University of Oslo, Norway(奥斯陆大学)

专题命中 效率与部署 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可微神经架构搜索框架,联合优化大语言模型的架构配置与混合精度量化,实现更优的精度-延迟权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02388 2026-06-02 cs.LG cs.AI 86%

Policy and World Modeling Co-Training for Language Agents

语言智能体的策略与世界模型协同训练

Ning Lu, Baijiong Lin, Shengcai Liu, Jiahao Wu, Haoze Lv, Yanbin Wei, Lingting Zhu, Shengju Qian, Xin Wang, Ying-Cong Chen, Qi Wang, Ke Tang

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科学大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学大学(广州)) Hong Kong Polytechnic University(香港理工大学) LIGHTSPEED

专题命中 效率与部署 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 提出PaW框架,通过在强化学习过程中添加辅助世界模型监督,无需改变推理范式,提升语言智能体在多个任务上的性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00120 2026-06-02 eess.SP cs.AI cs.LG 86%

SpikeWFM: Spiking-Aided Wireless Foundation Model for Robust Channel Prediction

SpikeWFM:用于鲁棒信道预测的脉冲辅助无线基础模型

Liwen Jing, Yisha Lu, Tingting Yang, Li Sun, Yuxuan Shi, Yuwei Wang, Mengfan Zheng, Leiyang Xu

机构 * Mobile Information Networks-National Science and Technology Major Project(移动信息网络国家科技重大专项)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SpikeWFM混合架构,将脉冲神经网络与基于ANN的Transformer结合,通过时间稀疏性和事件驱动处理增强无线基础模型对噪声和干扰的鲁棒性,在信道预测任务上优于传统模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00079 2026-06-02 cs.LG cs.AI 86%

BitsMoE: Efficient Spectral Energy-Guided Bit Allocation for MoE LLM Quantization

BitsMoE: 面向MoE大语言模型量化的频谱能量引导比特分配

Jiayu Zhao, Zihan Teng, Minhao Fan, Tianrui Ma, Wentao Ren, Song Chen, Weichen Liu

机构 * School of Microelectronics, University of Science and Technology of China(中国科学技术大学微电子学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出BitsMoE框架,通过SVD分解和频谱能量引导的混合精度比特分配,解决MoE模型超低位量化中的精度损失问题,在Qwen3-30B-A3B-Base上2比特量化下准确率提升27.83个百分点。

Comments 29 pages, 6 figures, 9 tables. Code and models are available at https://github.com/zjiayu064/BitsMoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30448 2026-06-01 cs.LG cs.CL 86%

Bounded Behavioral Indistinguishability for Black-Box LLM Distillation

黑盒大语言模型蒸馏的有界行为不可区分性

Munawar Hasan

机构 * Michigan Technological University(密歇根技术大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 针对黑盒LLM蒸馏,提出有界行为不可区分性形式化定义,并通过对抗评估揭示语义相似性不足以保证行为不可区分性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02480 2026-05-29 cs.AI cs.LG 86%

Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting

通过早退机制控制语言模型中有害上下文的风险

Andrea Wynn, Metod Jazbec, Charith Peris, Rinat Khaziev, Anqi Liu, Daniel Khashabi, Eric Nalisnick

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊人工智能实验室) Amazon Alexa(亚马逊Alexa)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合动态早退预测与无分布风险控制的方法,限制有害上下文对语言模型性能的退化,并在有益上下文中实现计算效率提升。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26842 2026-05-27 cs.LG cs.CL 86%

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

MONA: 基于Nesterov加速的Muon优化器用于可扩展语言模型训练

Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

机构 * Meituan(美团)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 提出MONA优化器,通过将Nesterov加速项集成到Muon的梯度处理流程中,实现曲率感知加速,从而帮助逃离尖锐局部最小值,并在1B到68B参数的混合专家预训练中取得更优收敛和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26132 2026-05-27 cs.CL cs.LG 86%

Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline

自验证蒸馏:你的语言模型秘密地就是它自己的合成数据管道

Tony Lee, Percy Liang

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 提出自验证蒸馏算法,让大语言模型仅用无标注种子问题,通过自生成、自验证和自训练提升推理能力,在数学、科学和编程任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21902 2026-05-22 cs.AI cs.CL 86%

Planning in the LLM Era: Building for Reliability and Efficiency

在大语言模型时代进行规划:构建可靠性与效率

Michael Katz, Harsha Kokel, Kavitha Srinivas, Shirin Sohrabi

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在大语言模型时代规划领域的发展,重点介绍了通过生成可验证的符号求解器来提高规划的可靠性和效率的方法。

Comments Published at ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04746 2026-05-19 cs.CL cs.AI 86%

SignRoundV2: Toward Closing the Performance Gap in Extremely Low-Bit Post-Training Quantization for LLMs

SignRoundV2:朝着关闭LLMs极低比特后训练量化性能差距的目标

Wenhua Cheng, Weiwei Zhang, Heng Guo, Haihao Shen, Zaner Ma

机构 * Intel(英特尔公司) Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SignRoundV2框架,通过自适应混合精度策略和轻量稳定技术,在极低比特量化下保持高性能,实验表明在混合MXFP设置中实现接近无损性能,将性能差距缩小到约1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10875 2026-05-12 cs.LG cs.CL 86%

Compute Where it Counts: Self Optimizing Language Models

在需要的地方计算:自优化语言模型

Yash Akhauri, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出自优化语言模型(SOL),通过轻量策略网络动态分配计算预算,提升解码效率与生成质量,在不同模型和计算条件下优于静态分配和随机搜索。

Comments Accepted at ICML'26 Code: https://github.com/akhauriyash/SOL

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08134 2026-05-12 cs.LG cs.AI 86%

DARE: Diffusion Language Model Activation Reuse for Efficient Inference

DARE:扩散语言模型激活重用以提高推理效率

Natalia Frumkin, Bokun Wang, Hung-Yueh Chiang, Chi-Chih Chang, Mohamed S. Abdelfattah, Diana Marculescu

机构 * Chandra Family Department of Electrical and Computer Engineering(查德拉家族电子与计算机工程系) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cornell University(康奈尔大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 DARE通过利用扩散语言模型中token级冗余性,提高推理效率,减少计算量,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23865 2026-04-30 cs.LG cs.AI stat.ML 86%

Inverting Foundation Models of Brain Function with Simulation-Based Inference

通过基于模拟的推断翻转脑功能基础模型

Niels Bracher, Xavier Intes, Stefan T. Radev

机构 * Center for Modeling, Simulation, \& Imaging in Medicine, Rensselaer Polytechnic Institute, NY, USA

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过TRIBEv2验证了能否从合成脑活动恢复刺激属性,利用大语言模型生成刺激参数,展示了基础脑模型在逆向设计中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26209 2026-04-30 cs.CL cs.AI 86%

Breaking the Autoregressive Chain: Hyper-Parallel Decoding for Efficient LLM-Based Attribute Value Extraction

打破自回归链:用于高效LLM属性值提取的超并行解码

Theodore Glavas, Nikhita Vedula, Dushyanta Dhyani, Yilun Zhu, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Int. Lab. Learning Systems(学习系统国际实验室)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出超并行解码方法,通过利用共享内存和计算实现批量并行,提升属性值提取任务的效率,减少推理成本和时间,适用于多种独立输出结构的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18655 2026-04-27 cs.DC cs.AI cs.CL 86%

Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

解锁多LoRA支持的多用途基础大语言模型的边缘部署与设备端加速

Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Euntaik Lee, Dohyoung Kim, HyeonSu Lee, Gyusung Cho, JungBae Kim

机构 * Samsung Research Institute(三星研究院) Samsung Electronics(三星电子)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种硬件感知框架,实现基于LLaMA的多语言基础模型在三星S24/S25设备上的高效设备端推理,通过动态任务切换和多流解码机制,提升内存和延迟性能,验证了多用途大语言模型在边缘设备上的可行性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17659 2026-04-21 cs.CL cs.AI 86%

Semantic Density Effect (SDE): Maximizing Information Per Token Improves LLM Accuracy

语义密度效应(SDE):最大化信息每token提升大语言模型准确性

Amr Ahmed

机构 * Public Health Department, Riyadh First Health Cluster Ministry of Health, Saudi Arabia(沙特阿拉伯利雅得第一健康集群卫生部)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出语义密度效应,通过提高每个token的语义信息量提升LLM准确性,实验显示高密度提示在多个模型和基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15672 2026-04-20 cs.LG cs.CL 86%

Faster LLM Inference via Sequential Monte Carlo

通过序列蒙特卡洛方法加速大语言模型推理

Yahya Emara, Mauricio Barba da Costa, Chi-Chih Chang, Cameron Freer, Tim Vieira, Ryan Cotterell, Mohamed S. Abdelfattah

机构 * Cornell University(康奈尔大学) Makora(马科拉) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院)

专题命中 效率与部署 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SMC-SD方法,通过重要性加权重采样替代传统拒绝采样,提升推理速度,实验证明在多个基准测试中保持高精度的同时,比推测解码和自回归解码分别快2.36倍和5.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15803 2026-04-14 cs.LG cs.AI 86%

WebLLM: A High-Performance In-Browser LLM Inference Engine

WebLLM:一种高性能的浏览器内LLM推理引擎

Charlie F. Ruan, Yucheng Qin, Akaash R. Parthasarathy, Xun Zhou, Ruihang Lai, Hongyi Jin, Yixin Dong, Bohan Hou, Meng-Shiun Yu, Yiyan Zhai, Sudeep Agarwal, Hangrui Cao, Siyuan Feng, Tianqi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Jiao Tong University(上海交通大学) NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 WebLLM通过JavaScript框架在浏览器内实现高性能LLM推理,利用WebGPU和WebAssembly结合MLC-LLM和Apache TVM优化,实现80%的本地性能,推动隐私保护的本地化LLM应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-04-14 cs.MA cs.AI cs.CL 86%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09624 2026-04-14 cs.CL cs.LG 86%

Self-Calibrating Language Models via Test-Time Discriminative Distillation

通过测试时判别蒸馏实现自校准语言模型

Mohamed Rissal Hedna, Jan Strich, Martin Semmann, Chris Biemann

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SECL方法,利用模型在回答正确性问题时的真实概率与声明置信度之间的差距进行无监督训练,有效降低校准误差,优于现有方法。

Comments Submitted to ACL March 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18150 2026-04-13 cs.LG cs.CL 86%

FP8-RL: A Practical and Stable Low-Precision Stack for LLM Reinforcement Learning

FP8-RL:一种实用且稳定的低精度栈用于大语言模型强化学习

Zhaopeng Qiu, Shuang Yu, Jingqi Zhang, Shuai Zhang, Xue Huang, Jingyi Yang, Junjie Lai

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种实用的FP8 rollout栈,用于大语言模型强化学习,通过块状FP8量化实现FP8 W8A8线性层rollout,扩展FP8到KV-cache以消除长上下文内存瓶颈,并通过重要性采样基于rollout修正缓解训练-推理不匹配问题,提升了rollout吞吐量达44%。

Comments Added more FP8 end2end experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04853 2026-04-13 cs.LG cs.AI cs.IT cs.NA math.IT math.NA 86%

Provable Post-Training Quantization: Theoretical Analysis of OPTQ and Qronos

可证明的训练后量化:OPTQ和Qronos的理论分析

Haoyu Zhang, Shihao Zhang, Ian Colbert, Rayan Saab

机构 * UC San Diego(加州大学圣地亚哥分校) AMD

专题命中 效率与部署 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次为OPTQ及Qronos提供了定量误差界,分析了训练后量化的迭代过程对量化误差的影响,并为参数选择和特征排序提供了理论依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06975 2026-04-10 cs.CR cs.AI cs.CL 86%

Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test

对黑盒LLM API进行基于排名的均匀性测试

Xiaoyuan Zhu, Yaowen Ye, Tianyi Qiu, Hanlin Zhu, Sijun Tan, Ajraf Mannan, Jonathan Michala, Raluca Ada Popa, Willie Neiswanger

机构 * University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校) Peking University(北京大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于排名的均匀性测试方法,用于验证黑盒LLM与本地部署的模型行为一致性,有效检测API提供者可能的模型替换或篡改行为,具有高准确性和低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06666 2026-04-09 cs.CL cs.AI 86%

A Graph-Enhanced Defense Framework for Explainable Fake News Detection with LLM

一种基于图的增强防御框架用于可解释的假新闻检测与大语言模型

Bo Wang, Jing Ma, Hongzhan Lin, Zhiwei Yang, Ruichao Yang, Yuan Tian, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Hong Kong Baptist University(香港浸会大学) Guangdong Institute of Smart Education, Jinan University(暨南大学广东智慧教育研究院) University of Science and Technology Beijing(北京科技大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence(知识驱动人机智能教育部工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出G-Defense框架,通过构建以声明为中心的图,利用检索增强生成技术获取证据并生成竞争性解释,以提高假新闻检测的准确性和解释质量。

Comments Accepted by TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06185 2026-04-09 cs.HC cs.AI cs.CL 86%

Benchmarking LLM Tool-Use in the Wild

在真实环境中评估大语言模型工具使用能力

Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

机构 * Tencent(腾讯)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WildToolBench基准测试,通过评估57个LLM在真实用户行为下的表现,揭示LLM在工具使用中的鲁棒性不足,强调需重新考虑LLM、用户与工具之间的交互。

Comments accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03257 2026-04-07 cs.CL cs.AI 86%

Robust LLM Performance Certification via Constrained Maximum Likelihood Estimation

通过约束最大似然估计实现鲁棒的大语言模型性能认证

Minghe Shen, Ananth Balashankar, Adam Fisch, David Madras, Miguel Rodrigues

机构 * University College London(伦敦大学学院) Google DeepMind(谷歌DeepMind)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于约束最大似然估计的方法,结合人工标注集、自动标注数据和领域约束,提升大语言模型失败率估计的准确性和稳定性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02985 2026-04-06 cs.IR cs.AI cs.CL 86%

Prompt Compression in the Wild: Measuring Latency, Rate Adherence, and Quality for Faster LLM Inference

野火中的提示压缩:测量延迟、速率遵守和质量以加快大语言模型推理

Cornelius Kummer, Lena Jurkschat, Michael Färber, Sahar Vahdati

机构 * ScaDS.AI Dresden/Leipzig, CIDS, TU Dresden(ScaDS.AI 德累斯顿/莱比锡,CIDS,德累斯顿工业大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了提示压缩在实际应用中的延迟、速率遵守和质量影响,通过大规模实验发现,当提示长度、压缩比和硬件容量匹配时,LLMLingua可实现18%的端到端加速,但超出此范围压缩步骤会抵消收益。

Comments Accepted at ECIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00026 2026-04-02 cs.CL cs.AI 86%

"Who Am I, and Who Else Is Here?" Behavioral Differentiation Without Role Assignment in Multi-Agent LLM Systems

我是谁,还有谁在这里?

Houssam EL Kandoussi

机构 * Independent Researcher(独立研究员)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了多个大语言模型在共享对话中是否发展出差异化社会角色或趋于统一行为,通过实验平台分析7种异质LLM群体在统一推理后端上的多代理讨论,发现异质群体行为差异化更显著,且模型名暴露会增加行为收敛,去除提示结构可使行为趋于同质。

Comments 9 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30035 2026-04-01 cs.LG cs.CL 86%

Reward-Based Online LLM Routing via NeuralUCB

基于神经UCB的奖励驱动在线大语言模型路由

Ming-Hua Tsai, Phat Tran

机构 * Oregon State University(俄勒冈州立大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于神经UCB的LLM路由策略,在模拟环境中验证其在成本意识路由中的优势,相比随机和最小成本基线,其在效用奖励上表现更优,同时保持较低的推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏