arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2606.11045 2026-06-10 cs.AI cs.LG 新提交 85%

What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents

什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化

Martin Andres Bertran, Aaron Roth, Zhiwei Steven Wu

机构 * Amazon Responsible AI(亚马逊负责任人工智能) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08446 2026-06-09 cs.LG cs.AI 新提交 85%

Sparrow: Sparse Rollout for Stable and Efficient Long-context RL of Large Language Models

Sparrow: 用于大语言模型稳定高效长上下文强化学习的稀疏 rollout

Yang Zhou, Ranajoy Sadhukhan, Zhaofeng Sun, Zhuoming Chen, Souvik Kundu, Saket Dingliwal, Sai Muralidhar Jayanthi, Aram Galstyan, Haizhong Zheng, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Cornell University(康奈尔大学) Intel(英特尔) Amazon AGI(亚马逊AGI)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 针对RLVR中长上下文rollout计算昂贵的问题,提出Sparrow方法,通过动态稀疏度调度保持token级策略失配的下尾统计量稳定,在Qwen3系列模型上实现2.0-2.4倍加速,并推广到更大模型和编程领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07690 2026-06-09 cs.LG cs.AI 新提交 85%

HARP: Efficient Data Selection for Finetuning Large Language Models

HARP:高效数据选择用于微调大型语言模型

Ning Wang, Zhengxin Zhang, Maosen Tang, Yitang Gao, Claire Cardie, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 提出层次主动区域剪枝(HARP),一种高效的基于训练的数据选择方法,通过层次结构和经验贝叶斯推断降低选择成本,同时保持下游对齐,在多个基准上优于最强基线最多8.9分,且训练样本减少约7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07500 2026-06-08 cs.LG cs.AI 新提交 85%

Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning

稀疏子空间到专家共享的任务无关持续学习

Fatema Siddika, Md Anwar Hossen, Tanwi Mallick, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SETA框架,通过将参数分解为任务特定专家和共享专家的稀疏子空间,结合自适应弹性锚定和路由感知正则化,解决LLM持续学习中的塑性-稳定性困境,在多个基准上优于现有方法。

Comments 19 pages. arXiv admin note: text overlap with arXiv:2601.17616

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20486 2026-08-24 eess.SP 新提交 85%

Wireless Physical-Layer Foundation Models: Architectures, Learning Paradigms, Applications, and Deployment

无线物理层基础模型:架构、学习范式、应用与部署

Mohammad Cheraghinia, Davide Buffelli, Liu Li, Mohammad Alhellani, Jaron Fontaine, Sattar Vakili, Mamoun Guenach, Eli De Poorter, Adnan Shahid

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文综述无线物理层基础模型(WPFMs)的架构、学习范式等,提出五维度分类体系,分析其在多领域的应用部署可行性,探讨模型压缩与挑战,为相关研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18339 2026-08-20 cs.CV cs.AI cs.CL cs.LG 新提交 85%

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

从推理到适应:视觉语言模型的统一最优传输视角

Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Wayne State University(韦恩州立大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出名为algname的VLM测试时适应方法,通过Wasserstein最优传输统一VLM的推理与适应目标,实验显示其性能较最优方法提升7%且效率先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15171 2026-08-18 cs.DC 新提交 85%

P-PAS: Prefill-Pressure Adaptive Scheduling for Long-Context LLM Serving

P-PAS:面向长上下文大语言模型服务的预填充压力自适应调度

Timo Sämann

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 针对长上下文LLM服务中静态最大批处理令牌数(MBT)无法适配不同调度压力的问题,提出P-PAS动态调度策略,可在各类负载下维持低延迟,避免固定MBT的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14333 2026-08-17 cs.AR 新提交 85%

Beyond Capacity: Scalable MoE LLM Inference via High-Bandwidth Flash with Direct GPU and HBM Paths

超越容量:通过具有直接GPU和HBM路径的高带宽闪存实现可扩展的MoE大语言模型推理

Seeyeon Kim, Juhyeong Jin, Joo-Young Kim

专题命中 效率与部署 :LLM(title,abstract);language model(abstract)

AI总结 该研究针对MoE大语言模型推理的HBM容量瓶颈,提出同时利用HBF到GPU的直接路径和HBF经HBM到GPU的中继路径的架构,可提升专家传递效率,实现1.94倍吞吐量与1.90倍端到端加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07076 2026-08-10 cs.SE 新提交 85%

Explanation-Guided Metamorphic Testing of Specialized Language Models: An Empirical Study

面向专用语言模型的解释引导式变异测试:一项实证研究

Xingcheng Chen, Mehmet Besenk, Andrea Stocco

专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文通过在三个数据集、四种模型架构下的20种配置开展实证研究,发现解释引导式变异测试生成的经验证故障诱导测试用例是启发式变异策略的2.30倍,可有效评估专用语言模型的鲁棒性。

Comments 20 pages, 4 figures. Accepted at ESEM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28418 2026-07-31 cs.AI cs.CL cs.LG 新提交 85%

WIDE: Boosting Adaptive LLM Inference via Token-level Dynamic Width Pruning

WIDE:通过令牌级动态宽度剪枝提升自适应大语言模型推理效率

Haozhe Hu, Hao Wu, Peiran Yin, Chao Han, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波东方理工大学宁波数字孪生研究院) Munich Center for Machine Learning, LMU Munich(慕尼黑大学慕尼黑机器学习中心)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WIDE是首个端到端可微令牌级动态宽度剪枝框架,通过两阶段训练与剪枝-内核协同设计,在50%稀疏度下实现显著推理加速与更优精度保持,性能优于现有动态剪枝方法。

Comments 30 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25346 2026-07-29 cs.IR 新提交 85%

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

反对用于检索的生成式模型:判别式语言模型作为有效的检索器

Zhe Xu, Prachi Agrawal, Kavosh Asadi, Tianyi Chen, Carl Hu, Justin Johnson, Wuwei Lan, Mingfu Liang, Xi Liu, Tik On Lui, Oladipo Ositelu, Sandeep Pandey, Ankit Peshin, Feng Qi, Anil Ramakrishna, Kaushik Rangadurai, Frank Shyu, Luke Simon, Yang Yang, Chiyu Zhang

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24788 2026-07-29 cs.AI cs.CL cs.LG 新提交 85%

GLIDE: Guided Layerwise Hybrid Attention for Efficient LLM Inference

GLIDE:用于高效大语言模型推理的引导式分层混合注意力机制

Vimal William, Ravi Tandon, Jyotikrishna Dass

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型推理时KV缓存瓶颈问题,提出GLIDE引导式分层混合注意力机制,通过分层自适应平衡线性循环与softmax窗口,非均匀压缩softmax占用空间,实现性能-效率权衡,降低长上下文生成延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18957 2026-07-22 cs.DC 新提交 85%

InstantInfer: Enabling Fast LLM Cold Start with Communicating Finite Automata

InstantInfer:使用通信有限自动机实现快速大语言模型冷启动

Yitao Yuan, Yongchao He, Shaoke Fang, Wenfei Wu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型推理服务冷启动低效问题,提出通信有限自动机抽象及编程框架,经证明其正确性后应用于vLLM相关环节形成InstantInfer,大幅加速冷启动且在多场景表现鲁棒。

Comments 15 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17415 2026-07-21 cs.AR 新提交 85%

Transition-Aware Backend Dispatch for Edge LLM Inference

用于边缘大语言模型推理的过渡感知后端调度

Alaaddin Goktug Ayar, Martin Margala

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究边缘平台大语言模型推理问题,提出过渡感知后端调度方法,结合算子特征与后端选择,经实验验证该方法能降低延迟、能量及能量延迟积,减少切换,提升边缘变压器工作负载调度效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17498 2026-07-21 quant-ph 新提交 85%

LLM-Driven Cross-Paradigm Design for Quantum Optimal Control

基于大语言模型驱动的量子最优控制跨范式设计

Yu-Qin Chen, Shi-Xin Zhang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对量子最优控制实际应用的瓶颈,提出由大语言模型驱动的QOC-Workbench工作流程,可跨范式设计协议,能自主解析文献、积累控制模式,在多场景验证中表现出色,建立了自主量子控制的跨范式方法。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11262 2026-07-14 cs.DC 新提交 85%

GPU-Tile-Sim: A Tile-Centric GPU Simulation Framework for LLM Hardware-Software Co-Design

GPU-Tile-Sim:用于大语言模型软硬件协同设计的以瓦片为中心的GPU仿真框架

Yitong Ding, Jiawei Huang, Renyang Guan, Yangjie Zhou, Zihan Liu, Yu Feng, Shixuan Sun, Mingyi Guo, Jingwen Leng, Jian Weng

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型中GPU内核给性能模型带来的挑战,提出GPU-Tile-Sim框架,以瓦片图表示内核执行,设计前后端,在多种工作负载上评估,精度高,还扩展到Blackwell验证其对设计分析的有效性。

Comments 14 pages, 14 figures. Accepted to MICRO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08116 2026-07-10 cs.NI 新提交 85%

MORES: Mobile Reasoning-as-a-Service via Distributed LLM Inference-Time Scaling

MORES:通过分布式大语言模型推理时间缩放实现移动推理即服务

Guanchen Liu, Hongyang Du, Kaibin Huang

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型推理时间缩放的计算和内存开销问题,提出MORES框架,利用隐式推理递归结构及基于语义MoE的DRL算法优化资源分配,实现边缘设备协作推理,提升系统吞吐量约18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07046 2026-07-09 cs.DC 新提交 85%

Voltron: Enabling Elastic Multi-Device Execution of LLM Inference for Empowered Edge Intelligence

Voltron:实现用于增强型边缘智能的大语言模型推理的弹性多设备执行

Chanwoo Cho, Wooseok Kim, Yonglak Son, Young Seo Lee, Young Geun Kim

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究旨在解决大语言模型推理在集中式执行的局限,提出利用边缘多用户端设备的方法。核心方法是Voltron框架,能弹性利用多设备适应边缘环境。主要贡献是比单设备执行的模型精度高16.5%,满足用户QoS需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04302 2026-07-07 cs.LG cs.AI cs.AR cs.CL cs.PF 新提交 85%

HiFA4: Training-Free 4-bit FlashAttention on Ascend HIF4 NPUs for LLM Inference

HiFA4:用于大语言模型推理的昇腾HIF4 NPU上的免训练4位FlashAttention

Hui Dong, Yanzhao Li, Jie Gao, Chunlu Li, Zhiyuan Zhang, Yupeng Sun, Zhenyuan Chen, Zhiqiang Zou

机构 * Huawei Technologies(华为技术有限公司)

专题命中 效率与部署 :LLM(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 HiFA4是一种训练后算子级设计,在昇腾NPU上用4位HIF4 Cube GEMM执行QK^T和PV进行大语言模型推理,结合Smooth-QK和P-Reordering机制,减少量化决策漂移,提升准确率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04181 2026-07-07 cs.DC 新提交 85%

CoCoScale: Leveraging Layer-wise Scaling to Unlock the Potential of Online LLM Serving

CoCoScale:利用逐层缩放释放在线大语言模型服务的潜力

Jingfeng Wu, Yiyuan He, Minxian Xu, Xitong Gao, Chong Ma, Le Chen, Min Shen, Lin Qu, Kejiang Ye, CHengzhong Xu

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究在线大语言模型服务中动态工作负载问题,提出CoCoScale逐层动态缩放机制,通过利用闲置资源扩展热层并行度,减少冷启动延迟,提升动态适应性和资源效率。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28251 2026-06-29 stat.AP 新提交 85%

Push Puppet Networks: Structured Bayesian Pruning Algorithm for Language Model Compression

推杆网络:用于语言模型压缩的结构化贝叶斯剪枝算法

Robert Kubinec

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 提出推杆网络,一种结构化贝叶斯剪枝算法,通过层次惩罚函数学习门控参数,在不加载完整模型的情况下将网络剪枝至特定大小,在高剪枝率下优于现有方法并实现GPU加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25324 2026-06-25 cs.CV 新提交 85%

Efficient Remote Sensing Instance Segmentation with Linear-Time State Space Distilled Visual Foundation Models

高效遥感实例分割:基于线性时间状态空间蒸馏的视觉基础模型

Qinzhe Yang, Keyan Chen, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北京航空航天大学沈元荣誉学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

专题命中 效率与部署 :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对Transformer在遥感实例分割中计算复杂度高的问题,提出基于知识蒸馏的线性复杂度状态空间模型RS4D,通过蒸馏ViT知识至轻量SSM骨干,实现参数减少8倍、FLOPs减少9倍且精度相当。

Comments 17 pages, 11 figures, has been published in IEEE TGRS vol. 64, pp. 5625417-5625417, 2026, Art no. 5625417, doi: 10.1109/TGRS.2026.3696104

Journal ref IEEE Transactions on Geoscience and Remote Sensing, vol. 64, pp. 5625417-5625417, 2026, Art no. 5625417

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15417 2026-06-16 cs.CV 新提交 85%

From Frames to Temporal Graphs: In-Context Egocentric Action Recognition with Vision-Language Models

从帧到时间图:基于视觉语言模型的上下文第一人称动作识别

Bessie Dominguez-Dager, Francisco Gomez-Donoso, Miguel Cazorla, Marc Pollefeys, Daniel Barath, Zuria Bauer

机构 * University of Alicante(阿利坎特大学) ETH Zürich(苏黎世联邦理工学院) Microsoft(微软)

专题命中 效率与部署 :language model(title,abstract);pretraining(abstract);prompting(abstract)

AI总结 提出将视频转换为时间动作图,通过多阶段提示生成自然语言叙述并结构化,实现上下文学习,在EGTEA和Epic-Kitchens-100上显著提升零样本和少样本动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11113 2026-06-10 cs.DC 新提交 85%

A Neurosymbolic Prolog Skill for LLM-Driven Service Placement

一种用于LLM驱动服务放置的神经符号Prolog技能

Jacopo Massa, Giuseppe Bisicchia, Patrizio Dazzi, Antonio Brogi

专题命中 效率与部署 :LLM(title,title_cn);language model(abstract)

AI总结 提出一种基于Prolog技能的神经符号方法,将服务放置意图转化为符号事实和规则,利用Prolog进行约束验证和推理,实现可检查的策略感知放置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06826 2026-06-08 cs.SE 新提交 85%

SkelDPO: A Skeleton-Guided Direct Preference Optimization Framework for Efficient Code Generation

SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成

Yu Yu, Chen Lyu

专题命中 效率与部署 :preference optimization(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17856 2026-08-19 cs.AI 新提交 84%

ARASH: Adaptive Retrieval And Shot Selection for Tabular Prediction

ARASH:面向表格预测的自适应检索与样本选择

Samirasadat Jamalidinan, Yue Xu, Kazem Cheshmi

机构 * McMaster University(麦克马斯特大学)

专题命中 效率与部署 :foundation model(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出ARASH方法,通过训练集局部邻域分析选择最优样本,在保持TabPFN相当准确率的同时,大幅降低其提示长度与内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16647 2026-08-18 cs.CL 新提交 84%

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) IQuest Research(IQuest研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL

AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13831 2026-08-17 eess.AS cs.CL 新提交 84%

VoiceChat-TTS: A Low-Latency Continuous Speech Synthesis Model for Interactive Agents

VoiceChat-TTS:面向交互智能体的低延迟连续语音合成模型

Edresson Casanova, Jaehyeon Kim, Mariana Graterol Fuenmayor, Shehzeen Hussain, Viacheslav Klimkov, Valentin Mendelev, Mikyas Desta, Paarth Neekhara, Piotr Zelasko, Chen Chen, Elena Rastorgueva, Ke Hu, Ankita Pasad, Xuesong Yang, Aya Alja'fari, Rajarshi Roy, Rohan Badlani, Jason Roche, Jason Li, Zhehuai Chen

专题命中 效率与部署 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 针对现有语音模型延迟高、无法处理用户插话的问题,提出VoiceChat-TTS模型,由LLM文本令牌流驱动,支持语句中途中断且不重置KV缓存,在保证高语音质量的同时实现低延迟连续语音合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09941 2026-08-12 cs.CL 新提交 84%

The Multilingual Quantization Tax: Structural Collapse and Typological Fragility in Edge SLMs

多语言量化代价:边缘端小型语言模型(SLM)中的结构崩溃与类型学脆弱性

Mohammad Wathiq Soualhi

专题命中 效率与部署 :SLM(title_cn,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 本研究针对Gemma 4、Qwen 3.5架构开展4比特量化的零样本多语言评估,发现量化存在类型学脆弱性等四类现象,揭示了量化代价的多语言差异。

Comments Under review at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06630 2026-08-10 cs.LG 新提交 84%

The Sparsity Whisperer

稀疏低语者

Linghao Kong, Inimai Subramanian, Micah Adler, Dan Alistarh, Dan Gutfreund, Nir Shavit

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文针对大语言模型剪枝忽略输出差异的问题,提出Wisp、Wisp+、Whisper等差异感知剪枝方法,在Llama系列模型上提升了剪枝效果,可与其他技术结合优化性能。

Comments 10 pages, 3 figures. Code available at https://github.com/Shavit-Lab/Whisper

详情

展开后加载摘要…

URL PDF HTML 收藏