arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-03 至 2026-02-03 共收录 608 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 146 篇

2509.21033 2026-02-03 cs.SD cs.AI 77%

SupCLAP: Controlling Optimization Trajectory Drift in Audio-Text Contrastive Learning with Support Vector Regularization

SupCLAP:通过支持向量正则化控制音频-文本对比学习中的优化轨迹漂移

Jiehui Luo, Yuguo Yin, Yuxin Xie, Jinghan Ru, Xianwei Zhuang, Minghua He, Aofan Liu, Zihan Xiong, Dongchao Yang

机构 * Peking University(北京大学) Central Conservatory of Music(中央音乐学院) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 SupCLAP通过支持向量正则化有效控制音频-文本对比学习中的优化轨迹漂移,提升多模态学习的稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04204 2026-02-03 cs.LG cs.CR stat.ML 77%

Short-length Adversarial Training Helps LLMs Defend Long-length Jailbreak Attacks: Theoretical and Empirical Evidence

短长度对抗训练有助于LLMs防御长长度劫持攻击:理论和实证证据

Shaopeng Fu, Liang Ding, Jingfeng Zhang, Di Wang

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) The University of Sydney(悉尼大学) The University of Auckland(奥克兰大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过短长度对抗训练有效防御长长度劫持攻击,理论和实验证实了这种策略的可行性。

Comments The Thirty-ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00103 2026-02-03 cond-mat.soft cond-mat.mtrl-sci cs.AI 77%

Autonomous Multi-Agent AI for High-Throughput Polymer Informatics: From Property Prediction to Generative Design Across Synthetic and Bio-Polymers

自主多智能体AI用于高通量聚合物信息学:从性质预测到生成设计跨越合成与生物聚合物

Mahule Roy, Adib Bazgir, Arthur da Silva Sousa Santos, Yuwen Zhang

机构 * Institute of Biomedical Engineering University of Oxford(生物医学工程研究所牛津大学) Department of Mechanical and Aerospace Engineering University of Missouri–Columbia(机械与航空航天工程系密苏里大学-哥伦比亚分校) Center for Engineering, Modeling and Applied Social Sciences Federal University of ABC (UFABC)(工程、建模与应用社会科学中心巴西联邦大学ABC分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个自主多智能体AI系统,用于高通量聚合物信息学,实现从性质预测到生成设计的跨合成与生物聚合物应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01233 2026-02-03 cs.LG cs.AI 76%

Lotus: Efficient LLM Training by Randomized Low-Rank Gradient Projection with Adaptive Subspace Switching

Lotus: 通过随机低秩梯度投影与自适应子空间切换实现高效的LLM训练

Tianhao Miao, Zhongyuan Bao, Lejun Zhang

机构 * Hong Kong Baptist University, School of Science, Hong Kong, China(香港 Baptist 大学,科学学院,香港,中国) Fudan University, School of Data Science, Shanghai, China(复旦大学,数据科学学院,上海,中国) New York University, Tandon School of Engineering, New York, USA(纽约大学,Tandon 工程学院,纽约,美国)

专题命中 效率与部署 :LLM(title);分类 cs.AI、cs.LG

AI总结 Lotus通过随机低秩梯度投影与自适应子空间切换,实现LLM训练的高效优化,减少30%训练时间和40%内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11367 2026-02-03 cs.LG cs.AI cs.CL 75%

Sparse Autoencoder Features for Classifications and Transferability

稀疏自编码器特征用于分类和可迁移性

Jack Gallifant, Shan Chen, Kuleen Sasse, Hugo Aerts, Thomas Hartvigsen, Danielle S. Bitterman

机构 * Harvard University(哈佛大学) Mass General Brigham(麻省总医院) Boston Children’s Hospital(波士顿儿童医院) Johns Hopkins University(约翰霍普金斯大学) Maastricht University(马斯特里赫特大学) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用稀疏自编码器提取LLM特征,通过优化架构和二进制化策略提升分类性能和跨模型迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02366 2026-02-03 cs.LG cs.AI 73%

ReasonCACHE: Teaching LLMs To Reason Without Weight Updates

ReasonCACHE: 教授大语言模型进行推理而不进行权重更新

Sharut Gupta, Phillip Isola, Stefanie Jegelka, David Lopez-Paz, Kartik Ahuja, Mark Ibrahim, Mohammad Pezeshki

机构 * FAIR at Meta(Meta 的 FAIR) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ReasonCACHE通过前缀微调实现无需权重更新的推理学习,在效率和表现上超越传统ICL和IWL方法。

Comments 26 pages, 17 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02199 2026-02-03 cs.AI cs.CL 73%

More Than a Quick Glance: Overcoming the Greedy Bias in KV-Cache Compression

超越快速一瞥:克服KV缓存压缩中的贪婪偏差

Aryan Sood, Tanvi Sharma, Vansh Agrawal

机构 * Indian Institute of Technology, Roorkee(印度理工学院拉胡尔学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LASER-KV通过块级累积策略克服KV缓存压缩中的贪婪偏差,实现更稳定的性能和更高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02195 2026-02-03 cs.LG cs.AI 73%

State Rank Dynamics in Linear Attention LLMs

线性注意力大语言模型中的状态排名动态

Ao Sun, Hongtao Zhang, Heng Zhou, Yixuan Ma, Yiran Qin, Tongrui Su, Yan Liu, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Chinese Academy of Sciences(中国科学院大学) CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院人工智能安全重点实验室) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学) University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示了线性注意力模型中状态排名分层现象,提出联合秩-范数剪枝策略,有效降低KV缓存开销并维持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02126 2026-02-03 cs.LG cs.AI 73%

Two-Stage Grid Optimization for Group-wise Quantization of LLMs

分两阶段的网格优化用于大语言模型的组级量化

Junhan Kim, Gukryeol Lee, Seungwoo Son, Jeewook Kim, Yongkweon Jeon

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出分两阶段的网格优化方法,通过显式最小化层间重建损失来提升大语言模型组级量化的准确性,同时减少计算开销。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01975 2026-02-03 cs.LG cs.AI 73%

IntraSlice: Towards High-Performance Structural Pruning with Block-Intra PCA for LLMs

IntraSlice: 面向高绩效结构剪枝的块内PCA方法用于大语言模型

Meng Li, Peisong Wang, Yuantian Shao, Qinghao Hu, Hongjian Fang, Yifan Zhang, Zhihui Wei, Jian Cheng

机构 * Nanjing University of Science and Technology(南京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology(北京信息科学研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 IntraSlice通过块内PCA实现高效结构剪枝,提升大语言模型的压缩性能与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01826 2026-02-03 cs.LG cs.AI 73%

Beyond Precision: Training-Inference Mismatch is an Optimization Problem and Simple LR Scheduling Fixes It

超越精度:训练-推理不匹配是一个优化问题,简单的学习率调度器可以解决它

Yaxiang Zhang, Yingru Li, Jiacai Liu, Jiawei Xu, Ziniu Li, Qian Liu, Haoyuan Li

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) CHUK-Shenzhen(CHUK-深圳) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过动态学习率调度器解决强化学习中训练-推理不匹配问题,通过减少学习率来抑制梯度噪声,从而稳定训练过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01519 2026-02-03 cs.LG cs.AI 73%

You Need an Encoder for Native Position-Independent Caching

你需要为原生位置无关缓存添加编码器

Shiju Zhao, Junhao Hu, Jiaqi Zheng, Guihai Chen

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Computer Science, Peking University, China(计算机学院,北京大学,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出原生PIC方法,通过在解码器-only LLMs中引入编码器并训练其支持PIC,开发了COMB缓存系统,显著提升了TTFT和吞吐量,同时保持精度。

Comments 12 pages, 10 figures. Welcome back, Encoder

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16979 2026-02-03 cs.LG cond-mat.dis-nn cs.AI stat.ML 73%

A Scalable Measure of Loss Landscape Curvature for Analyzing the Training Dynamics of LLMs

用于分析大语言模型训练动态的可扩展损失景观曲率度量

Dayal Singh Kalra, Jean-Christophe Gagnon-Audet, Andrey Gromov, Ishita Mediratta, Kelvin Niu, Alexander H Miller, Michael Shvartsman

机构 * Meta Superintelligence Labs(Meta超智能实验室) University of Maryland, College Park(马里兰大学哥伦比亚分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种可扩展的损失景观曲率度量,用于分析大语言模型的训练动态,展示了大规模下的尖锐度现象,并指导数据混合策略。

Comments Improved Appendix D proofs, text for clarity, added more related works

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08018 2026-02-03 cs.LG cs.AI 73%

KVmix: Gradient-Based Layer Importance-Aware Mixed-Precision Quantization for KV Cache

KVmix: 基于梯度的层重要性感知的KV缓存混合精度量化

Fei Li, Song Liu, Weiguo Wu, Shiqiang Nie, Jinyu Wang

机构 * Fei Li, Song Liu, Weiguo Wu, Shiqiang Nie, Jinyu Wang(作者)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KVmix通过基于梯度的重要性分析实现KV缓存的混合精度量化,有效平衡精度与效率,实现低内存高吞吐的LLM推理

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01274 2026-02-03 cs.CL cs.AI 73%

PACER: Blockwise Pre-verification for Speculative Decoding with Adaptive Length

PACER:基于自适应长度的块级预验证用于推测解码

Situo Zhang, Yifan Zhang, Zichen Zhu, Hankun Wang, Da Ma, Danyang Zhang, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science MoE Key Lab of Artificial Intelligence, SJTU AI Institute Shanghai Jiao Tong University(X-LANCE实验室,计算机科学学院,人工智能关键实验室,上海交通大学人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Pacer通过自适应长度的块级预验证技术,提升推测解码效率,实现高达3.09倍的加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01045 2026-02-03 cs.LG cs.AI physics.data-an stat.ML 73%

Superposition unifies power-law training dynamics

叠加统一了幂律训练动态

Zixin Jessie Chen, Hao Chen, Yizhou Liu, Jeff Gore

机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, USA(麻省理工学院物理系) Department of Electrical and Computer Engineering, Princeton University, Princeton, New Jersey 08544, USA(普林斯顿大学电气与计算机工程系) Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, Massachusetts 02139, USA(麻省理工学院机械工程系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 叠加技术通过统一幂律动态,显著加速了训练过程,使训练速度提升十倍,适用于多种神经网络。

Comments 17 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00871 2026-02-03 cs.AI cs.CL 73%

Beyond Output Critique: Self-Correction via Task Distillation

超越输出批评:通过任务蒸馏实现自我纠正

Hossein A. Rahmani, Mengting Wan, Pei Zhou, Longqi Yang, Nick Craswell, Emine Yilmaz, Sujay Kumar Jauhar

机构 * AI Center, University College London(伦敦大学学院人工智能中心) Microsoft(微软)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SELF-THOUGHT通过任务蒸馏引入任务抽象步骤,提升大型和小型语言模型的自我纠正能力,提高准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL 73%

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02180 2026-02-03 cs.LG 70%

STILL: Selecting Tokens for Intra-Layer Hybrid Attention to Linearize LLMs

STILL: 选择令牌以实现层内混合注意力以线性化大语言模型

Weikang Meng, Liangyu Huo, Yadan Luo, Jiawen Guan, Jingyi Zhang, Yingjian Li, Zheng Zhang

机构 * SMULL Group, Harbin Institute of Technology, Shenzhen(SMULL小组,哈尔滨工业大学,深圳) Pengcheng Laboratory(Pengcheng实验室) UQMM Lab, University of Queensland(UQMM实验室,昆士兰大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 STILL通过自显著性分数和NP-Map实现LLM的高效线性化,提升长上下文任务性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16600 2026-02-03 cs.AI 70%

You Only Forward Once: An Efficient Compositional Judging Paradigm

你只需一次转发:一种高效的组合判断范式

Tianlong Zhang, Hongwei Xue, Shilin Yan, Di Wu, Chen Xu, Guannan Zhang, Yunyun Yang

机构 * School of Science, Harbin Institute of Technology, Shenzhen, Guangdong Province, China(哈尔滨工业大学深圳校区科学学院) Accio, Alibaba Group, Hangzhou, Zhejiang Province, China(阿里集团杭州Accio)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 YOFO通过单次前向传递高效判断多模态大语言模型的结构化要求,实现速度与可解释性的平衡,同时支持依赖分析和事后CoT。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01395 2026-02-03 cs.CL 70%

Rethinking Selective Knowledge Distillation

重新思考选择性知识蒸馏

Almog Tavor, Itay Ebenspanger, Neil Cnaan, Mor Geva

机构 * Blavatnik School of Computer Science(Blavatnik计算机科学学院) Tel Aviv University(特拉维夫大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SE-KD方法,通过学生熵引导位置选择,提升大型语言模型在准确性、下游任务适应性和内存效率上的表现,同时减少训练时间和存储需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01381 2026-02-03 cs.CL stat.ML 70%

On the Power of (Approximate) Reward Models for Inference-Time Scaling

在推理时间扩展中(近似)奖励模型的效能

Youheng Zhu, Yiping Lu

机构 * Department of Industrial Engineering and Management Sciences(工业工程与管理科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了近似奖励模型在推理时间扩展中的有效性,通过理论分析表明,当贝尔曼误差被限制在O(1/T)时,结合SMC可将推理复杂度从指数级降至多项式级,显著提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01116 2026-02-03 cs.CL 70%

Logic-Oriented Retriever Enhancement via Contrastive Learning

基于对比学习的逻辑导向检索增强

Wenxuan Zhang, Yuan-Hao Jiang, Changyong Qi, Rui Jia, Yonghe Wu

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University, China(上海人工智能教育研究院,华东师范大学) Education Technology, East China Normal University, China(教育技术,华东师范大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LORE通过对比学习提升检索器的逻辑分析能力,无需额外资源,有效增强检索和生成性能。

Comments accepted by icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00969 2026-02-03 cs.LG 70%

On the Spectral Flattening of Quantized Embeddings

量化嵌入谱扁平化研究

Junlin Huang, Wenyi Fang, Zhenheng Tang, Yuxin Wang, Xueze Kang, Yang Zheng, Bo Li, Xiaowen Chu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究揭示了量化嵌入谱扁平化现象,证明了谱保真度对稳定低比特优化的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00879 2026-02-03 cs.LG 70%

Dynamic Expert Sharing: Decoupling Memory from Parallelism in Mixture-of-Experts Diffusion LLMs

动态专家共享:解耦内存与并行性在混合专家扩散语言模型中的方法

Hao Mark Chen, Zhiwen Mo, Royson Lee, Qianzhou Wang, Da Li, Shell Xu Hu, Wayne Luk, Timothy Hospedales, Hongxiang Fan

机构 * Imperial College London, London, UK(伦敦帝国学院) Samsung AI Center, Cambridge, UK(三星人工智能中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出动态专家共享方法,通过序列层面的coreset选择,减少MoE dLLMs中专家激活数量和延迟,同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00777 2026-02-03 cs.CL 70%

HyLRA: Hybrid Layer Reuse Attention for Efficient Long-Context Inference

HyLRA:混合层重用注意力用于高效长上下文推理

Xuan Ai, Qingqing Yang, Peng Wang, Lei Deng, Lin Zhang, Renhai Chen, Gong Zhang

机构 * City University of Hong Kong(香港城市大学) Theory Lab, Huawei Technologies(华为技术理论实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HyLRA通过混合层重用注意力机制,高效解决LLM长上下文推理中的二次计算瓶颈问题,提升吞吐量并保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22069 2026-02-03 cs.CL 70%

VTC-R1: Vision-Text Compression for Efficient Long-Context Reasoning

VTC-R1: 视觉-文本压缩用于高效长上下文推理

Yibo Wang, Yongcheng Jing, Shunyu Liu, Hao Guan, Rong-cheng Tu, Chengyu Wang, Jun Huang, Dacheng Tao

机构 * Nanyang Technical University(南洋技术大学) Alibaba Cloud Computing(阿里巴巴云计算)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VTC-R1通过视觉-文本压缩提升长上下文推理效率,实现3.4倍token压缩和2.7倍端到端延迟提升。

Comments Code: https://github.com/w-yibo/VTC-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16074 2026-02-03 cs.LG 70%

In-Context Multi-Operator Learning with DeepOSets

基于深度OSets的上下文多算子学习

Shao-Ting Chiu, Aditya Nambiar, Ali Syed, Jonathan W. Siegel, Ulisses Braga-Neto

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学) Department of Mathematics, Texas A&M University(数学系,德克萨斯A&M大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于深度OSets的多算子学习方法,通过简洁的架构实现高效训练和理论保证,能准确预测未见过的微分方程解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14531 2026-02-03 cs.CL 70%

VersatileFFN: Achieving Parameter Efficiency in LLMs via Adaptive Wide-and-Deep Reuse

VersatileFFN: 通过适应性宽深重用实现LLM中的参数效率

Ying Nie, Kai Han, Hongguang Li, Hang Zhou, Tianyu Guo, Enhua Wu, Xinghao Chen, Yunhe Wang

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) University of Macau(澳门大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VersatileFFN通过适应性宽深重用实现LLM参数效率,利用双路径结构在固定参数预算内提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19482 2026-02-03 cs.LG 70%

ELUTQ: Optimizing Quantization Accuracy under LUT-Based Computation for Edge LLMs

ELUTQ: 在基于LUT的计算下优化量化精度以适应边缘大语言模型

Xin Nie, Liang Dong, Haicheng Zhang, Jiawang Xiao, G. Sun

机构 * College of Electronic Information and Optical Engineering, Nankai University(电子信息与光工程学院,南开大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 ELUTQ通过分层线性量化提升边缘大语言模型低比特量化精度与性能

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏