arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-10 至 2026-02-10 共收录 454 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 104 篇

2602.07465 2026-02-10 cs.LG cs.CL 82%

On the Importance of a Multi-Scale Calibration for Quantization

关于多尺度校准在量化中的重要性

Seungwoo Son, Ingyu Seong, Junhan Kim, Hyemi Jang, Yongkweon Jeon

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MaCa方法,通过多尺度校准提升大语言模型量化精度,改进Hessian估计并增强量化效果。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07309 2026-02-10 cs.IR cs.AI cs.LG 82%

Semantic Search At LinkedIn

LinkedIn 的语义搜索

Fedor Borisyuk, Sriram Vasudevan, Muchen Wu, Guoyao Li, Benjamin Le, Shaobo Zhang, Qianqi Kay Shen, Yuchin Juan, Kayhan Behdin, Liming Dong, Kaixu Yang, Shusen Jing, Ravi Pothamsetty, Rajat Arora, Sophie Yanying Sheng, Vitaly Abdrashitov, Yang Zhao, Lin Su, Xiaoqing Wang, Chujie Zheng, Sarang Metkar, Rupesh Gupta, Igor Lapchuk, David N. Racca, Madhumitha Mohan, Yanbo Li, Haojun Li, Saloni Gandhi, Xueying Lu, Chetan Bhole, Ali Hooshmand, Xin Yang, Raghavan Muthuregunathan, Jiajun Zhang, Mathew Teoh, Adam Coler, Abhinav Gupta, Xiaojing Ma, Sundara Raman Ramachandran, Morteza Ramezani, Yubo Wang, Lijuan Zhang, Richard Li, Jian Sheng, Chanh Nguyen, Yen-Chi Chen, Chuanrui Zhu, Claire Zhang, Jiahao Xu, Deepti Kulkarni, Qing Lan, Arvind Subramaniam, Ata Fatahibaarzi, Steven Shimizu, Yanning Chen, Zhipeng Wang, Ran He, Zhengze Zhou, Qingquan Song, Yun Dai, Caleb Johnson, Ping Liu, Shaghayegh Gharghabi, Gokulraj Mohanasundaram, Juan Bottaro, Santhosh Sachindran, Qi Guo, Yunxiang Ren, Chengming Jiang, Di Mo, Luke Simon, Jianqiang Shen, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn(领英)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 LinkedIn推出基于大语言模型的语义搜索框架,通过优化相关性和参与度,在保持效率的同时提升检索质量和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07397 2026-02-10 cs.LG cs.AI 81%

Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference

在参加之前侦察:Sketch-and-Walk稀疏注意力用于高效的LLM推理

Hoang Anh Duy Le, Sahil Joshi, Zeyu Yang, Zhaozhuo Xu, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(计算机科学系, Rice大学) Department of Computer Science, Stevens Institute of Technology(计算机科学系, Stevens理工学院)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 Sketch&Walk通过无需训练的稀疏注意力方法,在高效LLM推理中实现高精度和速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07051 2026-02-10 cs.CV cs.AI cs.LG cs.NE 81%

Neural Sentinel: Unified Vision Language Model (VLM) for License Plate Recognition with Human-in-the-Loop Continual Learning

神经哨兵:用于车牌识别的统一视觉语言模型(VLM)与人类在循环持续学习

Karthik Sivakoti

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 Neural Sentinel利用视觉语言模型实现车牌识别与多任务学习,提升准确率并减少系统复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 81%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20125 2026-02-10 cs.LG cs.AI 81%

Membership Inference Attacks Against Fine-tuned Diffusion Language Models

针对微调扩散语言模型的成员推断攻击

Yuetian Chen, Kaiyuan Zhang, Yuntao Du, Edoardo Stoppa, Charles Fleming, Ashish Kundu, Bruno Ribeiro, Ninghui Li

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Cisco Research(思科研究)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAMA方法,通过稳健聚合解决稀疏信号挑战,显著提升对微调扩散语言模型的成员推断攻击效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06976 2026-02-10 cs.CL cs.AI cs.LG cs.PL 80%

Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks

弥合知识鸿沟:在推理时获取不熟悉编程语言以完成编码任务

Chen Shen, Wei Cheng, Jingyue Yang, Huan Zhang, Yuhan Wu, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学,中国)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ILA-agent框架,通过推理时动态交互获取不熟悉编程语言,提升编码任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08329 2026-02-10 cs.LG cs.AI cs.IT math.IT 80%

Near-Oracle KV Selection via Pre-hoc Sparsity for Long-Context Inference

通过预处理稀疏性实现近oracle的KV选择用于长上下文推理

Yifei Gao, Lei Wang, Rong-Cheng Tu, Qixin Zhang, Jun Cheng, Dacheng Tao

机构 * University College London(伦敦大学学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences (CAS)(深圳先进技术研究院,中国科学院) Chinese University of Hong Kong(香港中文大学) College of Computing & Data Science, Nanyang Technological University(computing 与数据科学学院,南洋理工大学)

专题命中 效率与部署 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PrHS通过预处理稀疏性在长上下文推理中实现近oracle的KV选择,有效降低计算和带宽成本,提升推理效率。

Comments An effective method for accelerating LLM's inference via selective KV processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07783 2026-02-10 cs.SE cs.AI 79%

Still Manual? Automated Linter Configuration via DSL-Based LLM Compilation of Coding Standards

Still Manual? 通过基于 DSL 的 LLM 编译实现自动代码规范的 linter 配置

Zejun Zhang, Yixin Gan, Zhenchang Xing, Tian Zhang, Yi Li, Xiwei Xu, Qinghua Lu, Liming Zhu

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出 LintCFG,一种基于 DSL 的 LLM 编译方法,用于自动生成功能规范的 linter 配置,提升开发者效率。

Comments Accepted By FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09009 2026-02-10 cs.LG cs.AI 79%

ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling

ANCRe: 适应性神经连接重新分配用于高效的深度扩展

Yilang Zhang, Bingcong Li, Niao He, Georgios B. Giannakis

机构 * University of Minnesota(明尼苏达大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 ANCRe通过适应性神经连接重新分配,有效提升深度扩展效率,加速收敛并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08621 2026-02-10 cs.LG cs.AI cs.CR 79%

Sparse Models, Sparse Safety: Unsafe Routes in Mixture-of-Experts LLMs

稀疏模型,稀疏安全:混合专家大语言模型中的不安全路线

Yukun Jiang, Hai Huang, Mingjie Li, Yage Zhang, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全研究中心)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究揭示了混合专家大语言模型中的不安全路由问题,提出RoSais评分和F-SOUR框架以量化和发现安全风险,通过实验展示了高ASR的攻击效果,并提出防御策略以提升模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08272 2026-02-10 cs.LG cs.AI 79%

When Do Multi-Agent Systems Outperform? Analysing the Learning Efficiency of Agentic Systems

多智能体系统何时表现更优?分析智能体系统的学习效率

Junwei Su, Chuan Wu

机构 * Department of Computer Science, University of Hong Kong(计算机科学系,香港大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多智能体强化学习在大语言模型中的学习效率,通过理论分析揭示任务分解与对齐对样本复杂性的影响,明确MARL在特定任务下的优势条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02563 2026-02-10 cs.SE cs.CL cs.LG cs.PL 79%

Compressed code: the hidden effects of quantization and distillation on programming tokens

压缩代码:量化和知识蒸馏对编程令牌的隐藏影响

Viacheslav Siniaev, Iaroslav Chelombitko, Aleksey Komissarov

机构 * National Sun Yat-Sen University(国立中山大学) DataSpike aglabx Neapolis University(尼apolis大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了量化和知识蒸馏对编程令牌的影响,通过分析令牌表示揭示了代码生成质量的优化方法和关键因素。

Comments 18 pages, 1 figure and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19191 2026-02-10 cs.CV 78%

Reading Images Like Texts: Sequential Image Understanding in Vision-Language Models

像阅读文本一样理解图像:视觉-语言模型中的序列图像理解

Yueyan Li, Chenggong Zhao, Zeyuan Zang, Caixia Yuan, Xiaojie Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 效率与部署 :language model(title,abstract)

AI总结 本文提出通过序列化方法理解图像内容,揭示视觉-语言模型中对象识别与空间感知的机制,改进解码效率并增强空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08817 2026-02-10 cs.LG 77%

Kirin: Improving ANN efficiency with SNN Hybridization

Kirin:通过混合SNN提升ANN效率

Chenyu Wang, Zhanglu Yan, Zhi Zhou, Xu Chen, Weng-Fai Wong

机构 * Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Kirin通过混合整数和脉冲神经网络,实现无损失的ANN到SNN转换,显著提升能效和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08376 2026-02-10 cs.LG 77%

OJBKQ: Objective-Joint Babai-Klein Quantization

OJBKQ:目标联合Babai-Klein量化

Xinyu Wang, Ziyu Zhao, Peng Lu, Yu Gu, Xiao-Wen Chang

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 OJBKQ通过联合优化激活和权重,提出了一种逐层的PTQ方法,以在低比特量化下实现更优的模型压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04769 2026-02-10 cs.LG 77%

NeuroCanvas: VLLM-Powered Robust Seizure Detection by Reformulating Multichannel EEG as Image

NeuroCanvas:通过重新表述多通道EEG为图像实现由VLLM驱动的鲁棒癫痫检测

Yan Chen, Jie Peng, Moajjem Hossain Chowdhury, Tianlong Chen, Yunmei Liu

机构 * MINDxAI Lab, Industrial \& Systems Engineering Department, University of Louisville UNITES Lab, University of North Carolina at Chapel Hill

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 NeuroCanvas通过重新表述多通道EEG为图像,利用VLLM实现高效且鲁棒的癫痫检测,提升F1分数20%并降低88%的推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10238 2026-02-10 cs.AI 77%

The Achilles' Heel of LLMs: How Altering a Handful of Neurons Can Cripple Language Abilities

大语言模型的致命弱点:改变少量神经元即可摧毁语言能力

Zixuan Qin, Qingchen Yu, Kunlin Lyu, Zhaoxin Fan, Yifan Sun

机构 * Center for Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(未来区块链与隐私计算北京先进创新中心) School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现大语言模型中存在关键神经元集,破坏这些神经元可导致模型崩溃,揭示了模型鲁棒性和可解释性的重要问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04787 2026-02-10 cs.MA cs.AI 77%

Trade in Minutes! Rationality-Driven Agentic System for Quantitative Financial Trading

一分钟内交易!基于理性驱动的量化金融交易代理系统

Zifan Song, Kaitao Song, Guosheng Hu, Ding Qi, Junyao Gao, Xiaohua Wang, Dongsheng Li, Cairong Zhao

机构 * Tongji University(同济大学) Microsoft Research Asia(微软亚洲研究院) University of Bristol(布里斯托大学) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TiMi是一种基于理性驱动的多代理系统,通过解耦策略开发与分钟级部署,实现量化金融交易的高效稳定盈利。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08067 2026-02-10 cs.LG 77%

Enhancing Bandit Algorithms with LLMs for Time-varying User Preferences in Streaming Recommendations

利用LLM增强带算法以应对流媒体推荐中随时间变化的用户偏好

Chenglei Shen, Yi Zhan, Weijie Yu, Xiao Zhang, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽学校) School of Artificial Intelligence and Data Science, University of International Business and Economics(国际商务经济大学人工智能与数据科学学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 HyperBandit+通过整合时间感知超网络和LLM预热机制,提升流媒体推荐中对随时间变化用户偏好的适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07778 2026-02-10 cs.CL 77%

Attn-GS: Attention-Guided Context Compression for Efficient Personalized LLMs

Attn-GS:基于注意力的上下文压缩用于高效个性化大语言模型

Shenglai Zeng, Tianqi Zheng, Chuan Tian, Dante Everaert, Yau-Shian Wang, Yupin Huang, Michael J. Morais, Rohit Patki, Jinjin Tian, Xinnan Dai, Kai Guo, Monica Xiao Cheng, Hui Liu

机构 * Michigan State University(密歇根州立大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 Attn-GS通过利用LLMs的注意力模式实现高效个性化,通过标记模型标记重要句子并指导压缩模型生成高质量压缩上下文,显著提升性能并减少token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07306 2026-02-10 cs.DC cs.LG 77%

Parallel Track Transformers: Enabling Fast GPU Inference with Reduced Synchronization

并行轨道变换器:通过减少同步实现快速GPU推理

Chong Wang, Nan Du, Tom Gunter, Tao Lei, Kulin Seth, Senyu Tong, Jianyu Wang, Guoli Yin, Xiyou Zhou, Kelvin Zou, Ruoming Pang

机构 * Apple(苹果公司)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 并行轨道变换器通过减少同步操作提升GPU推理效率,适用于大规模LLM服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12215 2026-02-10 cs.CL 77%

GMSA: Enhancing Context Compression via Group Merging and Layer Semantic Alignment

GMSA:通过组合并和层语义对齐增强上下文压缩

Jiwei Tang, Zhicheng Zhang, Shunlong Wu, Jingheng Ye, Lichen Bai, Zitai Wang, Tingwei Lu, Lin Hai, Yiming Zhao, Hai-Tao Zheng, Hong-Gee Kim

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) Seoul National University(首尔国立大学) Sun Yat-sen University(中山大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 GMSA通过组合并和层语义对齐技术,提升长上下文场景下的上下文压缩效率,实现更高效的模型压缩与下游任务性能提升。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01025 2026-02-10 cs.CL 77%

Knowing When to Stop: Efficient Context Processing via Latent Sufficiency Signals

何时停止:通过潜在充分信号实现高效的上下文处理

Roy Xie, Junlin Wang, Paul Rosu, Chunyuan Deng, Bolun Sun, Zihao Lin, Bhuwan Dhingra

机构 * Duke(杜克大学) Rice(稻田大学) JHU(约翰·霍普金斯大学) UC Davis(加州大学戴维斯分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 通过潜在充分信号实现高效上下文处理,使LLMs在获得足够信息后自动终止处理,提升效率并减少token使用。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08722 2026-02-10 cs.LG cs.AI 76%

QUOKA: Query-Oriented KV Selection For Efficient LLM Prefill

QUOKA:面向查询的键值选择以实现高效的LLM预填

Dalton Jones, Junyoung Park, Matthew Morse, Mingu Lee, Chris Lott, Harper Langston

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与部署 :LLM(title);分类 cs.AI、cs.LG

AI总结 QUOKA通过面向查询的键值选择,在保持准确性的同时显著加速了transformer推理,尤其在CPU上实现了接近7倍的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07276 2026-02-10 cs.AI cs.CL cs.LG 75%

Steer2Adapt: Dynamically Composing Steering Vectors Elicits Efficient Adaptation of LLMs

Steer2Adapt:动态组合转向向量引发LLM高效适应

Pengrui Han, Xueqiang Xu, Keyang Xuan, Peiyang Song, Siru Ouyang, Runchu Tian, Yuqing Jiang, Cheng Qian, Pengcheng Jiang, Jiashuo Sun, Junxia Cui, Ming Zhong, Ge Liu, Jiawei Han, Jiaxuan You

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STEER2ADAPT通过动态组合转向向量实现LLM高效适应,适用于需要多协调能力的复杂任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09006 2026-02-10 cs.LG cs.AI math.OC 73%

ARO: A New Lens On Matrix Optimization For Large Models

ARO:一种新的矩阵优化视角用于大模型

Wenbo Gong, Javier Zazo, Qijun Luo, Puqian Wang, James Hensman, Chao Ma

机构 * Microsoft Research(微软研究院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 ARO是一种基于梯度旋转的新矩阵优化方法,通过规范感知策略提升大模型训练效率,优于现有正交化和AdamW方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07963 2026-02-10 cs.CL cs.AI 73%

Lost in Translation? A Comparative Study on the Cross-Lingual Transfer of Composite Harms

迷失在翻译中?复合危害的跨语言迁移比较研究

Vaibhav Shukla, Hardik Sharma, Adith N Reganti, Soham Wasmatkar, Bagesh Kumar, Vrijendra Singh

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过复合危害基准测试,探讨了跨语言迁移中安全对齐的稳定性,发现攻击成功率在印度语言中显著上升,但上下文性危害迁移较温和,强调翻译基准在多语言安全测试中的必要性。

Comments Accepted at the AICS Workshop, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07265 2026-02-10 cs.LG cs.AI 73%

XShare: Collaborative in-Batch Expert Sharing for Faster MoE Inference

XShare: 为更快的MoE推理实现协同的批处理专家共享

Daniil Vankov, Nikita Ivkin, Kyle Ulrich, Xiang Song, Ashish Khetan, George Karypis

机构 * ASU(亚利桑那州立大学) Amazon Web Services(亚马逊网络服务)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 XShare通过动态适应批次和高效贪心算法,减少专家激活并提升MoE推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08858 2026-02-10 cs.CV cs.AI 70%

FlattenGPT: Depth Compression for Transformer with Layer Flattening

FlattenGPT: Transformer中基于层扁平化的深度压缩

Ruihan Xu, Qingpei Guo, Yao Zhu, Xiangyang Ji, Ming Yang, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Tsinghua University(清华大学)

专题命中 效率与部署 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 FlattenGPT通过层扁平化技术实现Transformer模型的深度压缩,有效提升效率并保持性能,适用于多种模型类型和参数规模。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏