arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-24 至 2026-02-24 共收录 58 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 58 篇

2507.04446 2026-02-24 cs.LG 89%

Sampling-aware Adversarial Attacks Against Large Language Models

针对大语言模型的采样感知对抗攻击

Tim Beyer, Yan Scholten, Leo Schwinn, Stephan Günnemann

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出了一种基于采样感知的对抗攻击方法,通过优化与采样资源分配提升攻击成功率和效率,揭示了采样在评估大语言模型安全性中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00553 2026-02-24 cs.LG cs.AI 88%

On Predictability of Reinforcement Learning Dynamics for Large Language Models

关于大型语言模型强化学习动态的可预测性

Yuchen Cai, Ding Cao, Xin Xu, Zijun Yao, Yuqing Huang, Zhenyu Tan, Benyi Zhang, Guangzhong Sun, Guiquan Liu, Junfeng Fang

机构 * USTC(中国科学技术大学) NUS(新加坡国立大学) HKUST(香港科技大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究发现大型语言模型强化学习动态的两个基本特性,并提出AlphaRL框架实现加速训练,保留高推理性能。

Comments 48 pages, 28 figures;

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15690 2026-02-24 cs.CV cs.CL 88%

MoDES: Accelerating Mixture-of-Experts Multimodal Large Language Models via Dynamic Expert Skipping

通过动态专家跳过加速混合专家多模态大语言模型

Yushi Huang, Zining Wang, Zhihang Yuan, Yifu Ding, Ruihao Gong, Jinyang Guo, Xianglong Liu, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Peking University(北京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16670 2026-02-24 cs.CR cs.AI 88%

BitHydra: Towards Bit-flip Inference Cost Attack against Large Language Models

BitHydra: 面向大语言模型的位翻转推理成本攻击

Xiaobei Yan, Yiming Li, Hao Wang, Han Qiu, Tianwei Zhang

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 BitHydra通过位翻转攻击针对大语言模型的推理成本进行攻击,利用ADMM方法高效实现无限生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17621 2026-02-24 cs.MA cs.AI cs.CL 88%

From Competition to Coordination: Market Making as a Scalable Framework for Safe and Aligned Multi-Agent LLM Systems

从竞争到协调:市场制作作为安全且对齐的多智能体大语言模型系统的可扩展框架

Brendan Gho, Suman Muppavarapu, Afnan Shaik, Tyson Tsay, Atharva Mohan, James Begin, Kevin Zhu, Archana Vaidheeswaran, Vasu Sharma

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种基于市场机制的多智能体大语言模型协调框架,通过结构化经济交换提升推理准确性和透明度,实现自我组织和可验证推理,为安全、对齐的AI系统提供可扩展解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08783 2026-02-24 cs.LG cs.AI cs.CL cs.NA math.NA 87%

CodePDE: An Inference Framework for LLM-driven PDE Solver Generation

CodePDE:基于LLM的PDE求解器生成推理框架

Shanda Li, Tanya Marwah, Junhong Shen, Weiwei Sun, Andrej Risteski, Yiming Yang, Ameet Talwalkar

机构 * Carnegie Mellon University(卡内基梅隆大学) Flatiron Institute(Flatiron研究院) Polymathic AI(多学科人工智能) Datadog

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CodePDE通过大语言模型生成PDE求解器,展示了LLM在复杂数学问题中的强大能力及潜在应用价值。

Comments TMLR. Code available at https://github.com/LithiumDA/CodePDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20133 2026-02-24 cs.NE cs.AI cs.CL 86%

AdaEvolve: Adaptive LLM Driven Zeroth-Order Optimization

AdaEvolve: 基于自适应LLM的零阶优化

Mert Cemri, Shubham Agrawal, Akshat Gupta, Shu Liu, Audrey Cheng, Qiuyang Mang, Ashwin Naren, Lutfi Eren Erdogan, Koushik Sen, Matei Zaharia, Alex Dimakis, Ion Stoica

机构 * University of California, Berkeley(加州大学伯克利分校) Bespoke Labs

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AdaEvolve通过自适应优化框架提升LLM驱动的零阶优化性能,有效解决搜索过程中的非平稳动态问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03346 2026-02-24 cs.LG cs.AI cs.MA 86%

KVComm: Enabling Efficient LLM Communication through Selective KV Sharing

KVComm: 通过选择性KV共享实现高效的LLM通信

Xiangyu Shi, Marco Chiesa, Gerald Q. Maguire, Dejan Kostic

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KVComm通过选择性共享KV对,实现LLM间高效通信,实验显示其性能与上界方法相当,仅传输30%的KV对。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01650 2026-02-24 cs.LG cs.AI 86%

The Unseen Frontier: Pushing the Limits of LLM Sparsity with Surrogate-Free ADMM

未被看见的前沿:通过无代理ADMM推动LLM稀疏性的极限

Kwanhee Lee, Hyeondo Jang, Dongyeop Lee, Dan Alistarh, Namhoon Lee

机构 * POSTECH ISTA

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Elsa通过无代理ADMM方法实现LLM高达90%的稀疏度,显著提升模型性能与效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01428 2026-02-24 cs.LG cs.CR 85%

Improving the Trade-off Between Watermark Strength and Speculative Sampling Efficiency for Language Models

提升语言模型中水印强度与推测采样效率之间的权衡

Weiqing He, Xiang Li, Li Shen, Weijie Su, Qi Long

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 效率与部署 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出了一种提升语言模型中水印强度与推测采样效率之间权衡的方法,通过定量指标和系统机制实现两者的平衡。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17560 2026-02-24 cs.AI 85%

ODESteer: A Unified ODE-Based Steering Framework for LLM Alignment

ODESteer: 一种基于常微分方程的统一激活引导框架用于大语言模型对齐

Hongjue Zhao, Haosen Sun, Jiangtao Kong, Xiaochang Li, Qineng Wang, Liwei Jiang, Qi Zhu, Tarek Abdelzaher, Yejin Choi, Manling Li, Huajie Shao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) William & Mary(威廉与玛丽学院) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ODESteer通过基于常微分方程的理论框架,统一了激活引导方法,实现了在大语言模型对齐中的显著性能提升。

Comments Accepted by ICLR 2026 (Camera Ready Version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05695 2026-02-24 cs.AI cs.PF 85%

SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference

SweetSpot: 一种预测LLM推理能效的分析模型

Hiari Pizzini Cavagna, Andrea Proia, Giacomo Madella, Giovanni B. Esposito, Francesco Antici, Daniele Cesarini, Zeynep Kiziltan, Andrea Bartolini

机构 * University of Bologna(博洛尼亚大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SweetSpot通过分析Transformer架构,提出预测LLM推理能效的模型,通过实验验证其在不同输入输出长度下的高效能表现,减少能耗达33.41倍。

Comments To appear at ICPE 2026 (International Conference on Performance Engineering)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00326 2026-02-24 cs.DC cs.AI cs.NI 85%

Teola: Towards End-to-End Optimization of LLM-based Applications

Teola:面向基于大语言模型应用的端到端优化

Xin Tan, Yimin Jiang, Yitao Yang, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Teola通过细粒度端到端编排方法优化基于大语言模型的应用,实现显著的速度提升。

Journal ref ASPLOS'25: Proceedings of the 30th ACM International Conference on Architectural Support for Programming Languages and Operating Systems, Vol. 2 (2025) 1302-1316

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04847 2026-02-24 cs.LG 85%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18931 2026-02-24 cs.DC 85%

WANSpec: Leveraging Global Compute Capacity for LLM Inference

WANSpec: 利用全球计算能力进行大语言模型推理

Noah Martin, Fahad Dogar

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 WANSpec通过将LLM生成任务转移到未充分利用的数据中心,利用本地计算资源缓解容量问题并减少高需求数据中心的延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV 82%

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :post-training(title,abstract);pretraining(abstract)

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04205 2026-02-24 cs.CL cs.AI 81%

STaRR: Spatial-Temporal Token-Dynamics-Aware Responsive Remasking for Diffusion Language Models

STaRR: 基于空间-时间令牌动态的响应性重掩码以提升扩散语言模型

Xinhao Sun, Huaijin Zhao, Maoliang Li, Zihao Zheng, Jiayu Chen, Yun Liang, Xiang Chen

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 STaRR通过动态调整重掩码策略,提升扩散语言模型的推理速度和输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06106 2026-02-24 cs.CL cs.LG 81%

Efficient Context Propagating Perceiver Architectures for Auto-Regressive Language Modeling

高效上下文传播感知架构用于自回归语言建模

Kaleel Mahmood, Shaoyi Huang

机构 * Department of Computer Science and Statistics, University of Rhode Island, Kingston, RI, USA(计算机科学与统计学系,罗德岛大学,金斯敦,罗德岛州,美国) Department of Computer Science, Stevens Institute of Technology, Hoboken, New Jersey, USA(计算机科学系,史蒂文斯理工学院,霍博肯,新泽西州,美国)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出ECP架构,通过结合上下文和潜在序列提升自回归语言建模性能,实现高效计算和更优的语言建模效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20126 2026-02-24 cs.LG cs.IT math.IT math.ST stat.ML stat.TH 79%

Adaptation to Intrinsic Dependence in Diffusion Language Models

适应内在依赖性在扩散语言模型中

Yunxiao Zhao, Changxiao Cai

机构 * Department of Industrial and Operations Engineering, University of Michigan(工业与运营工程系,密歇根大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出了一种分布无关的解屏蔽计划,使扩散语言模型能够适应目标数据分布的内在依赖结构,从而提升采样效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19574 2026-02-24 eess.AS cs.AI cs.SD 79%

CTC-TTS: LLM-based dual-streaming text-to-speech with CTC alignment

CTC-TTS: 基于大语言模型的双流文本到语音系统与CTC对齐

Hanwen Liu, Saierdaer Yusuyin, Hao Huang, Zhijian Ou

机构 * School of Computer Science and Technology, Xinjiang University, China(新疆大学计算机科学与技术学院) Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 CTC-TTS提出了一种基于大语言模型的双流文本到语音系统,采用CTC对齐器和双词交错策略,提升了流式合成和零样本任务的性能。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19225 2026-02-24 cs.AI 79%

Proximity-Based Multi-Turn Optimization: Practical Credit Assignment for LLM Agent Training

基于接近性的多轮优化:LLM代理训练中的实用信用分配

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi, Chang Liu, Peilin Zhao

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学) Lanzhou University(兰州大学) Tencent Inc.(腾讯公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 ProxMO通过动态调整梯度强度和连续语义加权,提升LLM代理在多轮训练中的信用分配效率与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07078 2026-02-24 cs.LG cs.SD eess.AS 79%

E-BATS: Efficient Backpropagation-Free Test-Time Adaptation for Speech Foundation Models

E-BATS:高效的无反向传播测试时间适应方法用于语音基础模型

Jiaheng Dong, Hong Jia, Soumyajit Chatterjee, Abhirup Ghosh, James Bailey, Ting Dang

机构 * The University of Melbourne(墨尔本大学) University of Auckland(奥克兰大学) Nokia Bell Labs, UK(诺基亚贝尔实验室(英国)) University of Birmingham(伯明翰大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 E-BATS是一种专为语音基础模型设计的高效无反向传播测试时间适应框架,通过轻量级提示适应、多尺度损失和测试时间指数移动平均机制,在适应效果和内存效率之间取得平衡,实现了4.1%-13.5%的准确率提升和2.0-6.4倍的GPU内存节省。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13632 2026-02-24 cs.CL cs.AI eess.AS 79%

Closing the Gap Between Text and Speech Understanding in LLMs

弥合语言模型中文本与语音理解之间的差距

Santiago Cuervo, Skyler Seto, Maureen de Seyssel, Richard He Bai, Zijin Gu, Tatiana Likhomanenko, Navdeep Jaitly, Zakaria Aldeneh

机构 * Université de Toulon, Aix Marseille Université, CNRS, LIS(法国图卢兹大学、马赛大学、CNRS、LIS)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SALAD通过主动选择和跨模态蒸馏提高语音与文本对齐,以更高效的方式弥合LLMs在语音理解上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00486 2026-02-24 cs.LG cs.AI stat.ML 79%

It Takes a Good Model to Train a Good Model: Generalized Gaussian Priors for Optimized LLMs

要训练一个好的模型,需要一个好的模型:通用高斯先验用于优化的大型语言模型

Jun Wu, Patrick Huang, Jiangtao Wen, Yuxing Han

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Electrical and Computer Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系) Computer Science, New York University Shanghai(纽约大学上海分校计算机科学系)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于广义高斯分布的初始化和训练方法,通过减少冗余和通信开销,提升大型语言模型的训练效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15886 2026-02-24 cs.CV 78%

RangeSAM: On the Potential of Visual Foundation Models for Range-View represented LiDAR segmentation

RangeSAM: 视觉基础模型在基于视距表示的激光雷达分割中的潜力

Paul Julius Kühn, Duc Anh Nguyen, Arjan Kuijper, Saptarshi Neil Sinha

专题命中 效率与部署 :foundation model(title,abstract)

AI总结 RangeSAM利用视觉基础模型SAM2改进基于视距的激光雷达分割,通过高效2D特征提取和定制架构优化,实现高效的3D分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18861 2026-02-24 cs.CV 78%

Joint Post-Training Quantization of Vision Transformers with Learned Prompt-Guided Data Generation

面向图像分类的视觉变换器联合后训练量化框架

Shile Li, Markus Karmann, Onay Urfalioglu

机构 * vivo Tech Research GmbH(vivo科技研究有限公司)

专题命中 效率与部署 :post-training(title,abstract)

AI总结 本文提出一种无标注数据的视觉变换器联合后训练量化方法,实现低比特下的高精度,并引入无数据校准策略提升边缘部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21363 2026-02-24 cs.RO 78%

Towards Bridging the Gap between Large-Scale Pretraining and Efficient Finetuning for Humanoid Control

迈向大规模预训练与高效微调之间的人形机器人控制的桥梁

Weidong Huang, Zhehan Li, Hangxin Liu, Biao Hou, Yao Su, Jingwen Zhang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)

专题命中 效率与部署 :pretraining(title,abstract)

AI总结 本文提出了一种结合大规模预训练与高效微调的方法,利用SAC实现人形机器人零样本部署,并通过基于模型的方法提升适应效率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06326 2026-02-24 cs.CR cs.AI 77%

AttestLLM: Efficient Attestation Framework for Billion-scale On-device LLMs

AttestLLM: 亿级参数本地设备LLM的高效认证框架

Ruisi Zhang, Yifei Zhao, Neusha Javidnia, Mengxin Zheng, Farinaz Koushanfar

机构 * University of Central Florida(佛罗里达中央大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AttestLLM通过算法/软件/硬件协同设计,为本地设备LLM提供高效认证框架,确保模型合法性并抵御替换和伪造攻击。

Comments accept to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01317 2026-02-24 cs.CR cs.AI 77%

TxRay: Agentic Postmortem of Live Blockchain Attacks

TxRay:活区块链攻击的代理事后分析

Ziyue Wang, Jiangshan Yu, Kaihua Qin, Dawn Song, Arthur Gervais, Liyi Zhou

机构 * Decentralized Intelligence AG(去中心化智能AG) The University of Sydney(悉尼大学) University of Warwick(沃里克大学) University of California, Berkeley(加州大学伯克利分校) University College London(伦敦大学学院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TxRay通过代理系统利用LLM和工具调用,从有限证据中重建活区块链攻击,生成可执行的PoC并验证根本原因,提升攻击分析效率和覆盖范围。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17155 2026-02-24 cs.LG 77%

Powering Up Zeroth-Order Training via Subspace Gradient Orthogonalization

通过子空间梯度正交化提升零阶训练

Yicheng Lang, Changsheng Wang, Yihua Zhang, Mingyi Hong, Zheng Zhang, Wotao Yin, Sijia Liu

机构 * Michigan State University(密歇根州立大学) University of Minnesota(明尼苏达大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) DAMO Academy, Alibaba Group US(阿里巴巴集团美国达摩院) IBM Research, USA(美国IBM研究院)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ZO-Muon方法,通过子空间梯度正交化提升零阶训练的精度和效率,显著加速收敛并实现准确性和查询效率的双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏