arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 258 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 70 篇

2511.07110 2026-01-30 cs.AI 89%

Two Heads are Better than One: Distilling Large Language Model Features Into Small Models with Feature Decomposition and Mixture

双头胜于单头:通过特征分解和混合将大语言模型特征蒸馏到小模型中

Tianhao Fu, Xinxin Xu, Weichen Xu, Jue Chen, Ruilong Ren, Bowen Deng, Xinyu Zhao, Jian Cao, Xixin Cao

机构 * Peking university(北京大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CMM框架,通过特征分解和混合将大语言模型特征蒸馏到小模型中,提升市场做市效率。

Comments accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17417 2026-01-30 cs.LG 89%

A Comprehensive Evaluation on Quantization Techniques for Large Language Models

对大语言模型量化技术的全面评估

Yutong Liu, Cairong Zhao, Guosheng Hu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) School of Engineering Math and Technology, University of Bristol(布里斯托大学工程数学与技术学院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 本文对大语言模型的量化技术进行了全面评估,分析了预量化转换与误差缓解步骤,揭示了不同设置对性能的影响,并评估了最新数据格式的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15255 2026-01-30 cs.CL 89%

Boosting Large Language Models for Mental Manipulation Detection via Data Augmentation and Distillation

通过数据增强和蒸馏提升大语言模型用于心理操控检测

Yuansheng Gao, Peng Gao, Han Bao, Bin Li, Jixiang Luo, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 通过数据增强和蒸馏提升大语言模型用于心理操控检测,提高检测准确率和F1指标

Comments Accepted to WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21540 2026-01-30 cs.SI cs.MA eess.SP 89%

Opinion Consensus Formation Among Networked Large Language Models

网络化大语言模型中的意见共识形成

Iris Yazici, Mert Kayaalp, Stefan Taga, Ali H. Sayed

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究通过DeGroot模型分析网络化大语言模型的意见共识形成,发现共识依赖于讨论主题和内在偏见,而非初始条件,且收敛速度与图的特征值相关。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22132 2026-01-30 cs.LG 89%

Pay for Hints, Not Answers: LLM Shepherding for Cost-Efficient Inference

为提示付费,而非答案:用于高效推断的LLM牧师

Ziming Dong, Hardik Sharma, Evan O'Toole, Jaya Prakash Champati, Kui Wu

机构 * Department of Computer Science, University of Victoria, Victoria, Canada(维多利亚大学计算机科学系) Department Of Information Technology, Manipal University, Manipal, India(马那尔大学信息科技系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 LLM牧师通过请求LLM的短提示来提高SLM的准确性,显著降低推断成本,同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07213 2026-01-30 cs.CL cs.AI 88%

Language Lives in Sparse Dimensions: Toward Interpretable and Efficient Multilingual Control for Large Language Models

语言存在于稀疏维度:迈向可解释且高效的多语言控制大型语言模型

Chengzhi Zhong, Fei Cheng, Qianying Liu, Yugo Murawaki, Chenhui Chu, Sadao Kurohashi

机构 * Kyoto University(京都大学) NII(日本信息机构)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种无需训练的方法,通过稀疏维度实现多语言控制,提升大型语言模型的可解释性和效率。

Comments Accepted at EACL 2026 (Main). Our code will be available at: https://github.com/ku-nlp/language-specific-dimensions

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20885 2026-01-30 cs.CR 88%

What Hard Tokens Reveal: Exploiting Low-confidence Tokens for Membership Inference Attacks against Large Language Models

硬token揭示:利用低置信度token对大型语言模型进行成员推断攻击

Md Tasnim Jawad, Mingyan Xiao, Yanzhao Wu

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出HT-MIA方法,通过分析低置信度token的概率改进,提升对大型语言模型的成员推断攻击效果,并探讨差分隐私训练作为防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04328 2026-01-30 cs.IT cs.AI cs.CL cs.CR cs.LG math.IT 87%

OD-Stega: LLM-Based Relatively Secure Steganography via Optimized Distributions

OD-Stega: 基于LLM的相对安全隐写术通过优化分布

Yu-Shin Huang, Peter Just, Hanyun Yin, Krishna Narayanan, Ruihong Huang, Chao Tian

机构 * Department of Electrical and Computer Engineering, Texas A&M University(电气与计算机工程系,德克萨斯A&M大学) Department of Computer Scicence and Engineering, Texas A&M University(计算机科学与工程系,德克萨斯A&M大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OD-Stega通过优化分布提升LLM隐写术的安全性,结合算术编码与词汇截断技术,解决标记化不匹配问题,增强隐写文本的自然性。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18352 2026-01-30 cs.CL cs.AI 86%

LLM-based Few-Shot Early Rumor Detection with Imitation Agent

基于大语言模型的少样本早期谣言检测与模仿代理

Fengzhu Zeng, Qian Shao, Ling Cheng, Wei Gao, Shih-Fen Cheng, Jing Ma, Cheng Niu

机构 * Singapore Management University(新加坡管理大学) Hong Kong Baptist University(香港 Baptist大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于自主代理和大语言模型的少样本早期谣言检测框架,通过轻量级代理提升效率,实现准确性和早熟性的提升。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12481 2026-01-30 cs.LG cs.AI 86%

SAC-GLAM: Improving Online RL for LLM agents with Soft Actor-Critic and Hindsight Relabeling

SAC-GLAM:通过软演员-评论员和回顾重标记改进LLM代理的在线强化学习

Loris Gaven, Clement Romac, Thomas Carta, Sylvain Lamprier, Olivier Sigaud, Pierre-Yves Oudeyer

机构 * Inria (Flowers)(Inria(Flowers)) University of Bordeaux(波尔多大学) Hugging Face Univ Angers(昂热大学) LERIA SFR MATHSTIC(MATHSTIC联合研究机构) Sorbonne Université(索邦大学) ISIR

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SAC-GLAM通过结合软演员-评论员算法和回顾重标记,改进LLM代理的在线强化学习,提升其在复杂环境中的策略学习能力。

Comments This work has been presented at the IMOL workshop at NeurIPS 2025 (https://neurips.cc/virtual/2024/101058)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21758 2026-01-30 cs.DC cs.AI 85%

EWSJF: An Adaptive Scheduler with Hybrid Partitioning for Mixed-Workload LLM Inference

EWSJF:一种用于混合工作负载LLM推理的自适应调度器与混合分区

Bronislav Sidik, Chaya Levi, Joseph Kampeas

机构 * Toga Networks (Huawei)(Toga Networks(华为))

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EWSJF通过自适应学习调度策略,提升混合负载下LLM推理的吞吐量和响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22944 2026-01-30 cs.LG 85%

SINQ: Sinkhorn-Normalized Quantization for Calibration-Free Low-Precision LLM Weights

SINQ:用于无校准低精度LLM权重的Sinkhorn规范化量化

Lorenz K. Müller, Philippe Bich, Jiawei Zhuang, Ahmet Çelik, Luca Benfenati, Lukas Cavigelli

机构 * Huawei(华为)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 SINQ通过引入第二轴尺度因子和快速Sinkhorn-Knopp算法,实现无校准低精度LLM权重的高效量化,显著提升困惑度表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21611 2026-01-30 cs.IR cs.AI cs.CL 85%

Thinking Broad, Acting Fast: Latent Reasoning Distillation from Multi-Perspective Chain-of-Thought for E-Commerce Relevance

深度思考,快速行动:多视角链式推理的潜在推理蒸馏用于电子商务相关性

Baopu Qiu, Hao Chen, Yuanrong Wu, Changtong Zan, Chao Wei, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Zhejiang University(浙江大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出多视角链式推理蒸馏方法,通过改进的教师模型和轻量级学生模型提升电子商务搜索相关性建模的准确性和效率。

Comments 12 pages, 6 figures, Accepted by WWW2026 industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20755 2026-01-30 cs.SE 85%

ProfInfer: An eBPF-based Fine-Grained LLM Inference Profiler

ProfInfer: 基于eBPF的细粒度LLM推理分析器

Bohua Zou, Debayan Roy, Dhimankumar Yogesh Airao, Weihao Xu, Binqi Sun, Yutao Liu, Haibo Chen

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 ProfInfer基于eBPF技术,为LLM推理引擎提供细粒度性能分析,通过动态探针实现非侵入式监控,帮助优化调度和资源管理。

Comments Accepted in the 9th Annual Conference on Machine Learning and Systems (MLSys 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20802 2026-01-30 eess.AS cs.SD 85%

SPADE: Structured Pruning and Adaptive Distillation for Efficient LLM-TTS

SPADE:结构剪枝与自适应知识蒸馏用于高效的LLM-TTS

Tan Dat Nguyen, Jaehun Kim, Ji-Hoon Kim, Shukjae Choi, Youshin Lim, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) dot Inc.(42dot公司)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 SPADE通过结构剪枝和自适应知识蒸馏,实现高效LLM-TTS模型,减半Transformer深度并提升实时生成速度,同时保持高质量语音输出。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22101 2026-01-30 cs.CL cs.AI cs.LG 83%

ECO: Quantized Training without Full-Precision Master Weights

ECO:无需全精度主权重的量化训练

Mahdi Nikdan, Amir Zandieh, Dan Alistarh, Vahab Mirrokni

机构 * Google Research(谷歌研究) ISTA

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 ECO通过直接在量化参数上应用更新,消除了主权重带来的内存开销,实现了在保持精度的同时提升内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21298 2026-01-30 cs.SE 83%

Detecting Multiple Semantic Concerns in Tangled Code Commits

检测 tangled commits 中的多个语义关注点

Beomsu Koh, Neil Walkinshaw, Donghwan Shin

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出利用 SLMs 检测 tangled 提交中的多关注点,通过实验证明提交信息显著提升检测准确率。

Comments 28 pages, 12 figures. Submitted to Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21238 2026-01-30 cs.CV cs.AI 83%

PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models

PTQ4ARVG:后训练量化用于自回归视觉生成模型

Xuewen Liu, Zhikai Li, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与部署 :post-training(title,abstract);language model(abstract);分类 cs.AI

AI总结 PTQ4ARVG提出一种无需训练的后训练量化框架,解决ARVG模型在通道、令牌和样本层面的量化难题,实现8位和6位高效量化。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21189 2026-01-30 cs.CR cs.AI 83%

Adaptive and Robust Cost-Aware Proof of Quality for Decentralized LLM Inference Networks

自适应和稳健的成本感知质量证明用于去中心化大语言模型推理网络

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种自适应和稳健的成本感知质量证明机制,通过鲁棒聚合规则和动态信任权重提升共识一致性,减少对抗攻击影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21109 2026-01-30 cs.CL 83%

ChunkWise LoRA: Adaptive Sequence Partitioning for Memory-Efficient Low-Rank Adaptation and Accelerated LLM Inference

ChunkWise LoRA: 适应性序列分块用于内存高效低秩适应和加速大语言模型推理

Ketan Thakkar, Maitreyi Chatterjee, Ramasubramanian Balasubramanian, Achyuthan Jootoo, Rajendra Ugrani

机构 * Bentley University USA(伯克利大学) Cornell University USA(康奈尔大学) University of California Berkeley USA(加州大学伯克利分校) George Mason University USA(乔治·马歇尔大学) Georgia Institute of Technology USA(佐治亚理工学院)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ChunkWise LoRA通过动态分块和适应性配置提升LLM推理效率,实现更低延迟和内存消耗的同时保持性能。

Comments Presented at 13th IEEE International Conference on Intelligent Systems and Embedded Design

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21647 2026-01-30 cs.CL cs.AI cs.LG 82%

ILRR: Inference-Time Steering Method for Masked Diffusion Language Models

ILRR: 用于掩码扩散语言模型的推理时间引导方法

Eden Avrahami, Eliya Nachmani

机构 * School of Computer Science, Tel Aviv University, Israel(特拉维夫大学计算机科学学院) Department of Electrical and Computer Engineering, Ben Gurion University, Beer Sheva, Israel(本· Gurion大学电气与计算机工程系)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ILRR是一种无需学习的引导方法,通过单个参考序列在去噪过程中动态对齐生成序列与参考序列的激活,实现对扩散语言模型属性的高效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21031 2026-01-30 cs.LG cs.AI 81%

SIGMA-PPG: Statistical-prior Informed Generative Masking Architecture for PPG Foundation Model

SIGMA-PPG:基于统计先验的生成掩码架构用于PPG基础模型

Zongheng Guo, Tao Chen, Yang Jiao, Yi Pan, Xiao Hu, Manuela Ferrario

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子工程与信息生物工程系,米兰理工大学) State Key Laboratory of Industrial Control Technology, Zhejiang University(工业控制技术国家重点实验室,浙江大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Nell Hodgson Woodruff School of Nursing, Emory University(埃默里大学护理学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 SIGMA-PPG通过统计先验引导的生成掩码架构,利用强化学习和向量化量化提升PPG信号基础模型的鲁棒性和性能。

Comments 31 pages, 9 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21851 2026-01-30 cs.LG 79%

Visual Disentangled Diffusion Autoencoders: Scalable Counterfactual Generation for Foundation Models

视觉解耦扩散自编码器:用于基础模型的可扩展反事实生成

Sidney Bender, Marco Morik

机构 * Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.LG

AI总结 DiDAE通过解耦字典学习和扩散自编码器实现高效无梯度反事实生成,提升基础模型的鲁棒性和下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21794 2026-01-30 cs.LG 79%

Knowledge Vector Weakening: Efficient Training-free Unlearning for Large Vision-Language Models

知识向量削弱:高效无训练卸载方法用于大视觉-语言模型

Yejin Kim, Dongjun Hwang, Sungmin Cha, Junsuk Choe

机构 * Sogang University(ソガン大学) New York University(纽约大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 KVW提出了一种无需训练的高效卸载方法,通过削弱模型中被激活的知识向量,有效防止模型利用有害知识,提升计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02553 2026-01-30 cs.AI 79%

SimpleMem: Efficient Lifelong Memory for LLM Agents

SimpleMem: 为LLM代理高效终身记忆

Jiaqi Liu, Yaofeng Su, Peng Xia, Siwei Han, Zeyu Zheng, Cihang Xie, Mingyu Ding, Huaxiu Yao

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 SimpleMem通过语义无损压缩和三阶段流程,提升LLM代理在复杂环境中的记忆效率与检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21344 2026-01-30 cs.AI cs.HC cs.SE 79%

Dynamic Framework for Collaborative Learning: Leveraging Advanced LLM with Adaptive Feedback Mechanisms

动态框架用于协作学习:利用高级大语言模型与自适应反馈机制

Hassam Tahir, Faizan Faisal, Fady Alnajjar, Muhammad Imran Taj, Lucia Gordon, Aila Khan, Michael Lwin, Omar Mubin

机构 * Swinburne University of Technology, Melbourne, Australia(斯winburne技术大学,墨尔本,澳大利亚) Western Sydney University, Australia(西澳大学,澳大利亚) Department of Computer Science, LUMS, Pakistan(计算机科学系,拉瓦尔大学,巴基斯坦) UAE University, UAE(阿联酋大学,阿联酋) Zayed University, UAE(扎耶德大学,阿联酋) School of Business Western Sydney University, Australia(商学院,西澳大学,澳大利亚)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种动态协作学习框架,利用高级LLM和自适应反馈机制提升学生参与度与学习效果。

Comments Publication Link: https://ieeexplore.ieee.org/document/11118419

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19139 2026-01-30 cs.LG cs.DC cs.ET 79%

Native LLM and MLLM Inference at Scale on Apple Silicon

在Apple Silicon上大规模原生LLM和MLLM推理

Wayner Barrios

机构 * Wiqonn Technologies(Wiqonn技术公司)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.LG

AI总结 vllm-mlx在Apple Silicon上实现高效LLM和MLLM推理,通过原生优化提升文本模型吞吐量并减少多模态延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03217 2026-01-30 cs.SE cs.AI 79%

Abstain and Validate: A Dual-LLM Policy for Reducing Noise in Agentic Program Repair

回避与验证:一种双LLM策略用于减少代理程序修复中的噪声

José Cambronero, Michele Tufano, Sherry Shi, Renyao Wei, Grant Uy, Runxiang Cheng, Chin-Jung Liu, Shiying Pan, Satish Chandra, Pat Rondon

机构 * Google, USA(谷歌公司) Meta, USA(Meta公司)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出双LLM策略,通过bug回避和补丁验证减少代理程序修复中的噪声,提升修复成功率和可靠性。

Comments Accepted to the 2026 IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP '26)

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06725 2026-01-30 cs.AI cs.LG 79%

WorldLLM: Improving LLMs' world modeling using curiosity-driven theory-making

WorldLLM: 通过好奇心驱动的理论构建改进LLM的世界建模

Guillaume Levy, Cedric Colas, Pierre-Yves Oudeyer, Thomas Carta, Clement Romac

机构 * Inria(法国国家信息与自动化技术研究院) Univ. of Bordeaux(波尔多大学) MIT(麻省理工学院) Hugging Face

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 WorldLLM通过结合贝叶斯推断和好奇心驱动的强化学习,改进LLM在结构化环境中的世界建模能力,提升预测精度并生成可解释的环境理论。

Comments This project's code can be found at https://github.com/flowersteam/WorldLLM. This project was presented at RLDM 2025 (https://rldm.org/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02901 2026-01-30 cs.LG cs.AI 79%

Fairy2i: Training Complex LLMs from Real LLMs with All Parameters in $\{\pm 1, \pm i\}$

Fairy2i: 从真实LLM中训练复杂LLM,所有参数在{±1, ±i}中

Feiyu Wang, Xinyu Tan, Bokai Huang, Yihao Zhang, Guoan Wang, Peizhuang Cong, Tong Yang

机构 * Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 Fairy2i通过将预训练实值层转换为复形式,实现极低比特量化,显著提升LLM推理效率。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏