arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 799 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 799 篇

2606.06833 2026-06-08 cs.LG cs.AI cs.CR 新提交 88%

Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks

听弦外之音:面向声学对抗攻击的语言模型先验

Jiani Xie, Andrew C. Cullen, Paul Montague, Benjamin I. P. Rubinstein

机构 * University of Melbourne(墨尔本大学) DST Group(DST集团)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Semantic Gambit攻击,利用大语言模型实时提供预测上下文,突破因果限制,使实时ASR系统词错误率提升至35.6%,较当前最优方法提高三倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17521 2026-08-19 cs.CV 新提交 88%

BrainNorm: A Foundation Model that knows Normal via Semantic Atlas Pretraining

BrainNorm:一种通过语义图谱预训练了解正常状态的基础模型

Madhumitha Venkatesh, Shanawaj S Madarkar, Konda Reddy Mopuri

机构 * Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 该研究提出BrainNorm基础模型,经约6.6万例T1w sMRI数据训练,通过语义图谱预训练学习规范表征,在多类下游任务上泛化性能优异,其识别的神经退行性偏差与临床病理吻合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28529 2026-07-31 cs.SE 新提交 88%

CoGate: Confidence-Gated Co-Decoding for Secure Code Generation

CoGate:用于安全代码生成的置信门控协同解码

Minghao Hu, Lannan Luo, Allen Roush, Phillip Howard

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 针对现有协同解码未考虑专家模型置信度的问题,提出CoGate方法,在多LLM后端和代码生成基准上优于CoSec+,在CWEval的Func-Sec@10指标最高提升12.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20572 2026-07-24 q-bio.GN 新提交 88%

Auditing pretraining contamination in single-cell foundation model benchmarks

单细胞基础模型基准中的预训练污染审计

Sarwan Ali

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 研究单细胞基础模型基准中的预训练污染问题,提出scContam审计框架,结合指纹信号与成员推理攻击。应用于多个基准和模型,发现部分基准有污染,且MIA-scFM的AUROC与模型容量数据比有关,证明预训练审计可行且应伴随基准报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15704 2026-07-20 cs.CY 新提交 88%

The CRAFT principles for the responsible use of large language models in policymaking

政策制定中负责任使用大语言模型的CRAFT原则

Willem Fourie, Gray Manicom, Tanya de Villiers-Botha

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 研究政策制定中如何利用大语言模型,提出CRAFT原则,即控制、严谨、问责、公平和透明,以在管理风险的同时充分利用大语言模型改善政策制定过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02221 2026-07-03 cond-mat.stat-mech 新提交 88%

Alternative routes to universal diversity scaling in component systems: from proteomes to large language models

组件系统中通用多样性标度的替代路径:从蛋白质组到大语言模型

Andrea Mazzolini, Leonardo Agasso, Filippo Valle, Michele Caselle, Marco Cosentino Lagomarsino, Matteo Osella

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract)

AI总结 研究复杂组件系统中多样性标度定律的涌现条件,发现创新驱动增长模型与潜在异质性模型均能产生相同的宏观定律,但无法唯一确定生成机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23130 2026-06-24 cs.CR cs.SE 新提交 88%

Understanding the (In)Security of Vibe-Coded Applications

理解“氛围编码”应用的安全性(与非安全性)

Junquan Deng, Zhiyu Fan, Ruijie Meng

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统研究了通过“氛围编码”范式开发的应用的安全性,发现其存在占位符逻辑、未过滤输入和秘密泄露等重复性漏洞模式,根源在于AI代理的系统性局限,且即使改进LLM能力也无法消除根本风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22413 2026-06-24 cs.SE cs.FL 新提交 88%

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09854 2026-06-10 cs.CL cs.AI cs.CY cs.LG 新提交 88%

Can Multi-Agent LLMs Identify Their Peers? Stylometric Fingerprinting in Role-Constrained Political Analysis

多智能体大语言模型能否识别其同类?角色约束政治分析中的笔迹风格指纹识别

Juergen Dietrich

机构 * Democracy Intelligence gGmbH

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多智能体LLM在政治分析中能否通过笔迹风格识别模型家族,提出SD-CV协议,T5模型在五类归属任务中达到F1=0.991,证明提示级匿名化无法消除模型身份信号。

Comments 24 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19463 2026-08-21 cs.LG 新提交 87%

LLM as Detector: An In-context Learning Approach for Tabular Anomaly Detection

作为检测器的大语言模型:一种用于表格异常检测的上下文学习方法

Tu Anh Hoang Nguyen, Dang Nguyen, Thuc Duy Le, Trung Le, Sunil Gupta

机构 * Applied Artificial Intelligence Initiative (A2I2), Deakin University(应用人工智能计划(A2I2),迪肯大学) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.LG

AI总结 本研究提出LLM-Detector框架,利用LLM的上下文学习能力进行表格异常检测,在24个数据集上对比15个SOTA基线均获提升,且无需微调或神经网络训练,降低了计算成本。

Comments Accepted at International Conference on Neural Information Processing (ICONIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11656 2026-08-13 cs.LG 新提交 87%

Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models

面向EEG-语言基础模型的语义对齐连续隐式预测建模

Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee, Seong-Whan Lee

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出BLPM模型,通过CELP编码器与MQSD模块对齐EEG语义,解决EEG基础模型预训练的关键挑战,在多基准任务中实现良好泛化。

Comments 19 pages, 3 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03883 2026-08-05 cs.CL 新提交 87%

DS@GT-ARC at eRisk 2026 Task 3: Sparse, Semantic, and LLM Reranking for ADHD Symptom Sentences

佐治亚理工学院DS团队参加eRisk 2026任务3:针对ADHD症状句子的稀疏、语义及大语言模型重排序

David Guecha

专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文介绍佐治亚理工学院DS团队针对eRisk 2026任务3,采用分阶段检索结合稀疏BM25、语义及LLM重排序的方案,其中LLM重排序器取得官方最优成绩,分阶段重排序具发展前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13304 2026-07-16 cs.IR cs.CL 新提交 87%

Where Does the Noise Come From? A Variance-Components Decomposition of Non-Determinism in LLM Brand Answers

噪声从何而来?大语言模型品牌答案中非确定性的方差成分分解

Dmitrij Żatuchin

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型品牌答案中非确定性的来源,通过交叉随机效应分解将响应级品牌结果总方差分为提示内重采样等四个来源,应用于多语言多模型语料库,发现查询语言是最大方差来源,跨语言和模型能提升可靠性而非重复提示。

Comments 18 pages, 6 tables, 3 code listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23591 2026-06-23 cs.LG 新提交 87%

Quantifying the Agreement Between Data-Influence and Data-Similarity to Understand LLM Behavior

量化数据影响与数据相似性之间的一致性以理解LLM行为

Christopher J. Anders, Henrique Da Silva Gameiro, Nico Daheim, Mohammad Emtiyaz Khan

机构 * RIKEN Center for Advanced Intelligence Project, Tokyo, Japan(日本东京理化学研究所先进智能项目中心) Section of Computer Science, EPFL Lausanne, Switzerland(瑞士洛桑联邦理工学院计算机科学系) Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt(达姆施塔特工业大学计算机科学系泛在知识处理实验室) National Research Center for Applied Cybersecurity ATHENE, Germany(德国国家应用网络安全研究中心ATHENE) TU Darmstadt & Hessian Center for AI (hessian.AI), Darmstadt, Germany(达姆施塔特工业大学与黑森州人工智能中心)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 通过排序重叠量化数据相似性与数据影响在输出追踪中的一致性和不对称性,并利用不对称性实现成本-精度权衡。

Comments 37 pages, 35 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18192 2026-06-18 cs.AI 新提交 87%

The Stanford EDGAR Filings Dataset: Reconstructing U.S. Corporate and Financial Disclosures into Layout-Faithful and Token-Efficient Pretraining Data

斯坦福EDGAR文件数据集:将美国公司及财务披露重建为布局忠实且令牌高效的预训练数据

Nick Bettencourt, Xiaowei Ding, Kay Giesecke

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nanjing University(南京大学) Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 为解决长上下文文档稀缺问题,提出SEFD数据集,将SEC文件重建为布局忠实的MultiMarkdown格式,用于金融语言建模与评估,具有令牌高效、与Common Crawl重叠率低于0.1%的特点。

Comments Preprint. Includes appendix, tables, and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16707 2026-08-18 cs.CL cs.AI 新提交 87%

Semantic Bandits: In-Context Exploration-Exploitation is Biased by Semantic Priors

语义老虎机:上下文内的探索-利用受语义先验的偏置

David Eric Austin, Kaheer Suleman, Jackie Chi Kit Cheung

机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Skyfall AI(天空fall人工智能公司) McGill University(麦吉尔大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出语义老虎机框架,发现LLM的探索-利用受语义先验偏置,语义标签对齐奖励可提升性能,负奖励比同等正奖励触发更多探索,为LLM智能体决策可靠性提供了新见解。

Comments 10 pages, 5 figures in main body

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13277 2026-08-14 cs.CL cs.AI 新提交 87%

Mixture of Training: Recombining Small-Scale Scaffolded Pretraining Runs into a Larger Language Model

训练混合:将小规模支架式预训练运行重组为更大的语言模型

Mohammed Sabry, Sean Augenstein, Keith Rush, Lucio Dery

机构 * Google(谷歌公司) School of Computing, Dublin City University(都柏林城市大学计算机学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 本研究提出训练混合(MoT)框架,将Transformer划分为层块在冻结对齐器内独立训练后重组,在13亿参数Gemma模型上验证其可重组为可用语言模型,可复用对齐器实现计算优势,用于研究可复用训练单元。

Comments Accepted at the Workshop on Methods and Opportunities at Small Scale (MOSS), COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08107 2026-08-11 cs.CL cs.AI 新提交 87%

NeuPAT: Neuron-aware Plasticity Allocation Tuning for Language-Preserving MLLMs

NeuPAT:面向语言保留多模态大语言模型的神经元感知可塑性分配调优

Jiayue Jin, Jingwei Zhang, Chen Wang, Jing Liu, Longteng Guo

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 NeuPAT是一种轻量架构无关框架,通过选择性保护语言敏感神经元、促进高可塑性神经元适配多模态,在11个语言基准上恢复了普通调优94.5%的语言能力下降,同时保持相当多模态性能,实现了能力保留型多模态大语言模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05872 2026-08-07 cs.CL cs.AI 新提交 87%

MACRO: Markov Chain Routing of Transformer Layers

MACRO:Transformer层的马尔可夫链路由

Paweł Batorski, Abtin Pourhadi, Akylgali Aitaza, Przemysław Spurek, Paul Swoboda

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05050 2026-08-06 cs.CY cs.AI cs.CL 新提交 87%

The Effect of Perceived Race and Gender on Police Language Use: Experimental Evidence from VR Simulations

感知到的种族与性别对警察语言使用的影响:来自VR模拟的实验证据

Sandra C. Sandoval, Navita Goyal, Rashawn Ray, Long Doan, Rachel Rudinger, Hal Daumé

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过VR模拟实验发现,警察对黑人男性虚拟角色的说话恭敬程度更低,还探讨了LLM在ATE估计中的应用,推荐混合效应模型结合iptw方法,认为LLM相关技术需进一步完善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02678 2026-08-05 cs.CR cs.AI cs.LG 新提交 87%

DenialRAG: Single-Document RAG Poisoning via Embedded Parametric Denial

DenialRAG:通过嵌入参数化弃权的单文档RAG污染攻击

Abay Zhurekbay, Tao Liu, Fan Li

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DenialRAG单文档RAG污染攻击,通过嵌入参数化弃权引导LLM生成错误答案,经多数据集、多模型及防御评估,其在Mistral-7B上攻击效果最优,凸显RAG污染风险的复杂性。

Comments Submit to ACSAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00013 2026-08-04 cs.CL cs.AI cs.CV 新提交 87%

What Transfers from Text to Vision? Capability Scaling Laws and Transfer Dynamics for VLMs

从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态

Ziran Li, Qiang Wang, Zhengyu Chen, Shanglin Lei, Borun Chen, Jingang Wang, Xunliang Cai

机构 * Meituan(美团) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00010 2026-07-02 cs.IR cs.AI cs.CL 新提交 87%

Prompt Optimization for User Simulation in Conversational Recommender Systems: A Multi-Objective Framework

对话推荐系统中用户模拟的提示优化:一个多目标框架

Nipun B Nair, Tongtong Wu, Weiqing Wang

机构 * Monash University(莫纳什大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多目标框架自动优化LLM提示,以生成更真实、多样化的用户模拟行为,缓解对话推荐系统中的评估与数据获取难题。

Comments to be published in 2026 IEEE 42nd International Conference on Data Engineering Workshops (ICDEW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20764 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 87%

One Image is All You Need: Agentic One-Shot Image Generation via Text-Based World Models for Long-Tail Spatial Perception

一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知

Keqin Zeng, Shuting Su, Shihao Lin, Ziyue Li, Rui Zhao

机构 * Tsinghua University(清华大学) SenseTime Research(商汤科技研究院) Sun Yat-Sen University(中山大学) Technical University of Munich(慕尼黑工业大学) Heilbronn Data Science Center(海尔布隆数据科学中心) Munich Data Institute(慕尼黑数据研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31247 2026-07-01 cs.SD eess.AS 新提交 87%

FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model

FlexiSLM:一种动态可控帧率的语音语言模型

Jiaqi Li, Chaoren Wang, Xiaohai Tian, Mingjie Chen, Xinyu Liang, Xu Li, Yufan Lin, Junwen Qiu, Jun Zhang, Lu Lu, Haizhou Li, Zhizheng Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ByteDance(字节跳动)

专题命中 预训练与数据 :language model(title,abstract);SLM(abstract,abstract_cn);LLM(abstract_cn)

AI总结 提出FlexiSLM,首个支持动态可控帧率的语音语言模型,利用动态帧率表示在高质量点超越固定帧率7B模型,并在6.25 Hz时推理速度减半且保持高质量。

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26050 2026-06-25 cs.LG cond-mat.dis-nn cs.AI cs.CL 新提交 87%

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

自然去突现:不对称控制哪些规则在预训练中幸存

Juliana Li, Diya Sreedhar

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。

Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12149 2026-08-13 cs.CL 新提交 86%

Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus

混合线性注意力大语言模型中的大规模激活:注意力前峰值与峰间平台期

Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo

机构 * Startlux(星创公司) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) The University of Hong Kong(香港大学) University of Sydney(悉尼大学) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 本研究系统揭示混合线性注意力大语言模型中大规模激活的两种形态,证实其在多架构、多配置等场景下的重复性,明确其对输出门控的响应规律及机制,为相关模型优化提供依据。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10239 2026-08-12 cs.AI 新提交 86%

Beyond Detection: Evaluating Defensive LLMs Against AI-Generated Social Engineering in Live Turn-by-Turn Interaction

超越检测:评估防御型大语言模型(LLM)在实时逐轮交互中对抗AI生成社会工程攻击的能力

Yuqiao Xu, Osama Zafar, Alexander Nemecek, Erman Ayday

专题命中 预训练与数据 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究构建含300例的在线住房语料库,评估5种防御型LLM在实时逐轮与静态设置下对抗AI社会工程攻击的能力,发现防御效果差异大,需单独测量干预等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09126 2026-08-11 cs.CL 新提交 86%

Subjective Multi-Bias Detection with Large Language Models

基于大语言模型的主观多偏见检测

Ruiyu Li, Zhiying Zhu

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 本研究针对文本中的主观多偏见问题,采用大语言模型,在WIKIBIAS数据集上检测三类偏见,相关代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08650 2026-08-11 cs.CL 新提交 86%

The Evolution of Mixture-of-Experts Architectures in Large Language Models: Routing, Topology, Load Balancing, and Expert Parallelism

大语言模型中混合专家架构的演进:路由、拓扑、负载均衡与专家并行

Jiguo Li

专题命中 预训练与数据 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL

AI总结 本技术综述梳理了大语言模型混合专家架构的演进,通过五个维度和四个控制平面分析关键技术,揭示其从激活稀疏参数到解耦路由、预算与执行的趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏