Gamma Mixture Modeling for Cosine Similarity in Small Language Models
专题命中 预训练与数据 :language model(title);small language model(title);分类 cs.LG
Comments 16 pages, 8 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title);small language model(title);分类 cs.LG
Comments 16 pages, 8 figures
机构 * Sorbonne University(索邦大学) ; Apple(苹果公司)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
机构 * University of Twente(特文特大学) ; Marburg University(马尔堡大学)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL
Comments Accepted at ICNLSP 2025
机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; University of Tennessee, Knoxville, USA(田纳西大学,基洛纳分校)
专题命中 预训练与数据 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI
Comments Accepted in the Second International Workshop on Large Language Models for Code (LLM4Code 2025)
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL
Comments Accepted to ACL 2025 main
机构 * University at Buffalo(布法罗大学)
专题命中 预训练与数据 :foundation model(title);pretraining(title);分类 cs.CL
Comments in submission
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI
Comments ASME 2025 International Design Engineering Technical Conferences and Computers and Information in Engineering Conference IDETC/CIE2025, August 17-20, 2025, Anaheim, CA (IDETC2025-168615)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL
Comments arXiv admin note: substantial text overlap with arXiv:2312.04642
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL
Comments 19 pages, 8 figures, C3NLP 2024
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL
Comments Accepted by ACL 2024
专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)
Comments Accepted by ACL 2024, Main Conference
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 20 pages, 15 Figures, 13 figures
专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL
Comments arXiv admin note: text overlap with arXiv:2305.02105 by other authors
专题命中 预训练与数据 :language model(title);pretraining(title);分类 cs.AI
专题命中 预训练与数据 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)
Comments Project page: https://janghyuncho.github.io/Cube-LLM
异构语言模型间的双缓存隐空间通信
机构 * Amazon(亚马逊)
专题命中 预训练与数据 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出XKV协议,解决异构语言模型隐空间通信的三个限制,仅训练转换器,在45个数据集-模型对设置中,其性能、速度均优于现有方法,参数效率更高。
用于鲁棒代码表示的不变预训练
机构 * University of California at Davis(加州大学戴维斯分校) ; The University of Hong Kong(香港大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文针对代码表示模型在不变程序下鲁棒性退化问题,提出仅基于代码的不变预训练(InvPT)方法,在克隆检测、代码分类任务上分别提升鲁棒性最高11、19个百分点,同时保持或提升标准准确率。
Comments To appear in LMPL 2026
用于高效在线强化学习微调的无评判者预训练
机构 * Tsinghua University(清华大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。
DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。
LF²AR:考虑分层动态以改进语言模型的多模态适配
机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) ; Department of Engineering, University of Cambridge, UK(剑桥大学工程系) ; Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) ; LIA, Avignon Université, France(法国阿维尼翁大学LIA) ; LIUM, Le Mans Université, France(法国勒芒大学LIUM) ; Zenidoc, Marseille, France(法国马赛Zenidoc)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。
Comments Published as a conference paper at COLM 2026
自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?
机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) ; Umeå University(于默奥大学) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。
Comments 21 pages, 7 figures,4 tables
MultiPathFormer:迈向多径无线传播的基础模型
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出MultiPathFormer,以多径传播为预训练对象,结合Environmental RAG机制,在27种环境预训练后,在多项无线通信下游任务中超越SOTA模型,验证了路径级预训练的有效性。
无递归预训练循环网络
机构 * MIT(麻省理工学院)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出监督记忆训练(SMT)方法,通过将循环神经网络训练转化为一步记忆转换标签上的监督学习,实现时间并行训练和稳定梯度路径,优于反向传播通过时间(BPTT)方法。
Comments 30 pages, 23 figures
作为编码智能体基础模型中间训练的函数感知中间填充
机构 * University of Waterloo(滑铁卢大学) ; University of British Columbia(英属哥伦比亚大学) ; NVIDIA(英伟达公司) ; Verdent AI(Verdent人工智能公司) ; Vector Institute(向量研究所)
专题命中 预训练与数据 :foundation model(title);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI
AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。
预训练数据可通过计算宣传被下毒
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(艾伦人工智能研究所)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究发现预训练数据可通过公共讨论界面被下毒,引入HalfLife方法衡量恶意内容,探索在网络规模下毒预训练语料库的可行性,证明估计毒注入重要性,确立第三方网页内容为攻击语言模型预训练的可能载体。
PluRel: 合成数据解锁关系基础模型的扩展定律
机构 * Stanford University(斯坦福大学) ; SAP Labs LLC(SAP实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。
Comments ICML 2026
CDFM:迈向通用因果发现基础模型
机构 * School of Computer Science, Guangdong University of Technology, Guangzhou, China(广东技术大学计算机科学学院) ; College of Mathematics and Computer, Shantou University, Shantou, China(汕头大学数学与计算机学院) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 研究针对因果发现中特定数据集方法的局限,提出通用框架CDFM,通过研究因果可识别性理论边界构建变分框架,将未知因果机制视为潜在变量,经大量合成模型预训练,性能优于传统算法,推动因果发现范式转变。
语言模型需要睡眠:学习自我修改和巩固记忆
机构 * Google(谷歌) ; Cornell University(康奈尔大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 受人类学习过程启发,提出“睡眠”范式,通过记忆巩固(知识播种)和梦境(自我改进)两阶段,使模型持续学习、将短期记忆转化为长期知识并自我提升。
Comments A version of this work has been publicly available from September 2025 on OpenReview