Pretraining Curricula Enable Selective Fine-tuning
预训练课程实现选择性微调
机构 * University of Oxford(牛津大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
预训练课程实现选择性微调
机构 * University of Oxford(牛津大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究预训练课程如何影响学习、泛化和微调选择性,对比平衡与不平衡预训练方式,发现不平衡预训练促进上下文学习并提高拒绝微调选择性,还扩展到合成语言学习任务。
CRISP:一种通过基于预测的世界模型预训练实现驾驶的时空相机-雷达主干网络
机构 * Department of Robotics, University of Michigan(密歇根大学机器人系)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过基于预测的表示学习预训练时空相机-雷达主干网络CRISP,利用历史多视图图像和雷达扫描,通过预测未来激光雷达点云学习统一鸟瞰图表示,介绍相关组件,实验表明其能提升点云预测并有效迁移至下游任务。
Comments 17 pages, under review
注意力只是耦合的另一个名字?:关于层级预训练的快速-慢速ODE视角
机构 * Independent scholar(独立学者)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种快慢ODE视角,将因果自注意力视为耦合机制,并引入一个通过零初始化门控反馈到快路径的慢子系统,在理论证明和实验验证中揭示了其与主方程平稳分布的联系。
Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练
机构 * Duke University(杜克大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。
Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA
TokSuite:衡量分词器选择对语言模型行为的影响
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Google DeepMind(谷歌DeepMind) ; McGill University(麦吉尔大学) ; University of Cambridge(剑桥大学) ; Hugging Face
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出TokSuite,含模型集合与基准测试,通过不同分词器的预训练模型及多语言鲁棒性基准测试,解耦分词器影响,阐明多种流行分词器优缺点。
Comments ICML 2026. 46 pages, 13 figures
Mantis: 用于时间序列分类的轻量级基础模型
机构 * com(42.com) ; Helmholtz Munich(亥姆霍兹慕尼黑中心) ; Technical University of Munich(慕尼黑工业大学) ; Criteo ; Meta ; Telecom Paris(巴黎电信学院)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出基于Transformer的轻量级基础模型Mantis,通过自监督对比学习在合成数据上预训练,并引入新颖的令牌生成单元和增强测试方法,在多个数据集上超越现有基础模型。
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026
DyGnROLE:动态图上边分类的非对称预训练
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出DyGnROLE,通过非对称预训练学习动态图中源节点与目标节点的异构表示,解决边分类中源目标节点行为不对称性问题,实验表明其在有限标注数据下表现优异。
强化学习基础模型本应已经存在
机构 * École normale supérieure de Paris, PSL University, Paris, France(巴黎高等师范学院,PSL大学,法国巴黎) ; Soda team, Inria Saclay, Palaiseau, France(Soda团队,法国国家信息与自动化研究所萨克雷中心,法国帕莱索)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出通过合成MDP构建强化学习基础模型,利用固定大小的充分统计量使注意力架构适用,在线和离线实验均优于传统算法。
SleepMaMi:一种融合宏观与微观结构的通用睡眠基础模型
机构 * Graduate School of Data Science, Seoul National University, Seoul, South Korea(首尔国立大学数据科学研究生院,韩国首尔) ; Department of Biomedical Sciences, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院生物医学科学系,韩国首尔) ; Obstructive Upper Airway Research (OUaR) Laboratory, Department of Pharmacology, Seoul National University College of Medicine, Seoul, Republic of Korea(首尔国立大学医学院药理学系阻塞性上气道研究(OUaR)实验室,韩国首尔) ; Department of Otorhinolaryngology-Head and Neck Surgery, Seoul National University Hospital, Seoul, Republic of Korea(首尔国立大学医院耳鼻喉头颈外科系,韩国首尔)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出SleepMaMi睡眠基础模型,通过分层双编码器设计(宏观编码器建模整夜时间依赖,微观编码器捕捉生物信号短时特征),结合人口统计引导对比学习和混合掩码自编码器训练,在超过2万条PSG记录上预训练,在下游任务中优于或匹配现有基础模型。
Comments 8 pages, Appendix 9 pages
Sumi: 从头训练的开放均匀扩散语言模型
机构 * Tohoku University(东北大学)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出Sumi,一个从零开始预训练的70亿参数均匀扩散语言模型,在1.5T tokens上训练,性能与同规模自回归模型相当,并开源所有资源。
熵、分歧与基因组基础模型的局限性
机构 * Genome Institute of Singapore, A*STAR(新加坡基因组研究院,A*STAR) ; KU Leuven(卢森堡大学) ; Faculty of Electrical Engineering and Computing, University of Zagreb(扎格雷布大学电子工程与计算学院)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文通过分析熵对模型学习的影响,发现基因组序列的高熵导致输出分布接近均匀、模型间分歧大和静态嵌入不稳定,且Fisher信息集中在嵌入层,表明仅靠序列自监督训练可能不适用于基因组数据。
Comments Accepted to LMLR Workshop at ICLR 2026
DSL-Topic:通过从语言模型中蒸馏软标签改进主题建模
机构 * University of Washington(华盛顿大学)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 提出DSL框架,通过从语言模型蒸馏软标签来增强主题模型训练,利用上下文感知的软标签重构信号,显著提升主题连贯性和分配准确性。
Comments 22 pages, 5 figures. Camera-ready version for ICML 2026
UNIVID:用于视频审核的统一视觉语言模型
机构 * Bytedance(字节跳动)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。
Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track
预算受限的微预训练中的分阶段因子筛选
机构 * Hewlett Packard Enterprise(惠普企业)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG
AI总结 针对预算受限的微预训练,提出分阶段分数因子设计方法,通过短时筛选识别高惩罚方向并确认有效锚点,在共享加速器上实现高效配方筛选。
Comments 23 pages, 4 figures
基础模型研究的有效性威胁
机构 * University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; University of Vienna(维也纳大学)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出一个因果推断评估框架,将基础模型研究中的不同近似实验策略(代理实验、观察性研究、单次运行设计)映射为四种有效性(统计、内部、外部、构念)的权衡,揭示并分析计算节省带来的隐蔽有效性威胁。
q0: 超周期预训练的原语
机构 * Q Labs(Q实验室) ; Princeton University(普林斯顿大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 针对多周期训练中单模型性能饱和的问题,提出超周期预训练(q0)方法,通过循环调度、链式蒸馏和学习先验三个原语,从多周期预算中生成多样化模型群体并聚合其预测,显著提升数据效率。
Comments 22 pages, 5 figures
学习邻域:无对比的多模态自监督分子图预训练
机构 * University of Tübingen(图宾根大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 提出C-FREE框架,通过预测子图嵌入与互补邻域的关系,融合2D拓扑和3D构象信息,实现无对比、无负样本的多模态自监督分子图预训练,在MoleculeNet上取得最优结果。
Comments Accepted at ICML 2026
物理基础模型从模拟到实验室湍流的涌现迁移
机构 * University of Cambridge(剑桥大学) ; CEA, DAM/DIF(法国CEA DAM/DIF) ; Flatiron Institute(Flatiron研究所) ; New York University(纽约大学) ; Princeton University(普林斯顿大学) ; Yale University(耶鲁大学) ; AIM, Université Paris-Saclay, Université Paris Cité, CEA, CNRS(AIM,巴黎-萨克雷大学,巴黎城市大学,CEA,CNRS) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Polymathic AI(聚合人工智能)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 通过微调连续介质动力学基础模型Walrus,在仅使用少量模拟数据的情况下,零样本泛化到实验室瑞利-泰勒不稳定性实验,揭示了初始条件在模拟-实验差距中的关键作用。
InfoAtlas:用于零样本统计依赖性估计的基础模型
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出InfoAtlas,一种基础模型架构,通过单次前向传播直接推断互信息,实现零样本估计,在保持精度的同时获得100倍加速。
Comments Accepted to ICML 2026
面向零样本时间序列异常检测的基础模型:利用合成数据和相对上下文差异
机构 * Department of Industrial Engineering, Tsinghua University, Beijing, China(清华大学工业工程系) ; Datadog AI Research, Paris, France. This work was completed prior to joining Datadog(Datadog AI 研究院) ; Lab, Huawei Technologies, ShenZhen, China(华为技术2012实验室)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出基于相对上下文差异(RCD)的预训练范式,通过合成数据训练Transformer模型比较查询模式与上下文,实现零样本时间序列异常检测,在多个基准上超越现有基础模型。
Comments This manuscript is withdrawn, as the authors intend to further extend and develop the work beyond its current scope
在语言模型发言前引导它们:Logit 级别的干预
机构 * Department of Computer Science, Yonsei University, Seoul, South Korea(延世大学计算机科学系,首尔,韩国)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 提出 SWAI 方法,通过基于语料库的 token 统计在 logit 空间直接引导语言模型,无需训练或访问内部激活,在可读性、礼貌性和毒性控制上优于提示和基线方法。
Comments preprint
语言模型中跨语言泛化的体外研究
机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA)(达勒莫利人工智能研究所(IDSIA))
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 通过构建两种程序生成的语言,独立控制词汇距离、少数语言比例等变量,研究语言模型跨语言迁移的机制,发现迁移主要取决于分词是否保留可复用的跨语言子结构,且词汇量越小越有利于掩码迁移。
Comments 16 Figures, 1 Table
在学习者语料库上继续预训练是否能提高英语水平测试的自动作文评分?来自EFCAMDAT的证据
机构 * University of Greenwich(格林威治大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG
AI总结 研究通过在EFCAMDAT学习者语料库上进行领域自适应继续预训练(DAPT),探究其对基于Transformer的自动作文评分(AES)在英语水平测试中的影响,发现全语料库DAPT效果不一,而基于CEFR分级的针对性DAPT能更可靠地提升领域内评分性能。
Comments 16 pages, 3 figures, 10 tables, including references and appendices
朝向语言模型的匿名化
机构 * INSA Lyon, Inria, CITI, UR3720(里昂国家理工学院、法国国家科学研究中心、CITI、UR3720) ; Inria, INSA Lyon, CITI, UR3720(法国国家科学研究中心、里昂国家理工学院、CITI、UR3720)
专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出了一种隐私保护的语言模型方法,通过掩码语言模型(MLM)和因果语言模型(CLM)方法,旨在解决语言模型的匿名化问题,从而促进其共享。研究通过医疗数据集评估了这两种方法,并表明在避免记忆直接和间接标识信息的同时,能够保持高隐私性和高实用性。
NeuroRVQ:多尺度生物信号分词用于生成式基础模型
机构 * Imperial College London(帝国理工学院伦敦分校) ; Cogitat ; National and Kapodistrian University of Athens(国家与资本主义大学雅典分校) ; Archimedes Research Unit(阿基米德研究单位) ; Aristotle University of Thessaloniki(亚里士多德大学塞萨洛尼基分校) ; Northeastern University London(东北大学伦敦分校)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出NeuroRVQ,一种多尺度生物信号分词方法,通过多尺度时序卷积分解生物信号并结合相位感知损失,实现高保真信号重建,验证了高质量分词对下游性能的重要性。
大语言模型代理系统中技能的扩展规律
机构 * Evolvent AI Team(Evolvent AI团队)
专题命中 预训练与数据 :LLM(title,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究揭示了大规模代理系统中技能扩展的双重规律:路由准确性随库大小对数衰减,执行准确性通过联合路由乘法提升下游任务表现,二者通过路由衰减斜率参数耦合,优化后显著提升性能。
Comments Technical Report
基于组合层次图的多级自监督预训练用于分子性质预测
机构 * School of Mathematical Sciences(数学科学学院) ; University of Electronic Science and Technology of China(电子科技大学) ; Department of Computer Science and Engineering(计算机科学与工程系) ; Oakland University(奥克兰大学)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出MolCHG框架,通过多级自监督预训练提升分子性质预测性能,采用组合层次图组织分子结构,引入bond graph增强bond信息,实现原子与bond语义的平等聚合。
Comments 11pages, 4 figures
ExplainerPFN:迈向无模型零样本特征重要性估计的表格基础模型
机构 * INESC-ID ; New York University(纽约大学)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出ExplainerPFN,一种基于TabPFN的表格基础模型,通过预训练合成结构因果数据实现无模型零样本特征重要性估计,展示了其在真实和合成数据集上的竞争力。
Comments 35 pages, 11 figures
密集与稀疏预训练在微小规模下的比较:主动参数与总参数匹配
机构 * Independent Researcher(独立研究者)
专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG
AI总结 本文研究了在微小预训练规模下密集和混合专家(MoE)Transformer的表现,通过比较主动参数与总参数匹配策略,发现MoE在主动参数匹配下验证损失更优,但总参数匹配下密集模型仍更优。
Comments 10 pages, 6 figures, 8 tables
Zatom-1:迈向3D分子和材料的多模态基础模型
机构 * LBNL(劳伦斯伯克利国家实验室) ; ICSI(国际计算机科学研究所) ; University of Cambridge(剑桥大学) ; Yale University(耶鲁大学) ; MIT(麻省理工学院) ; UC Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 Zatom-1是一种跨领域、通用的模型架构,统一了3D分子和材料的生成与预测学习,通过多模态流匹配目标实现高效的预训练和稳定采样,提升了生成推理速度和跨领域预测性能。
Comments 38 pages, 10 figures, 15 tables. ICLR 2026 FM4Science. Code, data, and model weights are available at https://github.com/Zatom-AI/zatom