Parsing as Pretraining
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments AAAI 2020 - The Thirty-Fourth AAAI Conference on Artificial Intelligence
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments AAAI 2020 - The Thirty-Fourth AAAI Conference on Artificial Intelligence
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Pretrained models and code are available at https://github.com/zihangdai/xlnet
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments 12 pages, conference
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG
Comments NAACL 2019
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG
Comments Updated to accepted EMNLP 2017 version
表格基础模型的出人意料的泛化特性研究
机构 * Polytechnique Montréal(蒙特利尔理工学院) ; Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Chandar Research Lab(钱达尔研究实验室) ; University of Toronto(多伦多大学) ; Layer 6 AI(第六层人工智能公司) ; Prior Labs(普里奥实验室) ; ELLIS Institute Tübingen(埃利斯研究所图宾根分部) ; University of Freiburg(弗赖堡大学) ; Cohere(科here公司)
专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG
AI总结 该研究揭示仅在单个真实表格上预训练的TFMs有强迁移性,提出以任务为中心、基于检索的新视角,为TFMs的模型与语料库设计提供了新框架。
Comments This work extends our previous work, Generalization Can Emerge in Tabular Foundation Models From a Single Table (arXiv:2511.09665)
PluRel-to-RDB-PFN:模式引导的合成关系预训练
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract,comments);分类 cs.LG
AI总结 该研究将合成关系数据库生成器PluRel作为RDB-PFN的外部预训练数据源,通过三种课程策略对比,发现模式优先引导策略仅用少量数据即可恢复RDB-PFN近94%的性能,证实早期接触真实模式的有效性。
Comments Proceedings of the 2nd ICML on Foundation Models for Structured Data
奇妙预训练优化器及其发现之处 II:超球优化
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG
AI总结 针对Muon等优化器在大模型预训练中增益随规模增大而减弱的问题,提出Hyperball包装器,固定权重矩阵及其更新的Frobenius范数,在1.2B参数模型上实现20-30%的token等效加速,并改善学习率迁移。
Comments Corresponding blog post: https://psychedelic-sunstone-851.notion.site/Fantastic-Pretraining-Optimizers-and-Where-to-Find-Them-2-1-Hyperball-Optimization-2e924306e6f280e7a5ffee00eb40a0dd
机构 * School of Computer Science, University of Birmingham(英国伯明翰大学计算机科学学院) ; Department of Information Systems and Computer Science, Ateneo de Manila University(马尼拉亚托大学信息系统与计算机科学系)
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments Accepted for presentation at The First Workshop on Language Models for Low-Resource Languages (LoResLM) at The 31st International Conference on Computational Linguistics (COLING 2025)
Journal ref https://aclanthology.org/2025.loreslm-1.9/
专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.AI;foundation model(comments)
Comments Accepted by ICCV Workshop 2023 (What is Next in Multimodal Foundation Models?)
SLIM-RL: 无需轨迹切分的扩散LLM风险预算随机掩码强化学习
机构 * Technical University of Denmark(丹麦技术大学) ; MBZUAI Institute of Foundation Models(穆罕默德·本·扎耶德人工智能大学基础模型研究所) ; Iowa State University(爱荷华州立大学) ; Red Hat AI Innovation(红帽人工智能创新实验室) ; MIT–IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)
专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SLIM-RL方法,通过τ预算解码器控制每步提交风险,结合无迹随机掩码目标和自适应方差缩减技术,在不重构训练轨迹的情况下匹配或超越现有轨迹感知方法,在数学和代码任务上取得显著提升。
Comments 17 pages
SpeakerCard-1M:面向野外说话人确认的基于证据的说话人卡片语料库
机构 * Brno University of Technology, Czechia(布拉格技术大学,捷克) ; Peking University, China(北京大学,中国) ; Xiaomi, China(小米,中国) ; Athens University of Economics and Business, Greece(雅典经济与商业大学,希腊) ; The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港) ; Nanjing University, China(南京大学,中国)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(abstract)
AI总结 提出SpeakerCard-1M双语说话人资源,通过声学探针和受限LLM生成结构化说话人卡片,并定义跨模态协议以支持基于证据的说话人确认。
Comments Corpus and protocols at https://junyipeng00.github.io/SpeakerCard-1M-page
立场:术语“机器遗忘”在大型语言模型中被过度使用
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。
Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally
轻量级3D特征预训练:基于2D基础模型的贝叶斯反演
机构 * U2IS, ENSTA – Institut Polytechnique de Paris, Palaiseau, France(U2IS,ENSTA – 巴黎综合理工学院,法国帕莱索) ; Pôle Recherche, Agence Ministérielle pour l’IA de Défense, Palaiseau, France(研究部,国防人工智能部级机构,法国帕莱索)
专题命中 预训练与数据 :foundation model(title);pretraining(title)
AI总结 提出Casper3D,一种轻量级概率框架,通过贝叶斯反演将多视图2D基础模型嵌入转换为潜在3D语义表示,实现开放词汇3D理解。
统一Transformer缩放定律中的学习动力学与泛化
机构 * Sun Yat-sen University(中山大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过将Transformer学习动力学形式化为ODE系统并近似为核行为,严格分析了随机梯度下降训练下的泛化误差,揭示了计算资源缩放时泛化误差的指数衰减与幂律衰减的两阶段相变,并建立了紧的上下界。
Comments 87 pages, 10 figures, 3 tables
将信号转换为语言以实现基于sEMG的活动识别
机构 * Lancaster University(兰卡斯特大学) ; Monash University(墨尔本大学) ; Cardiff University(卡迪夫大学)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出了一种基于大语言模型的sEMG活动识别框架,通过将连续sEMG信号转换为语言形式,提升活动识别的准确性。
数据混合可在知识获取中引发相变
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Shanghai Qizhi Institute(上海启智研究院) ; Simons Institute for the Theory of Computing, UC Berkeley(伯克利理论计算研究所)
专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在数据混合训练中LLM的知识获取行为,发现混合比例和模型规模会影响知识获取的相变现象,揭示了容量分配机制与信息理论框架下的预测关系。
Comments NeurIPS'25 Spotlight
BARRED: 通过不对称辩论合成定制策略的守卫规则
机构 * Plurai Inc.(Plurai公司)
专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);prompting(abstract)
AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。
SkillX: 为智能体自动构建技能知识库
机构 * Zhejiang University(浙江大学) ; Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 SkillX通过多级技能设计、迭代技能精炼和探索性技能扩展,构建可复用的技能知识库,提升智能体在长周期任务中的表现和泛化能力。
Comments Work in progress
跨越编程语言壁垒:关于跨语言检索增强型代码生成的研讨
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文研究了跨语言检索增强型代码生成中的知识转移,通过构建13种编程语言的14000个实例数据集,发现跨语言知识转移非 trivial,且依赖语言亲和力和预训练语料多样性。
Comments ACL 2026 Findings
矩阵:基于点对点的多智能体合成数据生成框架
机构 * FAIR at Meta(Meta 的 FAIR)
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Matrix框架,通过去中心化设计实现多智能体协同生成高质量、多样化的合成数据,提升数据生成效率2-15倍,适用于多智能体对话、网络推理数据提取等场景。
Comments MLSys 2026
从P(y|x)到P(y):在预训练空间中研究强化学习
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; National University of Singapore(新加坡国立大学) ; Tencent AI Lab(腾讯AI实验室)
专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。
Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR
多代理系统在软件工程中的公平性:面向软件开发生命周期的快速综述
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 本文综述了多代理系统在软件工程中的公平性研究,分析了LLM赋能环境下的公平性框架,指出当前研究在评估实践、泛化能力及缓解机制方面存在三大不足。
Comments 8 pages, 4 figures. Accepted to the LLMTrust workshop at FSE Companion 2026
代理批判训练
机构 * University of Maryland College Park(马里兰大学学院公园分校)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。
Comments Project page: https://attention-is-all-i-need.github.io/ACT/
SOSecure: 借助检索增强生成与StackOverflow讨论实现更安全的代码生成
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 SOSecure通过检索增强生成与StackOverflow讨论提升代码安全性,实现71.7%-96.7%的修复率,优于其他基线方法。
优于分类器:利用大语言模型和合成数据进行低资源多语言分类
机构 * Kempelen Institute of Intelligent Technologies(克姆佩尔智能技术研究所) ; Faculty of Information Technology, Brno University of Technology(信息科技学院)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 本研究利用大语言模型生成合成数据,训练更小的多语言模型,发现生成器在低资源语言中表现更优。
Comments Accepted to the Findings of EACL 2026
机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) ; University of Seoul, South Korea(首尔大学)
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments 5 pages. Submitted to IEEE ICASSP 2026
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)
Comments Accepted to COLM 2025. Camera-ready version
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)
机构 * Stanford University(斯坦福大学)
专题命中 预训练与数据 :LLM(abstract);language model(abstract);post-training(abstract);SFT(abstract)
Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total