Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG
Comments 28 pages, 15 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG
Comments 28 pages, 15 figures
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.AI、cs.LG
机构 * Department of Computer Science & Technology University of Cambridge(计算机科学与技术系剑桥大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
Comments MPhil in Advanced Computer Science thesis for University of Cambridge
机构 * Apple(苹果公司) ; University of Washington(华盛顿大学) ; Stanford(斯坦福大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG
Comments 44 pages, 25 figures, 13 tables
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.AI
Comments ICLR 2025, Oral
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI
Comments Bias detection, Large Language Models, nuanced biases, fine-grained mechanisms, model transparency, ethical AI
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
Comments Technical Report
专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
Comments Website: https://world-model.maitrix.org/
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
Comments Paper in submission (8 pages)
专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI
Comments Technical Report
专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI
Comments To appear in Proceedings of the Workshop on Linked Data-driven Resilience Research 2024 (D2R2) co-located with Extended Semantic Web Conference 2024 (ESWC 2024)
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
Comments EACL 2024
专题命中 预训练与数据 :prompting(title,abstract);language model(title);分类 cs.AI、cs.LG
Comments Accepted at CVPR 2023
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI
Comments 155 pages, 26 tables, 11 figures
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
Comments 12 pages, 2 figures, 7 tables, EMNLP 2022
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG
Comments Camera ready version. Accepted to WNUT 2021. Code for reproducing the experiments can be found at: https://github.com/twitter-research/multilingual-alignment-tpp
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG
Comments This work was presented at the first Health Search and Data Mining Workshop (HSDM 2020) as part of WSDM 2020 conference
CyrillicQA:语音编码的秘密语言对大语言模型性能的影响
机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)
专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究探讨大语言模型在处理拉丁字母标准语言时表现优异但对其他语言变体存在劣势的背景下,能否像人类一样解码语音编码的濒危语言,以评估其保护濒危语言的能力。
Comments 4 pages, in English; 4 pages, in German (original); German version originally published in: Rüdian, S. (2026). Prompt-Engineering in Education (1st ed., pp. 39-42). Humboldt-Universität zu Berlin. https://doi.org/10.5281/zenodo.21413892
将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法
机构 * Renmin University of China(中国人民大学)
专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。
通过语义相似性视角探讨大语言模型的生成新颖性
机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)
专题命中 预训练与数据 :LLM(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过语义相似性视角探讨大语言模型生成新颖性的评估方法,揭示模型在预训练数据中的长序列抽取能力及任务领域对生成新颖性的影响
如何合成高质量的预训练数据?提示设计、生成模型和源数据的系统研究
机构 * Hugging Face ; University of Sheffield(谢菲尔德大学) ; National Institute of Informatics(日本信息处理研究所)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过大规模实验探讨提示设计、生成模型和源数据对合成预训练数据质量的影响,发现结构化输出格式优于现有方法,且生成模型参数超过1B无额外收益,提出开源数据集FinePhrase。
Comments Accepted to COLM 2026
自主渗透测试代理研究中的伦理声明
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。
Comments Accepted at AutonomousCyber 2026
PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练
机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) ; National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。
自然去突现:不对称控制哪些规则在预训练中幸存
机构 * Harvard University(哈佛大学)
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。
Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking
权重衰减提升语言模型可塑性
机构 * Broad Institute, Schmidt Center(Broad研究所,Schmidt中心) ; University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) ; Harvard University(哈佛大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过系统实验表明,预训练中较大的权重衰减能提高模型的可塑性,使微调后下游性能更优,并揭示了其促进线性可分表示、正则化注意力矩阵和减少过拟合的机制。
Chronicle:一种用于联合语言和时间序列理解的多模态基础模型
机构 * InertialAI ; Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系) ; Department of Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程系)
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Chronicle,一种联合训练语言和时间序列的多模态基础模型,通过统一架构实现两者共享参数,从而在多个任务上取得了优异表现。
从有机数据生成预训练令牌以实现数据驱动的扩展
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出SynPro框架,通过重新表述和重新格式化操作,帮助大语言模型更充分地利用有限的有机数据,从而在数据驱动的预训练中实现更高效的扩展。
通过数据增强和大语言模型错误校正提升口腔癌患者语音识别性能
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 本文通过数据增强和大语言模型错误校正技术,有效提升了口腔癌患者语音识别的性能,实验结果显示在Whisper和MMS模型上分别实现了40%和50%的词错误率降低。
Comments 7 pages, 3 tables. Accepted by EMBC 2026