Thoughtful Things: Building Human-Centric Smart Devices with Small Language Models
专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.AI
Comments 24 pages (3 pages of references)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.AI
Comments 24 pages (3 pages of references)
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL
Comments HICSS '24
Journal ref Proceedings of the 57th Hawaii International Conference on System Sciences 2024
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.LG
Comments 20 pages, 3 figures
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.LG
Comments Under review
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL
Comments Published on First Monday https://firstmonday.org/ojs/index.php/fm/article/view/13346/11365
Journal ref First Monday, Volume 28, Number 11 - 6 November 2023
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL
Comments Added information about training tokenizer
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL
Comments Paper accepted for publication at ACL 2023 Main; 10 pages, 7 appendix pages, 4 figures, 13 tables
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL
Comments EMNLP 2022
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL
Comments Findings of North American Chapter of the Association for Computational Linguistics, NAACL 2022 (camera-ready)
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL
Comments This paper has been accepted by EMNLP'21 main conference
探究提示词与响应语言对大语言模型内容生成的影响
机构 * Université de Technologie de Compiègne(贡比涅技术大学) ; Norwegian University of Science and Technology (NTNU)(挪威科技大学) ; SimulaMet(西穆拉梅特研究院) ; HUTECH University(胡志明市技术大学)
专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究以5个大语言模型为对象,在4种语言条件下评估68个非翻译问题的响应,发现提示词语言会显著影响响应长度,且对多语言提示词设计具有启示意义。
MoganBert-TR:采用CLM到MLM课程从头训练的土耳其编码器基础模型
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 本文提出从头训练的土耳其编码器基础模型MoganBert-TR,采用CLM到MLM两阶段课程学习,在TrGLUE等任务上优于同类模型,其衍生嵌入模型MoganBert-Embed在MTEB(土耳其)学生模型中排名第一
Comments 32 pages, 4 figures, 18 tables. Model weights, tokenizer, embedding model and evaluation code: https://huggingface.co/moganai
任意时间预训练:无时间范围的学习率调度与权重平均
机构 * Harvard University(哈佛大学) ; Kempner Institute at Harvard University(哈佛大学凯默纳研究所)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出了一种无需时间范围的学习率调度方法,通过权重平均实现与余弦调度相当的预训练效果。
DFM Mimir v1:仅使用许可的后训练数据,在10亿参数规模下实现前沿性能的开放HRM模型
专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究人员因大模型开发依赖非许可数据受阻,本文提出仅用许可后训练数据训练的10亿参数HRM模型Mimir v1,其在多基准测试中性能优于同规模HRM-Text 1B,可与更大前沿模型媲美,且在丹麦语任务达新SOTA,已发布于Hugging Face Hub
Comments Technical Report, 20 Pages, 1 Model, Hierarchical Reasoning Model, v2: added memorization audits
开放语言模型:用于教育和研究的可读且可组合的小语言模型预训练
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG
AI总结 OpenLanguageModel是开源PyTorch库,用于构建和预训练小语言模型。其模型代码易读,能连接多种组件。通过追踪GPT - 2展示完整路径,含27个预设和文档。验证有高一致性和效率等成果,采用MIT许可,可多途径获取。
Comments 8 pages, 3 figures, and 1 table. Website: https://openlanguagemodel.github.io/openlanguagemodel/. Code: https://github.com/openlanguagemodel/openlanguagemodel
从开放式语言模型中提取记忆中的(受版权保护)书籍
机构 * Stanford University(斯坦福大学) ; Yale University(耶鲁大学) ; Cornell University(康奈尔大学) ; West Virginia University(西弗吉尼亚大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.LG
AI总结 研究通过测量书籍在语言模型中的记忆程度,发现大多数模型不完整记忆书籍,但部分模型如Llama 3.1 70B能完整记忆某些书籍,对版权案件有重要影响。
Comments COLM 2026
言语化采样:如何减轻模式坍塌并释放大语言模型的多样性
专题命中 预训练与数据 :LLM(title,abstract);post-training(abstract);prompting(abstract);分类 cs.CL、cs.AI
AI总结 研究发现偏好数据中的典型性偏差致大语言模型模式坍塌,引入言语化采样策略。该策略能促使模型说出响应概率分布,经实验验证可显著提升创意写作等多方面性能,为模式坍塌提供新视角及实用补救方法。
Comments 83 pages, 31 figures, 44 tables. Code is available at https://github.com/CHATS-lab/verbalize-sampling
小编辑,大模型:维基百科倡导如何塑造LLM价值观
机构 * Compassion Aligned Machine Learning (CaML)(慈悲对齐机器学习实验室) ; Independent researcher(独立研究者) ; Pro-Animal Wikipedians (PAW)(亲动物维基人组织)
专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI
AI总结 通过梯度归因和反事实影响估计,发现维基百科上一个小型倡导组织的编辑活动显著影响了语言模型在动物福利话题上的行为。
在任意文本条件下学习:一种超网络驱动的元门控大语言模型
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.LG
AI总结 提出一种超网络驱动的元门控机制,通过动态调整SwiGLU块中的β参数,使LLM适应不同文本条件,优于微调和元学习基线。
Comments Accepted by ICML2026
基于来源的门控与自适应恢复在合成后训练数据筛选中的应用
机构 * Lexsi Labs
专题命中 预训练与数据 :post-training(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究合成后训练数据筛选中的来源证据门控与样本自适应恢复,提出结合故障诊断与定向再生成的自适应恢复流水线,提高产量、恢复率和注入召回率。
寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Tokyo(东京大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI
AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。
Comments Accepted to ICML 2026
大脑-大语言模型对齐追踪训练数据,而非语言类型学
机构 * The University of Hong Kong(香港大学) ; Stellaris AI Limited(Stellaris AI有限公司)
专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 通过分析英语、中文和法语的fMRI数据及多种大语言模型,发现训练语言主导性而非英语本身驱动大脑-模型对齐模式,且类型学距离独立影响对齐退化。
Comments Accepted to CoNLL 2026. 9 pages main content + 4 pages references + 6 pages appendix; 4 figures, 13 tables
夸大态度,忽视网络:LLM在模拟虚假信息易感性中的偏见
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨LLM在模拟虚假信息易感性中的偏见,发现其夸大信念与分享的关联,忽视网络特征,建议LLM模拟更适用于诊断而非替代人类判断。
Comments Accepted to ICWSM 2026
Webscale-RL: 用于将强化学习数据扩展到预训练水平的自动化数据管道
机构 * Salesforce AI Research(赛富时人工智能研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Webscale-RL数据管道,通过系统性地将大规模预训练文档转换为数百万个多样化的可验证问题-答案对,解决RL数据瓶颈问题,并展示基于该数据集的模型在多个基准测试中表现优于传统预训练方法。
语言预训练引入的偏差:一种强大的基础视觉任务通用性基础
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 预训练与数据 :pretraining(title);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出随机标签桥梁训练方法,通过模态适应学习有效对齐大语言模型参数与视觉任务,揭示部分桥梁训练在视觉任务中的优势。
Comments Main manuscript: 13 pages, 9 figures. Appendix: 8 pages, 5 figures. Accepted in Transactions on Machine Learning Research (TMLR) 2026
大语言模型预训练和后训练数据中的政治内容是什么?
机构 * Bocconi University(博科尼大学) ; University of Manchester(曼彻斯特大学) ; Princeton University(普林斯顿大学)
专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。
Comments 10 pages, under review
基于大语言模型的引导性标题重写以增强点击率而不产生标题党
机构 * Intelligent Systems, Afeka Academic College of Engineering(阿菲卡工程学院智能系统系) ; School of Computer Science, Faculty of Sciences, HIT-Holon Institute of Technology(霍隆理工学院理学院计算机科学系)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种引导性标题重写框架,通过控制生成过程中的语言属性,在保持语义忠实的前提下提升标题吸引力,避免产生误导性内容。
Comments 14 pages, 4 figures
多语言大语言模型水印是否真的多语言?通过回译扩大到100多种语言的鲁棒性
机构 * African Institute for Mathematical Sciences Parameter Lab(非洲数学科学研究所参数实验室)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文指出现有多语言水印方法在中低资源语言中鲁棒性不足,提出STEAM方法通过回译恢复水印强度,提升跨语言水印鲁棒性。