CodecLM: Aligning Language Models with Tailored Synthetic Data
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)
Comments Accepted to Findings of NAACL 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)
Comments Accepted to Findings of NAACL 2024
专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
基于多补丁令牌对齐与混合掩码的时间序列基础模型尺度感知预训练
机构 * School of Software, Shandong University(山东大学软件学院) ; Joint SDU–NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(山东大学-南洋理工大学人工智能联合研究中心(C-FAIR)) ; Nanyang Technological University(南洋理工大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG
AI总结 本文针对时间序列基础模型预训练中处理不同采样频率的问题,提出SATS方法,通过尺度感知令牌对齐与混合掩码策略实现最优性能,同时提升模型效率。
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
Journal ref 2024 IEEE Spoken Language Technology Workshop (SLT), Macao, 2024, pp. 871-878
测量语言模型预训练中与任务无关的训练数据影响
机构 * Nara Institute of Science and Technology(奈良科学技术研究所) ; Waseda University(早稻田大学) ; The University of Tokyo(东京大学) ; IT University of Copenhagen(哥本哈根信息技术大学) ; Tohoku University(东北大学)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
AI总结 本文提出无需依赖下游任务或验证集的训练数据影响度量方法,经实验发现预训练中有影响力的数据存在时间变化,早期文献相关数据、后期STEM数据与最终参数轨迹的一致性更强。
Comments Accepted to COLM 2026
CASA:结合语音编码器与大语言模型的内容-语音口语评估
机构 * Aalto University(阿尔托大学) ; University of Helsinki(赫尔辛基大学) ; Walton Institute(沃尔顿研究所)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。
Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa
PROVE-RT:使用大语言模型为实时系统生成机械化定理证明器脚本
机构 * Florida International University(佛罗里达国际大学) ; University of South Florida(南佛罗里达大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 PROVE-RT是一种LLM辅助框架,通过依赖感知草图、PROSA文档检索等步骤生成PROSA/ROCQ脚本,在1191篇实时系统论文构建的语料库上,其机械化可调度性分析的成功率达44.7%,优于直接提示的LLM。
可解码但不可分离:训练数据粒度决定大语言模型的参数模块化
机构 * University of Houston(休斯顿大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究探讨大语言模型是否存在特定领域参数壳,通过多模型、多领域实验发现训练数据的标记级模块化是参数壳形成的关键,为大语言模型的参数模块化研究提供了核心结论。
减少扩散语言模型中的预训练-生成不匹配
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。
Comments 12 pages, 9 figures, 1 table
面向多模态大语言模型自我改进的故障感知图像自增强
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。
VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs
机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) ; Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) ; McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。
Comments 16 pages, 5 figures
OntoBook:用于医学编码器预训练的基于本体的合成教科书
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract,journal_ref);language model(abstract,journal_ref);LLM(abstract)
AI总结 研究提出OntoBook方法,将医学本体结构转为预训练信号,经随机游走、大语言模型重述等三阶段,用生成文本训练法语编码器,在多基准测试中有显著改进,强调目标对齐必要,还发布了相关教科书与模型检查点。
Journal ref Proceedings of Knowledge Graphs and Large Language Models Workshop, May 2026, Palma de Mallorca, Spain
大语言模型中的卷积
机构 * Peking University(北京大学) ; Huawei Technologies(华为技术有限公司) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 研究大语言模型中,轻量级深度卷积能否在不大幅增模型大小的情况下提供局部归纳偏差。通过实验发现特定位置应用卷积效果最佳,采用特定残差深度卷积设计,在多个模型和数据预算下提升了下游基准平均准确率,支持其作为自注意力补充建模短程交互。
Comments 12 pages, 5 figures
基于病理切片基础模型的多教师蒸馏预训练多实例学习网络
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; University of Washington(华盛顿大学) ; City University of Hong Kong (Dongguan)(香港城市大学(东莞)) ; Medical Optical Technology R&D Center, Research Institute of Tsinghua(清华研究院医学光学技术研发中心) ; Jinfeng Laboratory(金凤实验室)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI
AI总结 针对计算病理学中多实例学习存在的问题,提出基于蒸馏的预训练框架,利用两个基础模型作为教师,引入角分散归一化蒸馏损失,将蒸馏权重用于下游适应,实验表明该方法在少样本场景中优势明显,能提升计算效率。
评估大型语言模型在罗马尼亚文本中的重音恢复性能:一项比较研究
机构 * Babeș-Bolyai University(巴贝什-波雅伊大学)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本研究评估了多种大型语言模型在罗马尼亚文本重音恢复任务中的性能,发现GPT-4o表现优异,揭示了模型架构和提示设计对重音恢复的影响。
Comments The original submission contained metadata errors and requires correction. A revised and complete version will be submitted as a replacement
Journal ref Innovative Perspectives on Computational Intelligence and Data Science (InnoComp 2025), Communications in Computer and Information Science, vol. 2794, Springer, Cham, 2026
NeuroOnline:为脑电图基础模型搭建预训练与在线适应的桥梁
机构 * Southern University of Science and Technology(南方科技大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG
AI总结 研究脑电图基础模型,提出NeuroOnline框架,集成多视图一致性学习和上下文感知表示调制机制,统一表示对齐和动态适应,实验表明其在在线设置中性能优于基线。
通过潜在视角评估LLM中的多元主义
机构 * University of Helsinki(赫尔辛基大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 预训练与数据 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL
AI总结 提出一种领域无关的多层无监督框架,从LLM生成文本中提取潜在视角,评估多元主义差距,发现稀有视角仍被不成比例地低估。
Comments Pluralistic Alignment Workshop @ ICML 2026
数据受限的语言模型预训练:改进的正则化与缩放定律
机构 * University of Michigan(密歇根大学) ; KAIST AI(韩国科学技术院人工智能研究所)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG
AI总结 研究数据受限下语言模型预训练的正则化与缩放,提出掩码输入正则化(MIR)改善验证损失,并设计SoftQ缩放定律更准确拟合重复数据下的模型与数据规模交互。
SlideCheck: 通过数据集分布引导病理基础模型的自监督预训练
机构 * Beijing University of Chemical Technology(北京化工大学) ; South China Normal University(华南师范大学) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI
AI总结 提出SlideCheck工具,利用冻结病理基础模型的特征,通过双头MLP评分异常和恶性证据,引导自监督预训练数据筛选,实验表明数据分布影响模型下游性能。
Comments 9 pages, 2 figures, 4 tables
LLMSynthor: 使用大语言模型进行宏观对齐的微观记录合成
机构 * McGill University(麦吉尔大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.LG
AI总结 提出LLMSynthor方法,利用大语言模型作为非参数copula,通过迭代生成与目标宏观统计一致的微观记录,解决大规模细粒度数据收集困难的问题。
LatentWave: 无线基础模型的JEPA预训练
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI
AI总结 提出LatentWave,采用联合嵌入预测架构(JEPA)在潜空间预测掩码区域,学习可迁移的无线信号表示,并在四个下游任务中优于掩码建模基线。
语言模型中的认知不公正:预训练过滤器和护栏的审计
机构 * University of Turin(都灵大学) ; IT University of Copenhagen(哥本哈根技术大学) ; Trustworthy AI Lab(可信人工智能实验室)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
AI总结 通过审计预训练过滤器和推理时护栏,发现它们对边缘群体(如跨性别者、女性和中美洲人)的提及存在过度标记,导致认知抹除,而人类标注者会保留大部分被标记内容。
表格基础模型预训练的速通
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG
AI总结 提出一种速通竞赛格式,通过优化单文件训练脚本,在nanoTabPFN上实现81倍预训练加速,并建立社区排行榜以累积改进。
用于视觉语音识别的扩散大语言模型
机构 * Integrated Vision Language Lab, KAIST, South Korea(韩国加耶大学集成视觉语言实验室)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 提出首个基于扩散大语言模型(DLLM)的视觉语音识别框架DLLM-VSR,通过迭代掩码去噪和灵活顺序解码,结合置信度引导的解掩码策略及两阶段训练,并引入长度引导候选解码以降低目标长度不确定性,在LRS3上取得19.5%的词错误率。
Comments Code: https://github.com/JeongHun0716/dllm-vsr
大语言模型的优化超参数规律
机构 * Department of Mathematics, National University of Singapore, Singapore(新加坡国立大学数学系) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; Department of Mathematics and Institute of Operations Research and Analytics, National University of Singapore, Singapore(新加坡国立大学数学系和运筹分析研究所) ; Skywork AI, Beijing(北京Skywork AI)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG
AI总结 本文提出Opt-Laws框架,通过分析SDE收敛和逃逸特性,预测最终训练损失,从而在小规模实验中预选学习率调度方案,提高了超参数选择的准确性。
使用大语言模型模拟人类数据时分析灵活性的威胁
机构 * University of Bern, Switzerland(伯尔尼大学,瑞士) ; University of Oxford, United Kingdom(牛津大学,英国)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 本文研究了在使用大语言模型生成合成数据时,分析选择对合成数据与人类数据一致性的影响,发现不同的配置选择可能导致结论差异显著,呼吁关注分析灵活性的潜在威胁并提出减少该威胁的策略。
Comments 14 pages, 4 figures
Pion:通过正交等价变换实现的谱保持优化器
机构 * The Chinese University of Hong Kong(香港中文大学) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; Westlake University(西交利物浦大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 Pion通过正交等价变换实现谱保持优化,不同于Adam等加法优化器,其通过左右正交变换更新权重矩阵,保持奇异值不变,从而在保持谱范数的同时调节权重矩阵几何结构,实验表明其在LLM预训练和微调中具有稳定且竞争力的性能。
Comments Technical report v1 (30 pages, 19 figures, project page: https://spherelab.ai/pion/)
DataDignity: 为大语言模型训练数据的归因
机构 * Microsoft(微软)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract_cn);prompting(abstract)
AI总结 研究提出通过归因方法识别支持语言模型响应的文档,引入FakeWiki基准测试,评估ScoringModel在九个模型上的表现,提升Recall@10至52.2,展示训练数据归因需区分真实支持与主题或词汇相似性。
正交约束满足与大语言模型中的人类难度对齐
机构 * University of Houston(德克萨斯大学休斯顿分校)
专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文评估了三种大语言模型在字符级约束满足任务上的表现,发现跨家族性能差异显著大于同家族参数扩展效果,且模型在处理常见词时存在系统性失败,揭示了对分布合理性依赖的问题。
Comments Accepted to LREC 2026
预训练在哪里?探究预训练数据多样性如何影响地理空间基础模型性能
机构 * Arizona State University(亚利桑那州立大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG
AI总结 本文研究预训练数据地理组成对模型下游性能的影响,发现欧洲预训练数据在全局和本地评估中表现最佳,发现光谱多样性与性能强相关。
Comments Accepted at EarthVision workshop, CVPR 2026