ELIXR: Towards a general purpose X-ray artificial intelligence system through alignment of large language models and radiology vision encoders
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract)
Hamilton-Zero:适用于任意二次量子比特哈密顿量基态的神经张量网络基础模型
专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出Hamilton-Zero基础模型,将二次量子比特哈密顿量基态学习转化为流形变分优化,经预训练、微调后可在8100量子比特系统上评估,突破经典模拟局限,实现量子基态的高效计算。
Comments 26 pages main text
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
Journal ref Proceedings of the 17th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2023)
具备跨学科泛化能力的数值智能基础模型
机构 * National University of Singapore(新加坡国立大学)
专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出UNICON这一数值智能基础模型,可跨学科泛化,结合语言模型智能体后能超越训练未涉及学科的最先进专业人员,训练语料库多样性可提升泛化能力。
面向基于大语言模型的歌曲歌词性内容量化方法
专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出一种基于大语言模型的可复现方法,量化歌曲歌词主题内容(含性内容),并将其应用于12位雷鬼顿艺术家的1259首歌曲,还发布相关代码与语料库供他人复现或扩展。
Comments 17 pages, 10 figures. Code, scoring prompt, and corpus: https://github.com/ignaciosticco/open-lyrics-scorer
示例引导提示用于文档级文本简化
机构 * SCE(SCE(以色列SCE学院)) ; ScaDS.AI, TUD Dresden(ScaDS.AI,德累斯顿工业大学)
专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对文档级文本简化中提示指导不足的问题,提出示例引导提示方法,经OneStopEnglish语料库实验,可提升大语言模型的简化质量,性能优于或媲美相关基准系统。
利用经验下一个token分布追踪大语言模型行为到训练数据
机构 * NEC Labs America(美国 NEC 实验室)
专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.AI
AI总结 研究大语言模型输出分布与训练数据的联系,通过经验下一个token分布追踪。发现多数输入下二者近乎完美一致且随模型规模等提升,也存在差异,探讨了差异来源,鼓励以数据为中心的机制可解释性研究。
语言模型的物理:第4.1部分,架构设计与Canon层的魔力
专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.CL
AI总结 本研究提出Canon层,通过轻量级架构组件提升语言模型的推理深度和广度,验证了其在不同架构中的有效性,并展示了其在学术预训练中的潜力。
Comments V1.1 appeared in NeurIPS 2025 main conference; V2 adds GDN experiments, tightens others for a stronger, fairer comparison, and reorganizes sections; V3 adds Result 2.1 and Section 5.2 on how Canon layers improve hierarchical feature learning, from our Jan 2026 talk
用于语言智能的可扩展视觉预训练
专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 研究挑战语言模型仅在文本表示上训练的假设,通过对直接利用视觉文档的无监督视觉预训练范式进行系统研究,发现其在多主干和基准上优于仅文本预训练,为可扩展语言智能提供有效途径。
前沿语言模型在复制方面存在困难:文本可在二维视角下得到更好理解
机构 * Tsinghua University(清华大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 研究发现前沿语言模型复制输入字符串存在困难,归因于Transformer架构位置编码问题。为此引入2D-RoPE,将文本组织成二维网格,使复制任务更易学习。实验表明其在复制任务上优势明显,有助于语言建模,鼓励探索二维位置编码潜力。
多语言教师:评估语言模型用于多语言合成数据生成
机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 预训练与数据 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL
AI总结 本文评估了多语言教师模型的有效性,通过Polyglot Score衡量数据质量和学生模型表现,发现Gemma 3和Aya Expanse在不同学生模型家族中表现优异,数据质量如提示多样性、长度和响应流畅度对教学效果影响显著。
Comments Added human evaluation experiment results. Code is in https://github.com/ljvmiranda921/polyglot-teachers
DSWAM:用于细粒度机器人操作的双系统世界行动基础模型
机构 * AIRC, Midea Group(美的集团美云智数) ; Tongji University(同济大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.AI
AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。
Comments 13 pages, 1 figures
先复制,后翻译:在多语言预训练中解读翻译动态
机构 * MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) ; Department of Mathematics, LMU Munich(数学系,慕尼黑大学) ; Department of Physics and Technology, University of Tromsø(物理与技术系,特罗姆瑟大学) ; DLR-German Aerospace Center(德国航空航天中心)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究通过多语言预训练模型探索语言和翻译能力的早期发展,发现模型在早期阶段通过token级复制获取基本语言能力,翻译能力分两阶段发展。
Comments 10 pages
历史意大利语对语言模型有多令人惊讶?分词税、理解税以及一种简单的缓解方法
机构 * University of Bologna(博洛尼亚大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 本文提出一个诊断框架,将历史语言难度分解为分词成本、预测不确定性、语义鲁棒性和上下文敏感性四个维度,通过17世纪意大利语等数据集评估,发现历史文本存在分词税但语义表示鲁棒,并证明简单的时间上下文提示可将历史意外性降低约60%。
Comments The 22nd Conference on Information and Research Science Connecting to Digital and Library Science
迈向基于预训练数据组成的工程化缩放定律
机构 * Department of Applied Physics(应用物理系) ; Stanford University(斯坦福大学) ; Department of Physics and Astronomy(物理与天文学系) ; University of California, Irvine(加州大学尔湾分校) ; SLAC National Accelerator Laboratory(SLAC国家加速器实验室)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究通过工程化预训练数据组成(增加多样性和与下游任务的对齐)来改变粒子物理中神经网络的缩放行为,使其更偏向数据扩展而非模型扩展。
LifeSentence: 语言模型可以从纵向面板数据编码人类生命历程轨迹
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 提出LifeSentence模型,将大型语言模型与纵向面板数据结合,通过结构化自然语言记录生命事件并微调预训练模型,在少样本条件下超越传统方法,实现生命事件预测与时间顺序重建。
多跳知识组合受限于预训练暴露
机构 * Inria, Paris, France(法国国家信息与自动化研究所(巴黎)) ; Inria, Chile(法国国家信息与自动化研究所(智利)) ; Dept. of Computer Science, Universidad de Chile(智利大学计算机科学系)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究发现,即使单跳准确率达97%,大语言模型仍无法进行隐式多跳推理,原因是预训练中缺乏组合上下文,而非知识缺失。
生成器-擦除器悖论:负责任的大语言模型辅助方言资源创建的社区指南
机构 * Northwestern University in Qatar(卡塔尔西北大学)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出生成器-擦除器悖论理论框架,推导出12条社区指南,并通过阿拉伯方言案例展示如何在大语言模型辅助方言资源创建中平衡效率与语言多样性保护。
Journal ref Proceedings of the Workshop on Dialects in NLP - A Resource Perspective (DialRes) @ LREC 2026
EURO-5K:领域预训练何时重要?用于欧盟报告义务提取的Transformer基准测试
机构 * Division of Computer Science, School of Electrical and Computer Engineering(计算机科学系,电气与计算机工程学院) ; National Technical University of Athens(雅典技术大学) ; Department of Humanities Social Sciences and Law, School of Applied Mathematical and Physical Sciences(人文社会科学与法律系,应用数学与物理科学学院)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);prompting(abstract);分类 cs.CL
AI总结 本文构建了EURO-5K数据集,通过对比判别式与生成式模型在欧盟报告义务提取上的表现,发现领域预训练在参数高效微调时收益显著,且模型可作为专用提取器。
多智能体大语言模型系统中的林格曼效应:有效团队规模的缩放定律
机构 * Jozef Stefan Institute(乔泽夫·斯蒂芬研究所)
专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.AI
AI总结 本文推导出两参数缩放定律 $R(N) = N_\text{eff}/N = 1/(1+c(N-1)N^{-\beta})$,将多智能体LLM系统分为三种渐近状态,并通过44个实验单元验证了该定律,发现密集辩论无法增加答案多样性,噪声安慰剂可模拟自我修正效果,且仅异构团队能突破硬上限。
Comments 41 pages, 9 figures, 20 tables
参数对齐减轻多语言专家语言模型中的灾难性遗忘
机构 * Northeastern University(东北大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL
AI总结 针对多语言持续预训练中的灾难性遗忘问题,提出五种层感知参数对齐策略(硬冻结、软正则化、事后权重恢复和模型合并),在32种训练语言和保留语言上评估,证明参数对齐能有效减少遗忘且语言获取成本低。
Comments 25 Pages, 5 Figures
PictSure:预训练嵌入对上下文学习图像分类器至关重要
机构 * German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) ; Centrum Wiskunde & Informatica (CWI)(数学与信息学研究中心(CWI))
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文提出PictSure视觉上下文学习模型,发现预训练嵌入质量是下游性能的关键瓶颈,而融合层训练数据的多样性影响有限。
Comments 10 pages, 2 figures
超越文本:通过多模态双注意力和软图像引导减少大型视觉语言模型中的语言偏差
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Peking University(北京大学) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL
AI总结 针对大型视觉语言模型因语言偏差导致的幻觉问题,提出LACING框架,采用多模态双注意力机制和软图像引导策略,在不增加训练资源的情况下增强视觉理解并减少幻觉。
Comments EMNLP 2025
Nexus: 相同预训练损失,通过公共极小值实现更好的下游泛化
机构 * Tsinghua University(清华大学)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出Nexus优化器,通过最大化梯度相似性促使不同数据源的损失函数极小值靠近,在保持相同预训练损失的情况下显著提升下游泛化性能。
ITGPT:对不规则时间序列的生成预训练
机构 * Division of Information Science and Engineering, KTH Royal Institute of Technology(信息科学与工程系,皇家理工学院)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出ITGPT,一种针对多模态不规则时间序列的注意力架构,通过自监督学习和生成预训练目标处理不规则采样数据,在医疗和预测维护任务中实现SOTA性能。
Comments 9 pages
EMO:用于涌现模块化的专家混合预训练
机构 * University of California, Berkeley(加州大学伯克利分校) ; Allen Institute for AI(人工智能研究院)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出EMO,通过在预训练中利用文档边界实现专家模块化,使模型在内存受限下仍能保持高性能,同时实现专家的语义层面专业化。
代理AI是基础模型在分布外泛化中的缺失范式
机构 * Tsinghua University(清华大学)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);post-training(abstract);分类 cs.LG
AI总结 本文提出代理系统是解决基础模型分布外泛化问题的必要范式,通过四个步骤论证代理系统在结构上超越了传统模型中心范式,提出了参数覆盖上限的理论,并反驳了七项反论点。
Comments 13 pages, 2 figures
基于神经激活图的目标导向预训练数据选择
机构 * ByteDance(字节跳动) ; UC Santa Cruz(加州大学圣克鲁兹分校) ; UNC-Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);language model(abstract);分类 cs.CL
AI总结 本文提出基于神经激活图的排名方法,通过选取高影响神经元构建NAG,提升目标导向预训练效果,实验显示在六个基准测试中平均提升4.9%,并在多目标设置中优于基线方法。
Lil-Bevo:探索以更人性化方式训练语言模型的策略
机构 * Department of Linguistics(语言学系) ; Department of Computer Science(计算机科学系) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);pretraining(abstract);分类 cs.CL
AI总结 本文提出Lil-Bevo,通过音乐数据预训练、短序列先训练及特定token掩码等策略,探索更人性化的语言模型训练方法,但效果仍低于大模型。
Comments Proceedings of the BabyLM Challenge
Journal ref Proceedings of the BabyLM Challenge at the 27th Conference on Computational Natural Language Learning 2023
CuraLight: 基于辩论引导的数据整理用于LLM中心的交通信号控制
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) ; Beijing Big Data Center(北京大数据中心)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出CuraLight框架,通过强化学习代理生成高质量交互轨迹并结合多LLM辩论系统优化信号控制策略,实验显示在不同真实网络中优于现有方法,降低平均通行时间、排队长度和等待时间。
Comments accepted at IJCNN 2026