Larger language models do in-context learning differently
专题命中 预训练与数据 :language model(title,abstract);small language model(abstract);instruction tuning(abstract);pretraining(abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);small language model(abstract);instruction tuning(abstract);pretraining(abstract)
专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
Comments Accepted at Learning Meaningful Representations of Life workshop, NeurIPS 2022
从文本到视觉的可迁移性:视觉语言模型(VLM)的能力缩放定律与迁移动态
机构 * Meituan(美团) ; Tsinghua University(清华大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出首个跨家族的能力驱动多模态缩放定律,可通过LLM文本能力预测VLM性能,将主干选择从经验搜索转为定量决策,还揭示了LLM作为VLM主干的相关见解。
LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度
机构 * Peking University(北京大学) ; Meituan(美团)
专题命中 预训练与数据 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。
语义老虎机:上下文内的探索-利用受语义先验的偏置
机构 * Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) ; Skyfall AI(天空fall人工智能公司) ; McGill University(麦吉尔大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出语义老虎机框架,发现LLM的探索-利用受语义先验偏置,语义标签对齐奖励可提升性能,负奖励比同等正奖励触发更多探索,为LLM智能体决策可靠性提供了新见解。
Comments 10 pages, 5 figures in main body
训练混合:将小规模支架式预训练运行重组为更大的语言模型
机构 * Google(谷歌公司) ; School of Computing, Dublin City University(都柏林城市大学计算机学院)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
AI总结 本研究提出训练混合(MoT)框架,将Transformer划分为层块在冻结对齐器内独立训练后重组,在13亿参数Gemma模型上验证其可重组为可用语言模型,可复用对齐器实现计算优势,用于研究可复用训练单元。
Comments Accepted at the Workshop on Methods and Opportunities at Small Scale (MOSS), COLM 2026
NeuPAT:面向语言保留多模态大语言模型的神经元感知可塑性分配调优
专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)
AI总结 NeuPAT是一种轻量架构无关框架,通过选择性保护语言敏感神经元、促进高可塑性神经元适配多模态,在11个语言基准上恢复了普通调优94.5%的语言能力下降,同时保持相当多模态性能,实现了能力保留型多模态大语言模型扩展。
全栈FP4:通过量化投影、优化器和注意力进行稳定的语言模型预训练
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Sichuan University(四川大学) ; Beijing Zhongguancun Academy(北京中关村科学院) ; Zhejiang University(浙江大学) ; Beijing Key Laboratory of Brain-Inspired General Intelligence Large Model(北京脑科学与类脑研究中心通用人工智能大模型北京市重点实验室) ; Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑机智能技术重点实验室)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);分类 cs.AI、cs.LG
AI总结 研究针对4位预训练中优化器状态等未充分探索的问题,提出全栈FP4框架。通过模块精度策略解决稳定性瓶颈,如用LoRA-SVD抑制量化噪声,设计优化器变换,采用混合精度方案,实现稳定高效的端到端预训练。
Comments Fix experiment bugs and some statement, update current developed hardware efficiency result on 5090
MACRO:Transformer层的马尔可夫链路由
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出无需修改底层参数的MACRO框架,将Transformer层路由建模为马尔可夫策略,在多基准上实现优于基线及Dr. LLM的性能,同时大幅缩短路由搜索时间。
感知到的种族与性别对警察语言使用的影响:来自VR模拟的实验证据
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过VR模拟实验发现,警察对黑人男性虚拟角色的说话恭敬程度更低,还探讨了LLM在ATE估计中的应用,推荐混合效应模型结合iptw方法,认为LLM相关技术需进一步完善。
DenialRAG:通过嵌入参数化弃权的单文档RAG污染攻击
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出DenialRAG单文档RAG污染攻击,通过嵌入参数化弃权引导LLM生成错误答案,经多数据集、多模型及防御评估,其在Mistral-7B上攻击效果最优,凸显RAG污染风险的复杂性。
Comments Submit to ACSAC 2026
多模态上下文学习用于低资源语言的语音识别
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文探讨了通过多模态上下文学习提升低资源语言语音识别性能的方法,分析了跨语言迁移学习对模型效率的影响,并提出结合更强声学模型与语音LLM的改进系统。
Comments ACL 2026 findings
对话推荐系统中用户模拟的提示优化:一个多目标框架
机构 * Monash University(莫纳什大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出多目标框架自动优化LLM提示,以生成更真实、多样化的用户模拟行为,缓解对话推荐系统中的评估与数据获取难题。
Comments to be published in 2026 IEEE 42nd International Conference on Data Engineering Workshops (ICDEW)
一图足矣:基于文本世界模型的智能体单样本图像生成用于长尾空间感知
机构 * Tsinghua University(清华大学) ; SenseTime Research(商汤科技研究院) ; Sun Yat-Sen University(中山大学) ; Technical University of Munich(慕尼黑工业大学) ; Heilbronn Data Science Center(海尔布隆数据科学中心) ; Munich Data Institute(慕尼黑数据研究所)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 提出WMGen-v1框架,利用单张参考图像通过LVLM构建结构化场景表示,LLM进行物理合理的场景扩展,再由扩散模型生成多样化的长尾训练数据,缓解空间感知中的数据稀缺问题。
STRIDE: 通过子集扰动的稀疏恢复进行训练数据归因
机构 * Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所,图宾根,德国) ; Thoughtworks(Thoughtworks公司) ; Martian ; ELLIS Institute, Tübingen, Germany(图宾根ELLIS研究所,德国) ; EuroSafeAI
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 提出STRIDE框架,将训练数据归因建模为压缩感知中的稀疏恢复问题,通过激活空间中的轻量级“引导算子”模拟数据子集的影响,实现高效且准确的LLM预训练归因。
Comments project page: https://stride-tda.github.io/
LLMs 作为噪声信道:香农视角下的模型容量与缩放定律
机构 * University of Virginia(弗吉尼亚大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 针对现有缩放定律无法解释非单调性能退化的问题,提出基于香农-哈特利定理的香农缩放定律,将LLM训练建模为噪声信道上的信息传输,通过信号噪声比解释模型规模与数据量对性能的影响。
Comments Accepted by ICML 2026
理性是否必要且充分?为可解释的虚假信息检测调优大语言模型
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了如何通过调优大语言模型(LLM)来提升可解释性虚假信息检测的性能,提出了一种新的数据合成管道LONSREX,用于定位必要且充分的理性,以解决现有方法中因粗粒度标签和过度验证行为导致的理性不足和冗余问题。
Comments Accepted by KDD 2026. 12 pages, 8 figures. Code: https://github.com/wangbing1416/LONSREX
通过子词正则化预训练语言模型:BPE Dropout在低资源NLP中的实证研究
机构 * Department of Computer Science, Stellenbosch University(斯瓦茨堡大学计算机科学系)
专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG
AI总结 本文研究了在低资源NLP中预训练时应用BPE Dropout对下游性能的影响,发现随机分词在预训练和微调时均优于仅在微调时应用,尤其在数据较少时表现更佳。
Comments Comments: 12 pages, 8 figures, 5 tables
通过因果语言模型的绕行提升编码器持续预训练
机构 * Sorbonne Université / INRIA Paris ALMAnaCH Team(索邦大学 / 巴黎INRIA ALMAnaCH团队) ; INRIA Paris ALMAnaCH Team(巴黎INRIA ALMAnaCH团队)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
AI总结 本文通过在持续预训练中临时切换到因果语言模型并随后进行短时掩码语言模型衰减,提升了下游任务性能,特别是在生物医学文本上表现更优。
偏离策略训练数据对探测泛化的影响
机构 * King’s College London(伦敦国王学院) ; Imperial College London(伦敦帝国学院) ; LASR Labs(LASR实验室) ; University of Manchester(曼彻斯特大学) ; Goodfire AI ; University of Cambridge(剑桥大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文研究了偏离策略训练数据对八个不同LLM行为探测泛化的影响,发现训练策略显著影响探测性能,尤其在涉及响应意图的行为上表现更差,并提出预测泛化失败的测试方法。
Comments 10 pages, ACL 2026 Conference
通过竞赛式归因实现大规模去匿名化
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学)
专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 研究利用LLM链接匿名文档与其作者,提出大规模去匿名化方法DAS,通过分组筛选和多数投票提升鲁棒性和精度,实验显示在匿名平台存在现实隐私风险。
Comments 14 pages, ACL 2026 Oral
大型语言模型潜在语义流形中Voronoi分割的几何特性
机构 * MARS Labs(MARS实验室)
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
AI总结 研究大型语言模型在潜在语义流形中的Voronoi分割,通过浮点32精度重新计算消除bfloat16量化伪影,验证表达性差距的线性缩放定律,并展示通过边距优化程序重塑Voronoi分割的可行性。
Comments 20 pages
利用大语言模型进行GLP-1RA病例报告的时间表表征:一个文本时间序列语料库和风险建模
机构 * National Library of Medicine(美国国家医学图书馆)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
AI总结 本文利用大语言模型处理GLP-1RA病例报告的时间线,构建了包含136个病例的文本时间序列语料库,并通过时间序列分析评估了模型在提取临床事件及其时间点上的性能,发现GPT5在事件覆盖和时间顺序上表现优异,并展示了糖尿病患者使用GLP-1RA降低呼吸并发症风险的证据。
Comments AMIA Annual Symposium
人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿
机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG
AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。
Comments Preprint. Under review
PonderLM:在连续空间中预训练语言模型以进行思考
机构 * LUMIA Lab(LUMIA实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Institute for Advanced Algorithms Research Shanghai(上海高级算法研究所) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI
AI总结 PonderLM通过在连续空间中引入思考过程,提升语言模型的认知处理能力,实验表明其在多个基准测试中优于现有模型。
Comments ICLR 2026
关于大型语言模型中结构信息的出现及其测试时使用
机构 * ETH Zurich(苏黎世联邦理工学院) ; Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; University of Cambridge(剑桥大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG
AI总结 本研究探讨了大型语言模型如何学习和利用结构信息,发现其在复杂推理任务中表现突出,但测试时组合生成能力仍受限。
RECAP: 在基于文本的心理健康咨询中利用大语言模型进行抗阻捕捉
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
AI总结 RECAP通过捕捉13种细粒度抗阻行为,提高了基于文本的心理健康咨询中抗阻检测的准确性和解释性,优于现有方法。
Comments 19 pages, 2 figures
用语言锻造时间序列:一种基于大语言模型的合成数据生成方法
机构 * IBM Research Europe(IBM欧洲研究院)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
AI总结 SDForger通过大语言模型生成高质量多变量时间序列,利用文本条件化实现高效合成数据生成及多模态建模。
Journal ref NeurIPS 2025, https://openreview.net/forum?id=A2pmvkqOgp
利用大语言模型进行罕见疾病命名实体识别
专题命中 预训练与数据 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI
AI总结 本研究利用大语言模型在低资源环境下提升罕见疾病命名实体识别性能,通过结构化提示框架和语义引导方法,实现优于传统模型的表现。
大语言模型在混合语言扰动下的归因安全故障
机构 * Microsoft Corporation(微软公司)
专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI
AI总结 研究发现大语言模型在混合语言扰动下存在归因安全故障,提出显著性漂移归因框架并提出翻译基恢复策略以提升安全性。