On the Effect of Pretraining Corpora on In-context Learning by a Large-scale Language Model
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments Accepted to NAACL2022 as a long paper. Camera-ready version
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments Accepted to NAACL2022 as a long paper. Camera-ready version
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments NAACL 2022 Findings
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments ACL 2022
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments To be published in proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing (EMNLP 2021)
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments 24 pages, edited the citation of the syllable-level tokenizer from [Chormai et al., 2020] to [Phatthiyaphaibun et al., 2020] as the authors used the syllable-level tokenizer from PyThaiNLP [Phatthiyaphaibun et al., 2020] in the experiments
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments 5 pages, 3 figures. To be published in Findings of EMNLP 2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments AC2020
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
Comments AAAI student abstract
专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL
超越自然图像基础模型:针对眼科图像分析的卫星图像预训练基准测试
机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算机学院) ; University College London(伦敦大学学院) ; Institute of Ophthalmology, University College London(伦敦大学学院眼科研究所) ; Department of Computer Science, University College London(伦敦大学学院计算机科学系) ; NIHR Moorfields Biomedical Research Centre(NIHR穆尔菲尔德生物医学研究中心) ; Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) ; Moorfields Eye Hospital NHS Foundation Trust(穆尔菲尔德眼科医院NHS基金会信托)
专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)
AI总结 本文针对眼科图像分析,对比卫星图像与自然图像预训练的视觉基础模型,发现卫星图像预训练在眼科任务上表现优于自然图像,部分任务可媲美医学专家模型。
Comments Accepted at the ECCV 2026 Workshop on Medical Foundation Models and Benchmarks (MEDFMB)
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(title,abstract)
Comments 5 pages, Submitted to ICASSP 2025. The implementation and configuration could be found in https://github.com/NVIDIA/NeMo/blob/main/examples/audio/conf/flow_matching_generative_ssl_pretraining.yaml The audio demo page could be found in https://kuray107.github.io/ssl_gen25-examples/index.html
专题命中 预训练与数据 :pretraining(title,abstract);foundation model(title,abstract)
Comments Accepted by IEEE JSTARS Special issue on "Large-Scale Pretraining for Interpretation Promotion in Remote Sensing Domain". The codes and pretrained models are available at https://github.com/ViTAE-Transformer/MTP
面向人群健康管理的电子健康记录基础模型规模化研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgetown University(乔治城大学)
专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 该研究提出面向人群健康管理的电子健康记录基础模型,跨500万患者数据预训练,在11项慢性病预测任务及EHRShot基准中表现优于同类模型,将开源代码。
检测代码语言模型中的功能记忆
机构 * Meta ; Imperial College London(伦敦帝国学院)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG
AI总结 研究代码语言模型的功能记忆现象,通过反事实设置对比暴露目标代码的模型与未暴露的参考模型,使用文本和功能相似性度量,发现功能记忆超出文本重叠的检测范围。
这会改变你的答案吗?通过反事实实验评估现实场景中大语言模型(LLM)行为的解释
机构 * Anthropic
专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出CHIVE流程,通过反事实实验评估大语言模型行为的解释,发现常见可解释性技术无预测提升,且CHIVE生成的训练数据可实现分布外泛化。
Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试
机构 * University of California, Riverside(加利福尼亚大学河滨分校)
专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。
Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench
数据编排器:学习编排预训练数据的示例级整理
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究针对预训练数据处理未适应各示例需求的问题,提出DataOrchestra框架,统一处理操作并为每个示例编排特定管道,经实验验证该框架在多基准测试中表现良好,在数学持续预训练中有效且能减少计算。
Comments 36 pages
DomainPilot:用于高效语言模型微调的域级损失引导两阶段数据混合优化
机构 * Tsinghua University(清华大学)
专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);SFT(abstract)
AI总结 研究针对大语言模型训练数据问题,提出DomainPilot框架,通过域级损失引导两阶段数据混合优化,经令牌级监测、缩放与混合定律引导优化,在Qwen3-1.7B模型微调中验证,有效提升指标且不增成本。
SeaAlert:基于大型语言模型的海上 distress 通讯关键信息提取
机构 * HIT-Holon Institute of Technology(希伯来理工学院) ; Afeka Academic College of Engineering(阿菲卡工程学院)
专题命中 预训练与数据 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 本文提出SeaAlert框架,通过生成合成数据解决海上 distress 通讯标注数据不足问题,利用LLM生成多样化消息并模拟噪声环境,提升自动分析鲁棒性。
Comments 21 pages
超越安全数据:具有正则安全反射的预训练阶段对齐
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)
专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出安全反射预训练方法,在预训练语料中插入安全反思,使模型具备自我监控能力,实验表明该方法能有效降低推理和微调攻击成功率。
CHILLGuard:面向细粒度中文大语言模型安全护栏的可扩展数据构建与模型感知偏好对齐
机构 * Tsinghua University(清华大学) ; Beijing Normal University(北京师范大学) ; South China University of Technology(华南理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shenzhen ShenNong Information Technology Co., Ltd.(深圳神农信息技术有限公司)
专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 针对中文场景,提出细粒度风险分类体系(5大类31小类),通过可扩展数据构建管道生成高质量训练数据,并采用模型感知直接偏好优化训练CHILLGuard,在基准上F1分数提升15.92%。
时间序列作为语言:通用时间序列基础模型的通用分词器
机构 * Shanghai Jiao Tong University(上海交通大学) ; Huawei Noah’s Ark Lab(华为诺亚方舟实验室)
专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 提出UniTok通用分词器将时间序列转化为离散令牌,并基于NTP预训练UniTok-FM基础模型,支持零样本预测、提示增强预测以及少样本生成和分类,无需任务特定修改。
通过微调语言模型中的语义偏移检测社区特定俚语和实体
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.LG
AI总结 提出无监督方法,通过测量词在微调前后的语义偏移幅度,从在线社区文本中自动识别俚语、独特实体和民俗用语。
Comments 6 pages, 6 figures, 2 tables
听弦外之音:面向声学对抗攻击的语言模型先验
机构 * University of Melbourne(墨尔本大学) ; DST Group(DST集团)
专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG
AI总结 提出Semantic Gambit攻击,利用大语言模型实时提供预测上下文,突破因果限制,使实时ASR系统词错误率提升至35.6%,较当前最优方法提高三倍。
GEM: 用于最优LLM数据策展的几何熵混合
机构 * The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科学与技术大学) ; Peking University, Beijing, China(北京大学) ; University of Science and Technology of China, Hefei, China(中国科学技术大学)
专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出GEM框架,通过将数据策展重构为超球面上的变分问题并采用MM算法优化,解决了分类缺陷和嵌入各向异性问题,在1.1B参数模型上实现下游准确率提升1.2%。
Comments ICML 2026 Poster
TSFMAudit: 时间序列基础模型中的数据污染审计
机构 * Zhejiang University(浙江大学) ; Télécom Paris(巴黎高等电信学院) ; State Street Technology (Zhejiang) Ltd.(State Street Technology(浙江)有限公司) ; Datadog
专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG
AI总结 针对时间序列基础模型(TSFMs)预训练数据污染问题,提出基于探针适应动力学的审计方法TSFMAudit,通过检测微调后损失下降更快且骨干网络移动更小的异常现象来识别污染数据集。
Comments 22 pages, 7 figures, 9 tables
SimReg:通过嵌入相似性正则化提升预训练性能
机构 * Baidu Inc.(百度公司) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学)
专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 本文提出SimReg,通过增强相同标签嵌入的相似性与不同标签嵌入的对比,提升预训练效率和下游任务表现。
Naamah:通过DBpedia seeding和LLM生成构建大规模合成梵语命名实体识别语料库
机构 * Centre for Development of Advanced Computing (C-DAC)(发展高级计算中心)
专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 本文提出Naamah,一个包含102942个句子的高质量梵语NER数据集,结合DBpedia实体提取与混合推理模型生成,用于评估XLM RoBERTa和IndicBERTv2模型。