arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2510.16096 2025-10-21 cs.CL cs.LG 87%

Facts in Stats: Impacts of Pretraining Diversity on Language Model Generalization

Tina Behnia, Puneesh Deora, Christos Thrampoulidis

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01892 2025-08-05 cs.LG cs.AI 87%

How Does Controllability Emerge In Language Models During Pretraining?

Jianshu She, Xinyue Li, Eric Xing, Zhengzhong Liu, Qirong Ho

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00619 2025-08-04 cs.CL cs.LG 87%

DACTYL: Diverse Adversarial Corpus of Texts Yielded from Large Language Models

Shantanu Thorat, Andrew Caines

机构 * Department of Computer Science & Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments MPhil in Advanced Computer Science thesis for University of Cambridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12466 2025-07-17 cs.CL cs.LG 87%

Language Models Improve When Pretraining Data Matches Target Tasks

David Mizrahi, Anders Boesen Lindbo Larsen, Jesse Allardice, Suzie Petryk, Yuri Gorokhov, Jeffrey Li, Alex Fang, Josh Gardner, Tom Gunter, Afshin Dehghan

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Stanford(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

Comments 44 pages, 25 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00548 2025-06-03 cs.CR cs.CL cs.LG 87%

Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities

Jiahui Geng, Thy Thy Tran, Preslav Nakov, Iryna Gurevych

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01380 2025-03-13 cs.CL cs.AI 87%

Knowledge Entropy Decay during Language Model Pretraining Hinders New Knowledge Acquisition

Jiyeon Kim, Hyunji Lee, Hyowon Cho, Joel Jang, Hyeonbin Hwang, Seungpil Won, Youbin Ahn, Dohaeng Lee, Minjoon Seo

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.AI

Comments ICLR 2025, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06054 2025-03-11 cs.CL cs.AI 87%

Fine-Grained Bias Detection in LLM: Enhancing detection mechanisms for nuanced biases

Suvendu Mohanty

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.CL、cs.AI

Comments Bias detection, Large Language Models, nuanced biases, fine-grained mechanisms, model transparency, ethical AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13198 2024-09-23 cs.CL cs.LG stat.ML 87%

Exploring Scaling Laws for Local SGD in Large Language Model Training

Qiaozhi He, Xiaomin Zhuang, Zhihua Wu

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09455 2024-06-17 cs.CV cs.AI cs.CL 87%

Pandora: Towards General World Model with Natural Language Actions and Video States

Jiannan Xiang, Guangyi Liu, Yi Gu, Qiyue Gao, Yuting Ning, Yuheng Zha, Zeyu Feng, Tianhua Tao, Shibo Hao, Yemin Shi, Zhengzhong Liu, Eric P. Xing, Zhiting Hu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Website: https://world-model.maitrix.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03304 2024-06-14 cs.CL cs.LG 87%

Large Language Models for Document-Level Event-Argument Data Augmentation for Challenging Role Types

Joseph Gatto, Parker Seegmiller, Omar Sharif, Sarah M. Preum

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

Comments Paper in submission (8 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02385 2024-06-05 cs.CL cs.AI 87%

TinyLlama: An Open-Source Small Language Model

Peiyuan Zhang, Guangtao Zeng, Tianduo Wang, Wei Lu

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17076 2024-05-28 cs.AI cs.CL cs.IR 87%

Leveraging small language models for Text2SPARQL tasks to improve the resilience of AI assistance

Felix Brei, Johannes Frey, Lars-Peter Meyer

专题命中 预训练与数据 :language model(title,abstract);small language model(title);分类 cs.CL、cs.AI

Comments To appear in Proceedings of the Workshop on Linked Data-driven Resilience Research 2024 (D2R2) co-located with Extended Semantic Web Conference 2024 (ESWC 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02255 2024-02-06 cs.CL cs.LG 87%

Frequency Explains the Inverse Correlation of Large Language Models' Size, Training Data Amount, and Surprisal's Fit to Reading Times

Byung-Doh Oh, Shisen Yue, William Schuler

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

Comments EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01115 2023-04-04 cs.CV cs.AI cs.LG 87%

LASP: Text-to-Text Optimization for Language-Aware Soft Prompting of Vision & Language Models

Adrian Bulat, Georgios Tzimiropoulos

专题命中 预训练与数据 :prompting(title,abstract);language model(title);分类 cs.AI、cs.LG

Comments Accepted at CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.01806 2023-02-06 cs.CL cs.AI 87%

Mitigating Data Scarcity for Large Language Models

Hoang Van

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

Comments 155 pages, 26 tables, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.15231 2022-10-28 cs.CL cs.AI 87%

Unsupervised Boundary-Aware Language Model Pretraining for Chinese Sequence Labeling

Peijie Jiang, Dingkun Long, Yanzhao Zhang, Pengjun Xie, Meishan Zhang, Min Zhang

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

Comments 12 pages, 2 figures, 7 tables, EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.07055 2022-06-16 cs.CL cs.LG 87%

Large Language Models are not Models of Natural Language: they are Corpus Models

Csaba Veres

专题命中 预训练与数据 :language model(title,abstract);large language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.10318 2021-10-22 cs.CL cs.LG 87%

Improved Multilingual Language Model Pretraining for Social Media Text via Translation Pair Prediction

Shubhanshu Mishra, Aria Haghighi

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.CL、cs.LG

Comments Camera ready version. Accepted to WNUT 2021. Code for reproducing the experiments can be found at: https://github.com/twitter-research/multilingual-alignment-tpp

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.11241 2020-01-30 cs.CL cs.IR cs.LG 87%

Healthcare NER Models Using Language Model Pretraining

Amogh Kamat Tarcar, Aashis Tiwari, Vineet Naique Dhaimodker, Penjo Rebelo, Rahul Desai, Dattaraj Rao

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.LG

Comments This work was presented at the first Health Search and Data Mining Workshop (HSDM 2020) as part of WSDM 2020 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21462 2026-08-25 cs.CL cs.AI cs.LG 新提交 87%

CyrillicQA: The Influence of Phonetically Encoded Secret Language on LLM Performance

CyrillicQA:语音编码的秘密语言对大语言模型性能的影响

Erik Thureck, Leo S. Rdian

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 预训练与数据 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究探讨大语言模型在处理拉丁字母标准语言时表现优异但对其他语言变体存在劣势的背景下,能否像人类一样解码语音编码的濒危语言,以评估其保护濒危语言的能力。

Comments 4 pages, in English; 4 pages, in German (original); German version originally published in: Rüdian, S. (2026). Prompt-Engineering in Education (1st ed., pp. 39-42). Humboldt-Universität zu Berlin. https://doi.org/10.5281/zenodo.21413892

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04728 2026-08-19 cs.CL cs.AI cs.LG 版本更新 87%

Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment

将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法

Yu Li, Xiuyu Li, Mingyang Yi, Jiaxing Wang, Liangxu Zhang, Zhaolong Xing, Zhen Chen

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27313 2026-08-04 cs.LG cs.AI cs.CL 版本更新 87%

LLM generation novelty through the lens of semantic similarity

通过语义相似性视角探讨大语言模型的生成新颖性

Philipp Davydov, Ameya Prabhu, Matthias Bethge, Elisa Nguyen, Seong Joon Oh

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学)

专题命中 预训练与数据 :LLM(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过语义相似性视角探讨大语言模型生成新颖性的评估方法,揭示模型在预训练数据中的长序列抽取能力及任务领域对生成新颖性的影响

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13977 2026-07-31 cs.CL cs.AI cs.LG 版本更新 87%

How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data

如何合成高质量的预训练数据?提示设计、生成模型和源数据的系统研究

Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf

机构 * Hugging Face University of Sheffield(谢菲尔德大学) National Institute of Informatics(日本信息处理研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过大规模实验探讨提示设计、生成模型和源数据对合成预训练数据质量的影响,发现结构化输出格式优于现有方法,且生成模型参数超过1B无额外收益,提出开源数据集FinePhrase。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08693 2026-07-30 cs.CR 版本更新 87%

Recognition Without Mitigation: Ethical Frameworks in Autonomous Offensive-LLM Agent Research

自主渗透测试代理研究中的伦理声明

Andreas Happe, Jürgen Cito

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析利用大语言模型进行进攻性安全研究的论文,探讨伦理考量的表达与合理性,揭示学术社区在创新与伦理责任之间的平衡现状。

Comments Accepted at AutonomousCyber 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17621 2026-06-26 cs.CV 版本更新 87%

PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练

Fengchun Liu, Songhan Jiang, Linghan Cai, Ziyue Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26050 2026-06-25 cs.LG cond-mat.dis-nn cs.AI cs.CL 新提交 87%

Natural Ungrokking: Asymmetric Control of Which Rules Survive Pretraining

自然去突现:不对称控制哪些规则在预训练中幸存

Juliana Li, Diya Sreedhar

机构 * Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 发现语言模型在预训练中学习规则后会自动遗忘,规则存亡由训练数据中支持频率决定,且遗忘不可逆。

Comments Foundations of Deep Generative Models (FoGen) Workshop at ICML 2026. 23 pages (5-page main text plus appendices), 5 figures. Code: https://github.com/lijuliana/Natural-Ungrokking

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11137 2026-06-01 cs.LG cs.AI cs.CL 87%

Weight Decay Improves Language Model Plasticity

权重衰减提升语言模型可塑性

Tessa Han, Sebastian Bordt, Hanlin Zhang, Sham Kakade

机构 * Broad Institute, Schmidt Center(Broad研究所,Schmidt中心) University of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过系统实验表明,预训练中较大的权重衰减能提高模型的可塑性,使微调后下游性能更优,并揭示了其促进线性可分表示、正则化注意力矩阵和减少过拟合的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20268 2026-05-21 cs.LG cs.AI cs.CL 87%

Chronicle: A Multimodal Foundation Model for Joint Language and Time Series Understanding

Chronicle:一种用于联合语言和时间序列理解的多模态基础模型

Paul Quinlan, Jeremy Levasseur, Qingguo Li, Xiaodan Zhu

机构 * InertialAI Department of Electrical and Computer Engineering, Queen’s University(皇后大学电气与计算机工程系) Department of Mechanical and Materials Engineering, Queen’s University(皇后大学机械与材料工程系)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Chronicle,一种联合训练语言和时间序列的多模态基础模型,通过统一架构实现两者共享参数,从而在多个任务上取得了优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17849 2026-05-19 cs.CL cs.AI cs.LG 87%

Generating Pretraining Tokens from Organic Data for Data-Bound Scaling

从有机数据生成预训练令牌以实现数据驱动的扩展

Zichun Yu, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SynPro框架,通过重新表述和重新格式化操作,帮助大语言模型更充分地利用有限的有机数据,从而在数据驱动的预训练中实现更高效的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15854 2026-05-18 eess.AS 87%

Improving Automatic Speech Recognition for Speakers Treated for Oral Cancer using Data Augmentation and LLM Error Correction

通过数据增强和大语言模型错误校正提升口腔癌患者语音识别性能

Hidde Folkertsma, Thomas Tienkamp, Sebastiaan de Visscher, Max Witjes, Rob van Son, Jiapan Guo, Bence Mark Halpern

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过数据增强和大语言模型错误校正技术,有效提升了口腔癌患者语音识别的性能,实验结果显示在Whisper和MMS模型上分别实现了40%和50%的词错误率降低。

Comments 7 pages, 3 tables. Accepted by EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏