arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2601.21343 2026-04-07 cs.CL cs.AI cs.LG 88%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23383 2026-03-03 cs.CL cs.AI cs.LG 88%

Train Once, Answer All: Many Pretraining Experiments for the Cost of One

一次训练,全部回答:为一次训练成本进行多项预训练实验

Sebastian Bordt, Martin Pawelczyk

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) University of Vienna(维也纳大学) Faculty of Computer Science(计算机科学学院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 通过一次训练运行同时进行多项预训练实验,有效降低计算成本并提升研究的严谨性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12868 2025-12-16 cs.CL cs.AI cs.LG 88%

Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM

计数线索:一个轻量级概率基线可以匹配LLM

Furong Jia, Yuan Pu, Finn Guo, Monica Agrawal

机构 * Duke University(杜克大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种轻量级概率排名器FBPR,通过共现统计信息实现与LLM相当的性能,展示了概率基线在临床诊断中的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06795 2025-10-24 cs.CL cs.AI cs.LG 88%

ixi-GEN: Efficient Industrial sLLMs through Domain Adaptive Continual Pretraining

Seonwu Kim, Yohan Na, Kihun Kim, Hanhee Cho, Geun Lim, Mintae Kim, Seongik Park, Ki Hyun Kim, Youngsub Han, Byoung-Ki Jeon

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14688 2025-10-01 cs.CL cs.AI cs.LG 88%

Mind the Gap: A Review of Arabic Post-Training Datasets and Their Limitations

Mohammed Alkhowaiter, Norah Alshahrani, Saied Alshahrani, Reem I. Masoud, Alaa Alzahrani, Deema Alnuhait, Emad A. Alghamdi, Khalid Almubarak

机构 * Refine AI ASAS AI University of Bisha(比沙大学) University College London(伦敦大学学院) King Salman Global Academy for Arabic(萨勒曼全球阿拉伯学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) King Abdulaziz University(阿卜杜勒阿齐兹大学) HUMAIN

专题命中 预训练与数据 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15096 2025-08-22 cs.CL cs.AI cs.LG 88%

Nemotron-CC-Math: A 133 Billion-Token-Scale High Quality Math Pretraining Dataset

Rabeeh Karimi Mahabadi, Sanjeev Satheesh, Shrimai Prabhumoye, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

机构 * NVIDIA(英伟达) Boston University(波士顿大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07186 2025-07-15 cs.CL cs.AI cs.LG 88%

Planted in Pretraining, Swayed by Finetuning: A Case Study on the Origins of Cognitive Biases in LLMs

Itay Itzhak, Yonatan Belinkov, Gabriel Stanovsky

机构 * Technion – Israel Institute of Technology(以色列技术学院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments CoLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03250 2025-06-11 cs.LG cs.AI cs.CL 88%

DiffLM: Controllable Synthetic Data Generation via Diffusion Language Models

Ying Zhou, Xinyao Wang, Yulei Niu, Yaojie Shen, Lexin Tang, Fan Chen, Ben He, Le Sun, Longyin Wen

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) ByteDance Inc.(字节跳动公司)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments 21 pages, 9 figures, Accepted by ACL 2025, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18763 2025-02-27 cs.IT math.IT 88%

CommGPT: A Graph and Retrieval-Augmented Multimodal Communication Foundation Model

Feibo Jiang, Wanyun Zhu, Li Dong, Kezhi Wang, Kun Yang, Cunhua Pan, Octavia A. Dobre

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12031 2024-11-22 cs.LG cs.AI cs.CL 88%

Large Scale Transfer Learning for Tabular Data via Language Modeling

Josh Gardner, Juan C. Perdomo, Ludwig Schmidt

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

Comments NeurIPS 2024 camera-ready updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05581 2024-10-17 cs.CL cs.AI cs.LG 88%

Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?

Fırat Öncel, Matthias Bethge, Beyza Ermis, Mirco Ravanelli, Cem Subakan, Çağatay Yıldız

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Accepted to EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05140 2024-07-29 cs.LG cs.AI cs.CL 88%

Tag-LLM: Repurposing General-Purpose LLMs for Specialized Domains

Junhong Shen, Neil Tenenholtz, James Brian Hall, David Alvarez-Melis, Nicolo Fusi

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14316 2024-07-17 cs.CL cs.AI cs.LG 88%

Physics of Language Models: Part 3.1, Knowledge Storage and Extraction

Zeyuan Allen-Zhu, Yuanzhi Li

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);pretraining(abstract)

Comments V2 polishes writing + fixes author name; V3 includes additional Llama experiments and writing improvements

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10688 2024-04-19 cs.CL cs.AI cs.LG 88%

A decoder-only foundation model for time-series forecasting

Abhimanyu Das, Weihao Kong, Rajat Sen, Yichen Zhou

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05875 2024-04-10 cs.CL cs.AI cs.LG 88%

CodecLM: Aligning Language Models with Tailored Synthetic Data

Zifeng Wang, Chun-Liang Li, Vincent Perot, Long T. Le, Jin Miao, Zizhao Zhang, Chen-Yu Lee, Tomas Pfister

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

Comments Accepted to Findings of NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11730 2023-12-27 cs.CL cs.AI cs.IR cs.LG 88%

Knowledge Graph Prompting for Multi-Document Question Answering

Yu Wang, Nedim Lipka, Ryan A. Rossi, Alexa Siu, Ruiyi Zhang, Tyler Derr

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26580 2026-08-28 cs.CV cs.CL 新提交 88%

Visual Information-Guided Parallel Decoding for Diffusion Multimodal Large Language Models

面向扩散多模态大语言模型的视觉信息引导并行解码

Insu Lee, Wooje Park, Wonseok Shin, Jinwoo Son, Byonghyo Shim

机构 * Seoul National University(首尔大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对扩散多模态大语言模型解码时未充分利用输入图像信息的问题,提出视觉信息引导采样器 VIG-Sampler,在 7 个基准及 3 个开源模型上验证其性能优于 Info-Gain 采样器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25904 2026-08-27 cs.CL 新提交 88%

One Form to Transfer Them All: Pretraining Multilingual Language Models Beyond Native Orthography

一种实现跨语言迁移的统一形式:超越原生正字法的多语言语言模型预训练

Muge Zhang, Aaron Jencks, Krishna Badikela, Yulia Tsvetkov, Sachin Kumar

机构 * Ohio State University(俄亥俄州立大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 本文通过系统对比三种输入表示,发现罗马化预训练可实现最强跨语言迁移,且优势随模型规模增大而扩大,提出多语言模型应将罗马化作为预训练核心设计选择的结论。

Comments EMNLP 2026 (Main Conference). 9 pages, 6 figures (plus appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25663 2026-08-27 cs.IR cs.AI cs.DB cs.DL 新提交 88%

Data Citation for Large Language Models: A Challenge

大语言模型的数据引用:一项挑战

Gianmaria Silvello

机构 * University of Padua(帕多瓦大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文指出大语言模型的数据引用是一项开放挑战,提出训练数据归因、推理时数据引用、知识图谱事实引用三个研究方向,需跨领域协同推进以解决该问题。

Comments 7 pages, journal paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24814 2026-08-26 cs.LG 新提交 88%

Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

有效学习率支配语言模型预训练中的损失动态

Zihan Liu, Ruiheng Zheng, Shaobo Zhang, Changxin Tian, Kunlong Chen, Zhiqiang Zhang, Lei Wu

机构 * Peking University(北京大学) Ant Group(蚂蚁集团)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 该研究发现语言模型预训练中存在ELR崩溃现象,确定ELR是连接LR调度、范数控制与损失动态的共同坐标,提出的基于ELR的FSL可实现跨范数控制方法的迁移并解释延迟加速效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20005 2026-08-21 cs.LG 新提交 88%

Scale-Aware Pretraining of Time Series Foundation Models via Multi-Patch Token Alignment and Hybrid Masking

基于多补丁令牌对齐与混合掩码的时间序列基础模型尺度感知预训练

Taihua Chen, Xiang Ma, Yixin Zhang, Tailin Zhan, Manyu Sun, Lizhen Cui

机构 * School of Software, Shandong University(山东大学软件学院) Joint SDU–NTU Centre for Artificial Intelligence Research (C-FAIR), Shandong University(山东大学-南洋理工大学人工智能联合研究中心(C-FAIR)) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文针对时间序列基础模型预训练中处理不同采样频率的问题,提出SATS方法,通过尺度感知令牌对齐与混合掩码策略实现最优性能,同时提升模型效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07665 2026-08-18 cs.CL eess.AS 88%

Spoken Stereoset: On Evaluating Social Bias Toward Speaker in Speech Large Language Models

Yi-Cheng Lin, Wei-Chih Chen, Hung-yi Lee

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref 2024 IEEE Spoken Language Technology Workshop (SLT), Macao, 2024, pp. 871-878

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13515 2026-08-14 cs.CL 新提交 88%

Measuring Task-Agnostic Training Data Influence Across Language Model Pretraining

测量语言模型预训练中与任务无关的训练数据影响

Yuto Nishida, Hirokazu Kiyomaru, Yusuke Oda, Takashi Kodama, Chaoran Liu, Daisuke Kawahara, Yusuke Miyao, Max Müller-Eberstein, Masaru Isonuma

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Waseda University(早稻田大学) The University of Tokyo(东京大学) IT University of Copenhagen(哥本哈根信息技术大学) Tohoku University(东北大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 本文提出无需依赖下游任务或验证集的训练数据影响度量方法,经实验发现预训练中有影响力的数据存在时间变化,早期文献相关数据、后期STEM数据与最终参数轨迹的一致性更强。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13101 2026-08-14 cs.CL eess.AS 新提交 88%

CASA: Content-Acoustic Speaking Assessment with Speech Encoder and Large Language Model

CASA:结合语音编码器与大语言模型的内容-语音口语评估

Nhan Phan, Ilona Lähteenmäki, Anna von Zansen, Olli-Pekka Pauna, Yaroslav Getman, Tamás Grósz, Mikko Kurimo

机构 * Aalto University(阿尔托大学) University of Helsinki(赫尔辛基大学) Walton Institute(沃尔顿研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究提出结合Whisper-medium与Qwen3.5-2B的CASA架构,在Speak & Improve Corpus 2025上RMSE达0.358,参数量减半,可分离语音表达与内容,还分析了声学与内容信息的贡献及性能稳定性。

Comments To be submitted to ICASSP 2027. Code is available at https://github.com/aalto-speech/casa

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12762 2026-08-14 cs.AI 新提交 88%

PROVE-RT: Generating Mechanized Theorem Prover Scripts for Real-Time Systems using LLMs

PROVE-RT:使用大语言模型为实时系统生成机械化定理证明器脚本

Sadat Shahriyar, Shareef Ahmed, Abdullah Al Arafat

机构 * Florida International University(佛罗里达国际大学) University of South Florida(南佛罗里达大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PROVE-RT是一种LLM辅助框架,通过依赖感知草图、PROSA文档检索等步骤生成PROSA/ROCQ脚本,在1191篇实时系统论文构建的语料库上,其机械化可调度性分析的成功率达44.7%,优于直接提示的LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10214 2026-08-12 cs.AI 新提交 88%

Decodable But Not Detachable: Training Data Granularity Determines Parametric Modularity in Large Language Models

可解码但不可分离:训练数据粒度决定大语言模型的参数模块化

Marcus Armstrong, Navid Ayoobi, Arjun Mukherjee

机构 * University of Houston(休斯顿大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究探讨大语言模型是否存在特定领域参数壳,通过多模型、多领域实验发现训练数据的标记级模块化是参数壳形成的关键,为大语言模型的参数模块化研究提供了核心结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09424 2026-08-11 cs.CL 新提交 88%

Reducing Pretraining-Generation Mismatch in Diffusion Language Models

减少扩散语言模型中的预训练-生成不匹配

Xiaocheng Lu, Huabin Liu, Song Guo, Jianguo Li

机构 * Inclusion AI The Hong Kong University of Science and Technology(香港科技大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。

Comments 12 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03733 2026-08-05 cs.AI 新提交 88%

Failure-Informed Image Self-Augmentation for Multimodal Large Language Model Self-Improvement

面向多模态大语言模型自我改进的故障感知图像自增强

Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出FISA框架,基于MLLM失败案例生成保留答案的增强图像,经自检验与双重保真过滤后,可提升视觉问答性能,且兼容文本自增强、数据效率更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 88%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18927 2026-07-22 cs.AI 新提交 88%

OntoBook: Ontology-Grounded Synthetic Textbooks for Medical Encoder Pretraining

OntoBook:用于医学编码器预训练的基于本体的合成教科书

Rian Touchent, Éric de la Clergerie

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract,journal_ref);language model(abstract,journal_ref);LLM(abstract)

AI总结 研究提出OntoBook方法,将医学本体结构转为预训练信号,经随机游走、大语言模型重述等三阶段,用生成文本训练法语编码器,在多基准测试中有显著改进,强调目标对齐必要,还发布了相关教科书与模型检查点。

Journal ref Proceedings of Knowledge Graphs and Large Language Models Workshop, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏