arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2605.07244 2026-05-11 cs.LG cs.AI cs.CL 87%

Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models

异构语言模型中的互强化学习经验共享

Xiaoze Liu, Dhananjay Ram, Yuting Zhang, Zhaoyang Zhang, Wei Xia, Stefano Soatto

机构 * Purdue University(普渡大学) AWS Agentic AI(AWS智能体实验室)

专题命中 预训练与数据 :language model(title);LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出互强化学习框架,通过共享经验提升异构语言模型性能,采用共享经验交换、多工人资源分配和 tokenizer 异质性层实现跨模型经验共享,验证了在稳定与支持之间取得平衡的可行性。

Comments 50 pages, 10 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01158 2026-05-05 cs.CY 87%

The Hidden Cost of Thinking: Energy Use and Environmental Impact of LMs Beyond Pretraining

思考的隐性成本:语言模型的能耗与环境影响(超出预训练阶段)

Jacob Morrison, Noah A. Smith, Emma Strubell

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 研究分析了语言模型全开发流程的环境影响,发现推理模型在数据中心能耗上是指令模型的17倍,开发成本占总计算量的82.2%,整体能耗达12.3GWh,排放4251吨CO2eq,水耗15887千升,需纳入环境报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20122 2026-05-01 cs.CL cs.AI cs.IR cs.LG 87%

NanoKnow: How to Know What Your Language Model Knows

NanoKnow: 如何了解你的语言模型知道什么

Lingwei Gu, Nour Jedidi, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过NanoKnow基准数据集分析语言模型知识来源,发现预训练数据频率影响准确性,外部证据可缓解频率依赖,参数与外部知识互补,无关信息损害表现。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21159 2026-04-24 cs.CR cs.AI cs.CL cs.LG 87%

Adaptive Instruction Composition for Automated LLM Red-Teaming

自适应指令生成用于自动化大语言模型红队测试

Jesse Zymet, Andy Luo, Swapnil Shinde, Sahil Wadhwa, Emily Chen

机构 * Capital One, AI Foundations(Capital One人工智能基础研究)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自适应指令生成框架,通过强化学习平衡探索与利用,提升红队测试的攻击效果与多样性,优于随机组合和现有方法。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO 87%

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17930 2026-04-21 cs.CL cs.AI cs.LG 87%

Heterogeneity in Formal Linguistic Competence of Language Models: Is Data the Real Bottleneck?

形式语言能力异质性:数据是否是真正的瓶颈?

H S V N S Kowndinya Renduchintala, Sumit Bhatia

机构 * Adobe Inc.(Adobe公司) Media and Data Science Research(媒体与数据科学研究)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨语言模型在形式语言能力上的差异是否源于架构限制或数据稀缺,通过干预性数据增强显著提升了模型在8个最差BLiMP任务上的表现。

Comments ACL'26 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06571 2026-04-09 cs.CL cs.AI cs.IR cs.LG 87%

LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources

基于大型语言模型的异构数据源中缺失人员情报提取与验证方案

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(欧道明大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。

Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02320 2026-04-08 cs.CV cs.GR 87%

Large-scale Codec Avatars: The Unreasonable Effectiveness of Large-scale Avatar Pretraining

大规模编码者人像:大规模人像预训练的不理性有效性

Junxuan Li, Rawal Khirodkar, Chengan He, Zhongshi Jiang, Giljoo Nam, Lingchen Yang, Jihyun Lee, Egor Zakharov, Zhaoen Su, Rinat Abdrashitov, Yuan Dong, Julieta Martinez, Kai Li, Qingyang Tan, Takaaki Shiratori, Matthew Hu, Peihong Guo, Xuhua Huang, Ariyan Zarei, Marco Pesavento, Yichen Xu, He Wen, Teng Deng, Wyatt Borsos, Anjali Thakrar, Jean-Charles Bazin, Carsten Stoll, Ginés Hidalgo, James Booth, Lucy Wang, Xiaowen Ma, Yu Rong, Sairanjith Thalanki, Chen Cao, Christian Häne, Abhishek Kar, Sofien Bouaziz, Jason Saragih, Yaser Sheikh, Shunsuke Saito

机构 * Codec Avatars Lab, Meta(Meta编解码虚拟化身实验室)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出大规模编码者人像模型,通过预训练和后训练相结合的方法,在大规模数据上实现高保真的人像生成,支持多样化的身份和精细表情控制,同时具备泛化能力和鲁棒性。

Comments Accepted in CVPR2026. Website: https://junxuan-li.github.io/lca

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05766 2026-04-08 cs.IR 87%

The LLM Effect on IR Benchmarks: A Meta-Analysis of Effectiveness, Baselines, and Contamination

大型语言模型对信息检索基准的影响:有效性、基线和污染的元分析

Moritz Staudinger, Wojciech Kusa, Allan Hanbury

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过分析143篇论文,探讨了LLM对TREC Robust04和DL20基准的有效性影响,发现LLM系统在DL20上提升nDCG@10达8.8%,但存在数据污染问题,影响效果判断。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00022 2026-04-01 cs.CL cs.AI cs.LG 87%

Aleph-Alpha-GermanWeb: Improving German-language LLM pre-training with model-based data curation and synthetic data generation

Aleph-Alpha-GermanWeb:通过基于模型的数据筛选和合成数据生成改进德语LLM预训练

Thomas F Burns, Letitia Parcalabescu, Stephan Wäldchen, Michael Barlow, Gregor Ziegltrum, Volker Stampa, Bastian Harren, Björn Deiseroth

机构 * Aleph Alpha Research(Aleph Alpha 研究)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合启发式与模型筛选技术及合成数据生成的德语数据集筛选流程,构建了628B词的预训练数据集,通过在德语基准测试中显著优于FineWeb2,证明了基于模型的数据筛选和合成数据生成对LLM预训练的提升作用。

Comments 17 pages, 3 figures; published at EACL 2026

Journal ref EACL 2026, volume 1, pages 1267-1283

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02375 2026-03-24 cs.CL cs.AI cs.LG 87%

Pretraining with hierarchical memories: separating long-tail and common knowledge

预训练与层次记忆:区分长尾知识与常识

Hadi Pouransari, David Grangier, C Thomas, Michael Kirchhof, Oncel Tuzel

机构 * Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于层次记忆的预训练方法,通过分离长尾知识与常识,提升模型性能。实验显示,使用内存银行可使小模型性能媲美大模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01268 2026-02-03 cs.CL cs.AI cs.LG stat.ML 87%

AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees

AdaDetectGPT:具有统计保证的自适应检测LLM生成文本

Hongyi Zhou, Jin Zhu, Pingfan Su, Kai Ye, Ying Yang, Shakeel A O B Gavioli-Akilagun, Chengchun Shi

机构 * Department of Mathematics(数学系) Tsinghua University(清华大学) School of Mathematics(数学学院) University of Birmingham(伯明翰大学) Department of Statistics(统计系) LSE London, UK(伦敦经济学院) Department of Statistics and Data Science(统计与数据科学系) Department of Decision Analytics and Operations(决策分析与运营系) City University Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdaDetectGPT通过自适应学习见证函数,提高LLM生成文本检测的性能,改进幅度可达37%。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17300 2025-11-24 cs.CV 87%

MolSight: Optical Chemical Structure Recognition with SMILES Pretraining, Multi-Granularity Learning and Reinforcement Learning

MolSight: 基于SMILES预训练、多粒度学习和强化学习的光学化学结构识别

Wenrui Zhang, Xinggang Wang, Bin Feng, Wenyu Liu

专题命中 预训练与数据 :pretraining(title);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 MolSight通过SMILES预训练、多粒度学习和强化学习,实现高精度的立体化学结构识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00661 2025-11-12 cs.CL cs.AI cs.LG 87%

On the generalization of language models from in-context learning and finetuning: a controlled study

Andrew K. Lampinen, Arslan Chaudhry, Stephanie C. Y. Chan, Cody Wild, Diane Wan, Alex Ku, Jörg Bornschein, Razvan Pascanu, Murray Shanahan, James L. McClelland

机构 * Google DeepMind(谷歌DeepMind) Google DeepMind & Stanford University(谷歌DeepMind与斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments FoRLM workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07033 2025-11-11 cs.CR 87%

Uncovering Pretraining Code in LLMs: A Syntax-Aware Attribution Approach

Yuanheng Li, Zhuoyang Chen, Xiaoyun Liu, Yuhao Wang, Mingwei Liu, Yang Shi, Kaifeng Huang, Shengjie Zhao

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12563 2025-11-06 cs.CL cs.AI cs.LG 87%

MetaSynth: Meta-Prompting-Driven Agentic Scaffolds for Diverse Synthetic Data Generation

Haris Riaz, Sourav Bhabesh, Vinayak Arannil, Miguel Ballesteros, Graham Horwood

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 33 pages, 17 figures. Findings of ACL 2025

Journal ref Findings of the Association for Computational Linguistics: ACL 2025, pp. 18770-18803, Vienna, Austria, 2025. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15990 2025-10-21 cs.LG cs.AI cs.CL 87%

Can GRPO Help LLMs Transcend Their Pretraining Origin?

Kangqi Ni, Zhen Tan, Zijie Liu, Pingzhi Li, Tianlong Chen

机构 * cs.unc.edu(北卡罗来纳大学教堂山分校计算机科学系)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01631 2025-10-03 cs.LG cs.AI cs.CL 87%

Demystifying Synthetic Data in LLM Pre-training: A Systematic Study of Scaling Laws, Benefits, and Pitfalls

Feiyang Kang, Newsha Ardalani, Michael Kuchnik, Youssef Emad, Mostafa Elhoushi, Shubhabrata Sengupta, Shang-Wen Li, Ramya Raghavendra, Ruoxi Jia, Carole-Jean Wu

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published as a Main Conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23543 2025-09-30 q-bio.GN cs.NE q-bio.MN 87%

Contrastive Learning Enhances Language Model Based Cell Embeddings for Low-Sample Single Cell Transcriptomics

Luxuan Zhang, Douglas Jiang, Qinglong Wang, Haoqi Sun, Feng Tian

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

Comments 14 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14332 2025-08-14 cs.CV 87%

ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs

Yin Xie, Kaicheng Yang, Peirou Liang, Xiang An, Yongle Zhao, Yumeng Wang, Ziyong Feng, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22964 2025-08-14 cs.CL cs.AI cs.LG 87%

Exploring Scaling Laws for EHR Foundation Models

Sheng Zhang, Qin Liu, Naoto Usuyama, Cliff Wong, Tristan Naumann, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of Southern California(南加州大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06312 2025-07-23 cs.CV 87%

DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation

Zhitong Xiong, Yi Wang, Weikang Yu, Adam J Stewart, Jie Zhao, Nils Lehmann, Thomas Dujardin, Zhenghang Yuan, Pedram Ghamisi, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments code & weights: https://github.com/xiong-zhitong/DOFA-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10272 2025-05-27 cs.AI cs.CL cs.LG 87%

P$^2$ Law: Scaling Law for Post-Training After Model Pruning

Xiaodong Chen, Yuxuan Hu, Xiaokang Zhang, Yanling Wang, Cuiping Li, Hong Chen, Jing Zhang

机构 * Engineering Research Center of Database and Business Intelligence, MOE, China(数据库与商业智能工程研究中心,教育部,中国) School of Information, Renmin University of China,Beijing, China(信息学院,中国人民大学,北京,中国) Key Laboratory of Data Engineering and Knowledge Engineering, MOE, China(数据工程与知识工程重点实验室,教育部,中国) Zhipu AI, China(智谱AI,中国)

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted as Main of ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01533 2025-05-20 cs.CL cs.AI cs.LG 87%

Enhancing LLM Evaluations: The Garbling Trick

William F. Bradley

机构 * Mirabolic Consulting(Mirabolic咨询公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12427 2025-04-18 cs.CL cs.AI cs.CY cs.LG 87%

Position: The Most Expensive Part of an LLM should be its Training Data

Nikhil Kandpal, Colin Raffel

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01638 2025-04-01 cs.LG cs.AI cs.CL 87%

TimeCMA: Towards LLM-Empowered Multivariate Time Series Forecasting via Cross-Modality Alignment

Chenxi Liu, Qianxiong Xu, Hao Miao, Sun Yang, Lingzheng Zhang, Cheng Long, Ziyue Li, Rui Zhao

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted as an Oral Presentation at AAAI 2025 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16952 2025-03-21 cs.CL cs.AI cs.LG 87%

Data Mixing Laws: Optimizing Data Mixtures by Predicting Language Modeling Performance

Jiasheng Ye, Peiju Liu, Tianxiang Sun, Jun Zhan, Yunhua Zhou, Xipeng Qiu

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments accepted by ICLR2025, camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02304 2025-03-18 cs.CV 87%

A Token-level Text Image Foundation Model for Document Understanding

Tongkun Guan, Zining Wang, Pei Fu, Zhengtao Guo, Wei Shen, Kai Zhou, Tiezhu Yue, Chen Duan, Hao Sun, Qianyi Jiang, Junfeng Luo, Xiaokang Yang

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12372 2025-02-19 cs.CL cs.AI cs.LG 87%

Factual Inconsistency in Data-to-Text Generation Scales Exponentially with LLM Size: A Statistical Validation

Joy Mahapatra, Soumyajit Roy, Utpal Garain

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04419 2025-02-11 cs.LG cs.AI cs.CL 87%

Understanding and Mitigating the Bias Inheritance in LLM-based Data Augmentation on Downstream Tasks

Miaomiao Li, Hao Chen, Yang Wang, Tingyuan Zhu, Weijia Zhang, Kaijie Zhu, Kam-Fai Wong, Jindong Wang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical report; 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏