arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2510.05309 2025-10-08 cs.LG 84%

Gamma Mixture Modeling for Cosine Similarity in Small Language Models

Kevin Player

专题命中 预训练与数据 :language model(title);small language model(title);分类 cs.LG

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09404 2025-10-03 cs.LG 84%

Scaling Laws for Optimal Data Mixtures

Mustafa Shukor, Louis Bethune, Dan Busbridge, David Grangier, Enrico Fini, Alaaeldin El-Nouby, Pierre Ablin

机构 * Sorbonne University(索邦大学) Apple(苹果公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17994 2025-08-26 cs.CL 84%

A Retail-Corpus for Aspect-Based Sentiment Analysis with Large Language Models

Oleg Silcenco, Marcos R. Machad, Wallace C. Ugulino, Daniel Braun

机构 * University of Twente(特文特大学) Marburg University(马尔堡大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments Accepted at ICNLSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02628 2025-06-23 cs.SE cs.AI 84%

Cracks in The Stack: Hidden Vulnerabilities and Licensing Risks in LLM Pre-Training Datasets

Mahmoud Jahanshahi, Audris Mockus

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) University of Tennessee, Knoxville, USA(田纳西大学,基洛纳分校)

专题命中 预训练与数据 :LLM(title);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

Comments Accepted in the Second International Workshop on Large Language Models for Code (LLM4Code 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07479 2025-06-13 cs.CL 84%

Improving Fairness of Large Language Models in Multi-document Summarization

Haoyuan Li, Rui Zhang, Snigdha Chaturvedi

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments Accepted to ACL 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20606 2025-05-28 cs.CL cs.MM 84%

Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation

Dancheng Liu, Amir Nassereldine, Chenhui Xu, Jinjun Xiong

机构 * University at Buffalo(布法罗大学)

专题命中 预训练与数据 :foundation model(title);pretraining(title);分类 cs.CL

Comments in submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13828 2025-05-21 cs.AI 84%

Multimodal RAG-driven Anomaly Detection and Classification in Laser Powder Bed Fusion using Large Language Models

Kiarash Naghavi Khanghah, Zhiling Chen, Lela Romeo, Qian Yang, Rajiv Malhotra, Farhad Imani, Hongyi Xu

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI

Comments ASME 2025 International Design Engineering Technical Conferences and Computers and Information in Engineering Conference IDETC/CIE2025, August 17-20, 2025, Anaheim, CA (IDETC2025-168615)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11525 2025-05-20 cs.CL 84%

Beyond Single-Task: Robust Multi-Task Length Generalization for LLMs

Yi Hu, Shijia Kang, Haotong Yang, Haotian Xu, Muhan Zhang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06166 2025-04-17 cs.CL 84%

Assessing how hyperparameters impact Large Language Models' sarcasm detection performance

Montgomery Gole, Andriy Miranskyy

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments arXiv admin note: substantial text overlap with arXiv:2312.04642

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07633 2024-12-11 cs.CL 84%

ChocoLlama: Lessons Learned From Teaching Llamas Dutch

Matthieu Meeus, Anthony Rathé, François Remy, Pieter Delobelle, Jens-Joris Decorte, Thomas Demeester

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05740 2024-07-10 cs.CL 84%

Do Multilingual Large Language Models Mitigate Stereotype Bias?

Shangrui Nie, Michael Fromm, Charles Welch, Rebekka Görge, Akbar Karimi, Joan Plepi, Nazia Afsan Mowmita, Nicolas Flores-Herr, Mehdi Ali, Lucie Flek

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments 19 pages, 8 figures, C3NLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00368 2024-06-03 cs.CL cs.IR 84%

Improving Text Embeddings with Large Language Models

Liang Wang, Nan Yang, Xiaolong Huang, Linjun Yang, Rangan Majumder, Furu Wei

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments Accepted by ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.02415 2024-05-31 cs.CL 84%

LLaMA Pro: Progressive LLaMA with Block Expansion

Chengyue Wu, Yukang Gan, Yixiao Ge, Zeyu Lu, Jiahao Wang, Ye Feng, Ying Shan, Ping Luo

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

Comments Accepted by ACL 2024, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04763 2024-04-09 cs.CV cs.AI 84%

GenEARL: A Training-Free Generative Framework for Multimodal Event Argument Role Labeling

Hritik Bansal, Po-Nien Kung, P. Jeffrey Brantingham, Kai-Wei Chang, Nanyun Peng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 20 pages, 15 Figures, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17519 2023-07-24 cs.CL 84%

GPT-FinRE: In-context Learning for Financial Relation Extraction using Large Language Models

Pawan Kumar Rajpoot, Ankur Parikh

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2305.02105 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.14095 2022-05-31 cs.CV cs.AI 84%

PyramidCLIP: Hierarchical Feature Alignment for Vision-language Model Pretraining

Yuting Gao, Jinfeng Liu, Zihan Xu, Jun Zhang, Ke Li, Rongrong Ji, Chunhua Shen

专题命中 预训练与数据 :language model(title);pretraining(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03685 2024-05-07 cs.CV cs.AI cs.CL cs.LG 84%

Language-Image Models with 3D Understanding

Jang Hyun Cho, Boris Ivanovic, Yulong Cao, Edward Schmerling, Yue Wang, Xinshuo Weng, Boyi Li, Yurong You, Philipp Krähenbühl, Yan Wang, Marco Pavone

专题命中 预训练与数据 :LLM(abstract,comments);large language model(abstract);language model(abstract);prompting(abstract)

Comments Project page: https://janghyuncho.github.io/Cube-LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20617 2026-08-24 cs.AI cs.LG 新提交 84%

Dual-Cache Latent Space Communication between Heterogeneous Language Models

异构语言模型间的双缓存隐空间通信

Jiyao Liu, Qi Zhang, Yaoyi Jia, Ziwen Kan, Song Wang

机构 * Amazon(亚马逊)

专题命中 预训练与数据 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出XKV协议,解决异构语言模型隐空间通信的三个限制,仅训练转换器,在45个数据集-模型对设置中,其性能、速度均优于现有方法,参数效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15412 2026-08-18 cs.LG cs.AI cs.SE 新提交 84%

Invariant Pretraining for Robust Code Representations

用于鲁棒代码表示的不变预训练

Yifeng He, Yundi Xu, Christopher Castro Gaw Gonzalo, Zili Wang, Hao Chen

机构 * University of California at Davis(加州大学戴维斯分校) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文针对代码表示模型在不变程序下鲁棒性退化问题,提出仅基于代码的不变预训练(InvPT)方法,在克隆检测、代码分类任务上分别提升鲁棒性最高11、19个百分点,同时保持或提升标准准确率。

Comments To appear in LMPL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10473 2026-08-14 cs.LG cs.AI 版本更新 84%

Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning

用于高效在线强化学习微调的无评判者预训练

Daoyi Li, Yixian Zhang, Wenbo Ding, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线转在线强化学习中复用离线评判者导致的适配问题,提出无评判者预训练范式,兼容主流算法且在多任务上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08148 2026-08-11 cs.LG cs.AI 新提交 84%

DoGMA: A Central-Dogma-Guided Foundation Model for Multi-Omics Alignment and Multi-Task Learning in Oncology

DoGMA:一种用于肿瘤学多组学对齐与多任务学习的中心法则引导基础模型

Junfei Ling, Bangzheng Pu, Bingsen Xue, Tianle Li, Ruying Hu, Cheng Jin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出中心法则引导的多组学基础模型DoGMA,通过Transformer-MoE架构结合定向注意力与掩码分层多组学重构预训练,在泛癌多组学下游任务中展现出优异性能,为多组学注意力机制设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06211 2026-08-11 cs.CL cs.AI eess.AS 版本更新 84%

LF${}^{2}$AR: Accounting for Layerwise Dynamics to Improve Multimodal Adaptation of Language Models

LF²AR:考虑分层动态以改进语言模型的多模态适配

Santiago Cuervo, Adel Moumen, Yanis Labrak, Sameer Khurana, Antoine Laurent, Mickael Rouvier, Phil Woodland, Ricard Marxer

机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) Department of Engineering, University of Cambridge, UK(剑桥大学工程系) Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) LIA, Avignon Université, France(法国阿维尼翁大学LIA) LIUM, Le Mans Université, France(法国勒芒大学LIUM) Zenidoc, Marseille, France(法国马赛Zenidoc)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06122 2026-08-10 cs.LG cs.AI 版本更新 84%

Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?

Omar Coser, Antonio Orvieto, Paolo Soda, Loredana Zollo

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。

Comments 21 pages, 7 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05076 2026-08-06 cs.LG cs.AI eess.SP 新提交 84%

MultiPathFormer: Towards a Foundation Model for Multipath Wireless Propagation

MultiPathFormer:迈向多径无线传播的基础模型

Blessed Guda, Kayley Sze, Carlee Joe-Wong

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出MultiPathFormer,以多径传播为预训练对象,结合Environmental RAG机制,在27种环境预训练后,在多项无线通信下游任务中超越SOTA模型,验证了路径级预训练的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06479 2026-07-27 cs.LG cs.AI 版本更新 84%

Pretraining Recurrent Networks without Recurrence

无递归预训练循环网络

Akarsh Kumar, Phillip Isola

机构 * MIT(麻省理工学院)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出监督记忆训练(SMT)方法,通过将循环神经网络训练转化为一步记忆转换标签上的监督学习,实现时间并行训练和稳定梯度路径,优于反向传播通过时间(BPTT)方法。

Comments 30 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 84%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15267 2026-07-17 cs.AI cs.CL 新提交 84%

Pretraining Data Can Be Poisoned through Computational Propaganda

预训练数据可通过计算宣传被下毒

Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(艾伦人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现预训练数据可通过公共讨论界面被下毒,引入HalfLife方法衡量恶意内容,探索在网络规模下毒预训练语料库的可行性,证明估计毒注入重要性,确立第三方网页内容为攻击语言模型预训练的可能载体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04029 2026-07-15 cs.DB cs.AI cs.LG 版本更新 84%

PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models

PluRel: 合成数据解锁关系基础模型的扩展定律

Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec

机构 * Stanford University(斯坦福大学) SAP Labs LLC(SAP实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11508 2026-07-14 cs.LG cs.AI stat.ML 新提交 84%

CDFM: Towards a General-Purpose Causal Discovery Foundation Model

CDFM:迈向通用因果发现基础模型

Jie Qiao, Ruichu Cai, Zijian Li, Weilin Chen, Pengfei Hua, Boyan Xu, Zhengming Chen, Zhifeng Hao, Peng Cui

机构 * School of Computer Science, Guangdong University of Technology, Guangzhou, China(广东技术大学计算机科学学院) College of Mathematics and Computer, Shantou University, Shantou, China(汕头大学数学与计算机学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对因果发现中特定数据集方法的局限,提出通用框架CDFM,通过研究因果可识别性理论边界构建变分框架,将未知因果机制视为潜在变量,经大量合成模型预训练,性能优于传统算法,推动因果发现范式转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03979 2026-07-13 cs.LG cs.AI 版本更新 84%

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

语言模型需要睡眠:学习自我修改和巩固记忆

Ali Behrouz, Farnoosh Hashemi, Adel Javanmard, Vahab Mirrokni

机构 * Google(谷歌) Cornell University(康奈尔大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 受人类学习过程启发,提出“睡眠”范式,通过记忆巩固(知识播种)和梦境(自我改进)两阶段,使模型持续学习、将短期记忆转化为长期知识并自我提升。

Comments A version of this work has been publicly available from September 2025 on OpenReview

详情

展开后加载摘要…

URL PDF HTML 收藏