arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2508.11551 2025-08-19 stat.ML cs.AI cs.LG 84%

ADMIRE-BayesOpt: Accelerated Data MIxture RE-weighting for Language Models with Bayesian Optimization

Shengzhuang Chen, Xu Ouyang, Michael Arthur Leopold Pearce, Thomas Hartvigsen, Jonathan Richard Schwarz

机构 * Thomson Reuters Foundational Research & Imperial College London(汤姆逊·路透基础研究与帝国理工学院伦敦) University of Virginia(弗吉尼亚大学) Graphcore Thomson Reuters Foundational Research(汤姆逊·路透基础研究)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07695 2025-08-01 cs.CL cs.AI 84%

KeyKnowledgeRAG (K^2RAG): An Enhanced RAG method for improved LLM question-answering capabilities

Hruday Markondapatnaikuni, Basem Suleiman, Abdelkarim Erradi, Shijing Chen

机构 * University of Sydney(悉尼大学) University of New South Wales(新南威尔士大学) Qatar University(卡塔尔大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 21 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11588 2025-07-24 q-bio.GN cs.AI cs.LG 84%

SToFM: a Multi-scale Foundation Model for Spatial Transcriptomics

Suyuan Zhao, Yizhen Luo, Ganbo Yang, Yan Zhong, Hao Zhou, Zaiqing Nie

机构 * Department of Computer Science and Tecnology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) School of Mathematical Sciences, Peking University(北京大学数学科学学院) PharMolix Inc.(PharMolix公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Accpeted by ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14141 2025-07-22 eess.SP cs.AI cs.LG 84%

DIVER-0 : A Fully Channel Equivariant EEG Foundation Model

Danny Dongyeop Han, Ahhyun Lucy Lee, Taeyang Lee, Yonghyeon Gwon, Sebin Lee, Seongjin Lee, David Keetae Park, Shinjae Yoo, Jiook Cha, Chun Kee Chung

机构 * snu(首尔国立大学) bnl(布鲁克海文国家实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments 11 pages, 1 figures, ICML 2025 Workshop on GenBio

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14523 2025-07-21 cs.CL cs.AI 84%

Exploring Graph Representations of Logical Forms for Language Modeling

Michael Sullivan

机构 * University at Buffalo(布法罗大学) Saarland University(萨尔兰州大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments To be published in ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11966 2025-07-17 cs.CL cs.AI cs.CY 84%

Toxicity-Aware Few-Shot Prompting for Low-Resource Singlish Translation

Ziyu Ge, Gabriel Chua, Leanne Tan, Roy Ka-Wei Lee

专题命中 预训练与数据 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21018 2025-07-15 cs.CL cs.LG 84%

HYPEROFA: Expanding LLM Vocabulary to New Languages via Hypernetwork-Based Embedding Initialization

Enes Özeren, Yihong Liu, Hinrich Schütze

机构 * LMU Munich(慕尼黑莱布尼茨大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 预训练与数据 :LLM(title);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments 18 pages, 3 figures, 15 tables. After ACL reviews: Corrected typos, Table 4 caption updated and the order of the results changed, numbers are unchanged. This paper will appear in ACL SRW 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01450 2025-07-15 cs.LG cs.CL 84%

CASCADE Your Datasets for Cross-Mode Knowledge Retrieval of Language Models

Runlong Zhou, Yi Zhang

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12370 2025-07-04 cs.LG cs.AI 84%

Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models

Samira Abnar, Harshay Shah, Dan Busbridge, Alaaeldin Mohamed Elnouby Ali, Josh Susskind, Vimal Thilak

机构 * Apple(苹果公司) MIT(麻省理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01844 2025-07-03 cs.CL cs.LG 84%

Low-Perplexity LLM-Generated Sequences and Where To Find Them

Arthur Wuhrmann, Anastasiia Kucherenko, Andrei Kucharavy

机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Institute of Entrepreneurship and Management, HES-SO Valais-Wallis(企业家与管理学院) Institute of Informatics, HES-SO Valais-Wallis(信息学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Camera-ready version. Accepted to ACL 2025. 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01045 2025-07-03 cs.LG cs.AI eess.SP 84%

Sensing Cardiac Health Across Scenarios and Devices: A Multi-Modal Foundation Model Pretrained on Heterogeneous Data from 1.7 Million Individuals

Xiao Gu, Wei Tang, Jinpei Han, Veer Sangha, Fenglin Liu, Shreyank N Gowda, Antonio H. Ribeiro, Patrick Schwab, Kim Branson, Lei Clifton, Antonio Luiz P. Ribeiro, Zhangdaihong Liu, David A. Clifton

机构 * University of Oxford(牛津大学) University of Nottingham(诺丁汉大学) Uppsala University(乌普萨拉大学) GlaxoSmithKline(葛兰素史克)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21803 2025-06-30 eess.SP cs.AI cs.LG 84%

From Token to Rhythm: A Multi-Scale Approach for ECG-Language Pretraining

Fuying Wang, Jiacheng Xu, Lequan Yu

机构 * School of Computing and Data Science, The University of Hong Kong, Hong Kong SAR, China(计算与数据科学学院,香港大学,香港特别行政区,中国)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21071 2025-06-27 cs.LG cs.CL 84%

Enhancing LLM Tool Use with High-quality Instruction Data from Knowledge Graph

Jingwei Wang, Zai Zhang, Hao Qian, Chunjing Gan, Binbin Hu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou, Bin Shi, Bo Dong

机构 * Ant Group, China(蚂蚁集团) School of Computer Science and Technology, Xi’an Jiaotong University, China(西安交通大学计算机科学与技术学院) School of Distance Education, Xi’an Jiaotong University, China(西安交通大学继续教育学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20249 2025-06-26 cs.AI cs.CL cs.MA 84%

Language Modeling by Language Models

Junyan Cheng, Peter Clark, Kyle Richardson

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14709 2025-06-23 cs.CL cs.LG 84%

Group-Level Data Selection for Efficient Pretraining

Zichun Yu, Fei Peng, Jie Lei, Arnold Overwijk, Wen-tau Yih, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学) Meta

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14761 2025-06-18 cs.CL cs.AI 84%

From Bytes to Ideas: Language Modeling with Autoregressive U-Nets

Mathurin Videau, Badr Youbi Idrissi, Alessandro Leite, Marc Schoenauer, Olivier Teytaud, David Lopez-Paz

机构 * FAIR at Meta TAU, INRIA LISN, CNRS \& Université Paris-Saclay

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12442 2025-06-18 cs.CR cs.AI cs.CL 84%

IP Leakage Attacks Targeting LLM-Based Multi-Agent Systems

Liwen Wang, Wenxuan Wang, Shuai Wang, Zongjie Li, Zhenlan Ji, Zongyi Lyu, Daoyuan Wu, Shing-Chi Cheung

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07827 2025-06-13 cs.LG cs.AI 84%

Implicit Language Models are RNNs: Balancing Parallelization and Expressivity

Mark Schöne, Babak Rahmani, Heiner Kremer, Fabian Falck, Hitesh Ballani, Jannes Gladrow

机构 * Chair of Highly-Parallel VLSI Systems and Neuro-Microelectronics , TUD Dresden University of Technology, Dresden, Germany(德累斯顿技术大学神经微电子学系) Microsoft Research, Cambridge, United Kingdom(微软研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments 25 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05568 2025-06-12 cs.LG cs.AI cs.DB 84%

Griffin: Towards a Graph-Centric Relational Database Foundation Model

Yanbo Wang, Xiyuan Wang, Quan Gan, Minjie Wang, Qibin Yang, David Wipf, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Amazon Web Services(亚马逊网络服务)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Published at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01716 2025-06-03 cs.AI cs.CL 84%

Self-Challenging Language Model Agents

Yifei Zhou, Sergey Levine, Jason Weston, Xian Li, Sainbayar Sukhbaatar

机构 * UC Berkeley(伯克利大学) FAIR at Meta(Meta 公司人工智能研究部)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06042 2025-05-28 cs.LG cs.CL 84%

Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection

Louis Bethune, David Grangier, Dan Busbridge, Eleonora Gualdoni, Marco Cuturi, Pierre Ablin

机构 * Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 19 pages, 15 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20225 2025-05-27 cs.CL cs.LG 84%

FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models

Hao Kang, Zichun Yu, Chenyan Xiong

机构 * Language Technologies Institute(语言技术研究所) School of Computer Science(计算机科学学院) Foundation and Language Model Center(基础与语言模型中心)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments All code, training logs, and model checkpoints are available at https://github.com/cmu-flame/FLAME-MoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19548 2025-05-27 cs.CL cs.AI 84%

How Syntax Specialization Emerges in Language Models

Xufeng Duan, Zhaoqian Yao, Yunhao Zhang, Shaonan Wang, Zhenguang G. Cai

机构 * Department of Linguistics and Modern Languages, The Chinese University of Hong Kong(香港中文大学语言学与现代语言系) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Brain and Mind Institute, The Chinese University of Hong Kong(香港中文大学脑科学与心灵研究所)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05564 2025-05-27 cs.LG cs.AI 84%

TabICL: A Tabular Foundation Model for In-Context Learning on Large Data

Jingang Qu, David Holzmüller, Gaël Varoquaux, Marine Le Morvan

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Published at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02792 2025-05-26 cs.RO cs.AI cs.LG 84%

Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets

Chuning Zhu, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, Abhishek Gupta

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04614 2025-05-23 cs.LG cs.CL 84%

Extractive Structures Learned in Pretraining Enable Generalization on Finetuned Facts

Jiahai Feng, Stuart Russell, Jacob Steinhardt

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10134 2025-05-16 eess.SP cs.AI cs.LG 84%

Large Wireless Localization Model (LWLM): A Foundation Model for Positioning in 6G Networks

Guangjin Pan, Kaixuan Huang, Hui Chen, Shunqing Zhang, Christian Häger, Henk Wymeersch

机构 * Department of Electrical Engineering, Chalmers University of Technology(楚德大学电气工程系) School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Chalmers AI Research Center Consortium (CHAIR)(楚德人工智能研究中心联盟) National Academic Infrastructure for Supercomputing in Sweden (NAISS)(瑞典国家学术超级计算基础设施) SNS JU project 6G-DISAC under the EU’s Horizon Europe research and innovation Program(欧盟地平线欧洲研究与创新计划下的SNS JU项目6G-DISAC) Swedish Foundation for Strategic Research (SSF)(瑞典战略研究基金会) Chalmers Areas of Advance in ICT and Transport(楚德信息与交通领域先进领域)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments 13 pages,16 figures.This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11758 2025-05-16 cs.RO cs.CL cs.CV cs.LG 84%

Latent Action Pretraining from Videos

Seonghyeon Ye, Joel Jang, Byeongguk Jeon, Sejune Joo, Jianwei Yang, Baolin Peng, Ajay Mandlekar, Reuben Tan, Yu-Wei Chao, Bill Yuchen Lin, Lars Liden, Kimin Lee, Jianfeng Gao, Luke Zettlemoyer, Dieter Fox, Minjoon Seo

机构 * KAIST(韩国科学技术院) University of Washington(华盛顿大学) Microsoft Research(微软研究院) NVIDIA(英伟达) Allen Institute for AI(人工智能算法研究所)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

Comments ICLR 2025 Website: https://latentactionpretraining.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09519 2025-05-12 cs.CL cs.AI 84%

Talking Heads: Understanding Inter-layer Communication in Transformer Language Models

Jack Merullo, Carsten Eickhoff, Ellie Pavlick

机构 * Department of Computer Science(计算机科学系) Brown University(布朗大学) School of Medicine(医学院) University of Tübingen(图宾根大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Neurips 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00903 2025-05-05 cs.LG cs.CL 84%

NeMo-Inspector: A Visualization Tool for LLM Generation Analysis

Daria Gitman, Igor Gitman, Evelina Bakhturina

机构 * NVIDIA Corporation(英伟达公司)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Presented at the NAACL 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏