arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2506.04079 2025-06-18 cs.CL cs.AI cs.LG 83%

EuroLLM-9B: Technical Report

Pedro Henrique Martins, João Alves, Patrick Fernandes, Nuno M. Guerreiro, Ricardo Rei, Amin Farajian, Mateusz Klimaszewski, Duarte M. Alves, José Pombal, Nicolas Boizard, Manuel Faysse, Pierre Colombo, François Yvon, Barry Haddow, José G. C. de Souza, Alexandra Birch, André F. T. Martins

机构 * Unbabel Instituto de Telecomunicações & Instituto Superior Técnico, Universidade de Lisboa(电信研究院 & 莱斯特大学技术学院) Carnegie Mellon University(卡内基梅隆大学) MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央圣埃克苏佩里学院、巴黎萨克雷大学) Illuin Technology(Illuin技术公司) University of Edinburgh(爱丁堡大学) Equall(Equall公司) Aveni(Aveni公司) Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) Diabolocom(Diabolocom公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00070 2025-05-05 cs.CL cs.AI cs.LG 83%

ICLR: In-Context Learning of Representations

Core Francisco Park, Andrew Lee, Ekdeep Singh Lubana, Yongyi Yang, Maya Okawa, Kento Nishi, Martin Wattenberg, Hidenori Tanaka

机构 * CBS-NTT Program in Physics of Intelligence, Harvard University(哈佛大学物理智能联合项目) Department of Physics, Harvard University(哈佛大学物理系) Physics & Informatics Lab, NTT Research Inc.(NTT研究公司物理与信息学实验室) SEAS, Harvard University(哈佛大学科学与工程学院) CSE, University of Michigan, Ann Arbor(密歇根大学安娜堡分校计算机科学系)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments ICLR 2025

Journal ref International Conference on Learning Representations, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12963 2025-05-01 cs.CL cs.AI cs.LG 83%

Open Llama2 Model for the Lithuanian Language

Artūras Nakvosas, Povilas Daniušis, Vytas Mulevičius

机构 * Neurotechnology(神经技术)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 12 pages, 8 figures, 5 tables

Journal ref Informatica, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17115 2025-02-17 cs.CL cs.AI cs.LG 83%

Programming Every Example: Lifting Pre-training Data Quality Like Experts at Scale

Fan Zhou, Zengzhi Wang, Qian Liu, Junlong Li, Pengfei Liu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments 47 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08394 2025-01-03 cs.CV 83%

VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks

Jiannan Wu, Muyan Zhong, Sen Xing, Zeqiang Lai, Zhaoyang Liu, Zhe Chen, Wenhai Wang, Xizhou Zhu, Lewei Lu, Tong Lu, Ping Luo, Yu Qiao, Jifeng Dai

专题命中 预训练与数据 :large language model(title);language model(title)

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11303 2024-12-30 cs.LG cs.AI cs.CL 83%

TSDS: Data Selection for Task-Specific Model Finetuning

Zifan Liu, Amin Karbasi, Theodoros Rekatsinas

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);instruction tuning(abstract);pretraining(abstract)

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17747 2024-12-24 cs.CL cs.AI cs.LG 83%

Deliberation in Latent Space via Differentiable Cache Augmentation

Luyang Liu, Jonas Pfeiffer, Jiaxing Wu, Jun Xie, Arthur Szlam

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14670 2024-10-31 cs.CL cs.AI cs.LG 83%

Exploring Design Choices for Building Language-Specific LLMs

Atula Tejaswi, Nilesh Gupta, Eunsol Choi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11402 2024-10-24 cs.CL cs.AI cs.CV cs.LG cs.MM 83%

NVLM: Open Frontier-Class Multimodal LLMs

Wenliang Dai, Nayeon Lee, Boxin Wang, Zhuolin Yang, Zihan Liu, Jon Barker, Tuomas Rintamaki, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Fixed the typos. For more information, please visit our project page at: https://research.nvidia.com/labs/adlr/NVLM-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13861 2024-10-22 cs.CV 83%

PUMA: Empowering Unified MLLM with Multi-granular Visual Generation

Rongyao Fang, Chengqi Duan, Kun Wang, Hao Li, Hao Tian, Xingyu Zeng, Rui Zhao, Jifeng Dai, Hongsheng Li, Xihui Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);instruction tuning(abstract)

Comments Project page: https://rongyaofang.github.io/puma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18369 2024-10-04 cs.CL cs.AI cs.LG 83%

PromptWizard: Task-Aware Prompt Optimization Framework

Eshaan Agarwal, Joykirat Singh, Vivek Dani, Raghav Magazine, Tanuja Ganu, Akshay Nambi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13359 2024-09-13 cs.CL cs.AI cs.LG 83%

Power Scheduler: A Batch Size and Token Number Agnostic Learning Rate Scheduler

Yikang Shen, Matthew Stallone, Mayank Mishra, Gaoyuan Zhang, Shawn Tan, Aditya Prasad, Adriana Meza Soria, David D. Cox, Rameswar Panda

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01420 2024-08-05 cs.LG cs.AI cs.CL 83%

Mission Impossible: A Statistical Perspective on Jailbreaking LLMs

Jingtong Su, Julia Kempe, Karen Ullrich

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01783 2024-02-06 cs.CL cs.AI cs.LG 83%

Hierarchical Multi-Label Classification of Online Vaccine Concerns

Chloe Qinyu Zhu, Rickard Stureborg, Bhuwan Dhingra

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Published in AAAI 2024 Health Intelligence workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02125 2023-12-07 cs.CL cs.AI cs.LG 83%

TPPoet: Transformer-Based Persian Poem Generation using Minimal Data and Advanced Decoding Techniques

Amir Panahandeh, Hanie Asemi, Esmaeil Nourani

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01218 2023-10-03 cs.CV 83%

Making LLaMA SEE and Draw with SEED Tokenizer

Yuying Ge, Sijie Zhao, Ziyun Zeng, Yixiao Ge, Chen Li, Xintao Wang, Ying Shan

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Project released at: https://github.com/AILab-CVC/SEED. arXiv admin note: substantial text overlap with arXiv:2307.08041

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11206 2023-05-22 cs.CL cs.AI cs.LG 83%

LIMA: Less Is More for Alignment

Chunting Zhou, Pengfei Liu, Puxin Xu, Srini Iyer, Jiao Sun, Yuning Mao, Xuezhe Ma, Avia Efrat, Ping Yu, Lili Yu, Susan Zhang, Gargi Ghosh, Mike Lewis, Luke Zettlemoyer, Omer Levy

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-08-18 cs.CL 版本更新 83%

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18383 2026-08-14 cs.LG 版本更新 83%

TabH2O: A Unified Foundation Model for Tabular Prediction

TabH2O:用于表格预测的统一基础模型

Pascal Pfeiffer, Dmitry Gordeev, Mathias Müller, Laura Fink, Joan Salvà Soler, Mark Landry, Branden Murray, Marcos V. Conde, Sri Satish Ambati

机构 * H2O.ai

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TabH2O,一种统一的基础模型,通过上下文学习在单次前向传递中实现分类和回归。该模型基于TabICL架构进行了关键改进,包括统一训练、单阶段预训练和噪声感知预训练,从而在表格数据预测任务中表现出色。

Comments Technical Report - https://tabh2o.h2oai.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10595 2026-08-12 q-bio.BM cs.AI 新提交 83%

DegradeQuery: Counterfactual Tuple Pretraining for Context-Aware PROTAC Degradation Prediction

DegradeQuery:面向上下文感知PROTAC降解预测的反事实元组预训练

Dong Xu, Zhangfan Yang, Jiantao Wu, Zexuan Zhu, Jianqiang Li, Junkai Ji

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 DegradeQuery是一种上下文感知PROTAC降解预测框架,通过反事实元组预训练利用标签缺失的PROTAC记录,在PROTAC-8K基准上AUC达0.9065、准确率0.8500,性能优于对比方法。

Comments 19 pages, 2 figures, with supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09558 2026-08-11 cs.LG cs.NA math.NA math.ST stat.TH 新提交 83%

Training-Free Universal Approximation by Prompting Random Transformers

通过提示随机Transformer实现无训练的通用逼近

Alexander Hsu, Rongjie Lai

机构 * Purdue University(普渡大学)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 该研究证明预训练Transformer可选,随机未训练的单层softmax注意力网络经软提示引导可实现通用逼近,其继承核回归的极小极大最优速率,还揭示了提示相关参数的权衡关系。

Comments 31 pages, 5 figures. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06659 2026-08-10 cs.AI 新提交 83%

CellWorld: From Gene-Level Reconstruction to Latent Cell Prediction in Spatial Transcriptomics Foundation Models

CellWorld:空间转录组学基础模型中从基因水平重建到潜在细胞预测

Haiping Liu, Qian Zhao, Lijing Lin, Jingyuan Sun, Hongpeng Zhou

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出CellWorld,将空间转录组学基础模型的预测目标从基因测量转向潜在细胞表示,在多基准测试中其性能优于现有基线,仅用5%语料库预训练的大型模型也表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05000 2026-08-07 cs.CV cs.LG cs.MM 版本更新 83%

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

机构 * FAIR, Meta(Meta FAIR研究院) Reality Labs, Meta(Meta Reality Labs) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。

Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03949 2026-08-07 cs.CV cs.LG 版本更新 83%

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

TESSERA v2:扩展逐像素地球基础模型

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

机构 * University of Cambridge(剑桥大学) NVIDIA(英伟达) dClimate Labs(dClimate实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究逐像素地球观测基础模型的扩展及预训练预算分配,通过大规模实验发现预训练损失难预测下游性能,给出计算分配规则,训练并蒸馏模型,其成果优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05028 2026-08-06 cs.CL 新提交 83%

Language Models Generalize to Human-like Word Order Preferences

语言模型可泛化出类人的词序偏好

Amanda Popadich, Shane Steinert-Threlkeld

机构 * University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究发现不同规模的语言模型可从贫乏输入中泛化出类人的范围同态名词短语修饰语顺序偏好,且该偏好无法用点互信息解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04268 2026-08-06 cs.CL 新提交 83%

The Fairness Collapse Phenomenon: Bias Amplification in Language Models Trained on Synthetic Data

公平性崩溃现象:在合成数据上训练的语言模型中的偏差放大

Irina Proskurina, Antoine Gourru, Julien Velcin

机构 * Laboratoire Hubert Curien(于贝尔·屈里安实验室) CNRS(法国国家科学研究中心) Université Claude Bernard Lyon 1(里昂第一大学) Université Lumière Lyon 2(里昂第二大学) École Centrale de Lyon(里昂中央理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 该研究发现,在合成数据上反复训练语言模型会出现公平性崩溃,即偏差在标准指标未明显下降时悄然放大,揭示了合成数据污染的关键风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03457 2026-08-05 cs.AI 新提交 83%

LLaDA MoE v2: Scaling Mixture-of-Experts Diffusion Language Models

LLaDA MoE v2:扩展混合专家扩散语言模型

Fengqi Zhu, Shaoxuan Xu, Jingyang Ou, Zebin You, Yipeng Xing, Huabin Liu, Xiaolu Zhang, Jun Zhou, Zhenzhong Lan, Yankai Lin, Wayne Xin Zhao, Jianguo Li, Chongxuan Li, Ji-Rong Wen

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 该研究明确MoE扩散语言模型的扩展规律,训练30B-A3B的LLaDA MoE v2,其预训练令牌量为Qwen3的65%,经微调后在多数推理编码基准上优于SDAR Chat且接近Qwen3。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00114 2026-08-04 eess.SP cs.AI 新提交 83%

EEG-JEPA: Structured Latent Prediction for EEG Foundation Models

EEG-JEPA:用于脑电基础模型的结构化隐变量预测

Jinhao Li, Zhiyuan Ma, Xueqiao Han, Zhongye Xia, Xinche Zhang, Shanghong Xie, Yixuan Liu, Yongjian Li, Runmin Gan, Tianlin Huo, Sen Song

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本研究提出EEG-JEPA结构化隐变量预测框架,通过优化目标设计提升EEG基础模型性能,在EEG-FM-Bench等基准上实现了14任务、9任务的平衡准确率提升,为EEG基础建模提供了新方案。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02252 2026-08-04 cs.CV cs.AI 新提交 83%

HarMoE: Multi-Source Chest Radiograph Pretraining with Dataset-Disentangled Experts

HarMoE:基于数据集解耦专家的多源胸部X射线预训练

Haozhe Luo, Ziyu Zhou, Shelley Zixin Shu, Mauricio Reyes

机构 * University of Bern(伯尔尼大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出HarMoE框架,通过解耦数据集专家从异构胸部X射线数据集学习,提升了放射学视觉-语言模型的零样本分类、分布外迁移等性能,相关代码与87.3万份数据集将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01898 2026-08-04 cs.LG 新提交 83%

Understanding and Correcting Low-Frequency Bias in EEG Foundation Model

脑电(EEG)基础模型中低频偏差的理解与修正

Junjie Yu, Zihan Deng, Jianyu Zhang, Junrong Mu, Jiahui An, Wenxiao Ma, Ziling Lu, Yue Wang, Yan Zhu, Kexin Lou, Quanying Liu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 针对EEG基础模型存在的低频偏差问题,提出频率平衡掩码自编码框架FAME,在OmniEEG-Bench的41项下游任务中24项达到SOTA,凸显平衡频谱监督的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏