arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2605.18552 2026-05-19 cs.LG q-bio.BM q-bio.QM 74%

Protein Fold Classification at Scale: Benchmarking and Pretraining

大规模蛋白质折叠分类:基准测试与预训练

Dexiong Chen, Andrei Manolache, Mathias Niepert, Karsten Borgwardt

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所) Computer Science Department, University of Stuttgart(斯图加特大学计算机科学系)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本文提出TEDBench,一个大规模非冗余的蛋白质折叠分类基准,通过Encyclopedia of Domains和Foldseek-clustered AlphaFold结构构建。基于此基准,作者提出Masked Invariant Autoencoders (MiAE)框架,通过高掩码率和SE(3)不变编码器实现蛋白质结构表示学习,从而在TEDBench上取得优异性能。

Comments Accepted at ICML 2026 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08704 2026-05-19 cs.CV cs.LG 74%

Rethinking Generative Image Pretraining: How Far Are We From Scaling Up Next-Pixel Prediction?

重新思考生成图像预训练:我们离扩大下一步像素预测还有多远?

Xinchen Yan, Chen Liang, Lijun Yu, Adams Wei Yu, Yifeng Lu, Quoc V. Le

机构 * Google Deepmind(谷歌DeepMind)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本文研究了自回归下一步像素预测的扩展特性,探讨了统一视觉模型中简单且端到端但尚未充分探索的框架。通过在32x32分辨率的图像上训练Transformer模型,评估了三个目标指标:下一步像素预测目标、ImageNet分类准确率和基于生成的完成度(通过Fr'echet距离测量)。研究发现,最优扩展策略高度依赖任务,且随着图像分辨率的增加,模型大小必须比数据量增长得更快。通过预测发现,计算能力是主要瓶颈,而非训练数据量。随着计算能力每年增长四到五倍,预计在五年内可实现像素级图像建模。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12946 2026-04-15 cs.LG 74%

Parcae: Scaling Laws For Stable Looped Language Models

Parcae:稳定循环语言模型的扩展定律

Hayden Prairie, Zachary Novack, Taylor Berg-Kirkpatrick, Daniel Y. Fu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Together AI

专题命中 预训练与数据 :language model(title);分类 cs.LG

AI总结 本文提出Parcae,一种稳定的循环架构,通过限制注入参数的谱范数来解决现有循环架构的不稳定性问题,实验表明其在验证 perplexity 和测试性能上均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00066 2026-04-02 cs.LG 74%

Evolution Strategies for Deep RL pretraining

深度强化学习预训练的进化策略

Adrian Martínez, Ananya Gupta, Hanka Goralija, Mario Rico, Saúl Fenollosa, Tamar Alphaidze

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 研究比较了进化策略与深度强化学习在不同难度任务中的性能,发现ES在简单任务中可提升DRL效果,但复杂任务中表现不优。

Comments 12 pages, 3 figures, 2 algorithms; EE-568 Reinforcement learning course project

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29974 2026-04-01 cs.LG 74%

Meteorology-Driven GPT4AP: A Multi-Task Forecasting LLM for Atmospheric Air Pollution in Data-Scarce Settings

气象驱动的GPT4AP:一种用于数据稀少环境的多任务预测LLM

Prasanjit Dey, Soumyabrata Dev, Bianca Schoen-Phelan

机构 * ADAPT SFI Research Centre, School of Computer Science, Technological University Dublin(ADAPT SFI研究中心,计算机科学学院,都柏林理工大学) ADAPT SFI Research Centre, School of Computer Science, University College Dublin(ADAPT SFI研究中心,计算机科学学院,都柏林大学学院) School of Computer Science, Technological University Dublin(计算机科学学院,都柏林理工大学)

专题命中 预训练与数据 :LLM(title);分类 cs.LG

AI总结 本文提出GPT4AP,一种基于预训练GPT-2和rsLoRA的高效多任务预测框架,用于数据稀少环境下的大气污染预测,展示了其在少样本、零样本和长期预测中的优越性能。

Comments This manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22053 2026-03-24 cs.SD cs.LG 74%

AnimalCLAP: Taxonomy-Aware Language-Audio Pretraining for Species Recognition and Trait Inference

AnimalCLAP:基于物种分类的语言-音频预训练用于物种识别和特征推断

Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Hiroaki Santo, Fumio Okura

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 AnimalCLAP通过整合生物层级信息,利用新的数据集和模型提升物种识别和特征推断性能,优于CLAP模型。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04657 2026-03-06 cs.CL cs.CY physics.ed-ph 74%

Stan: An LLM-based thermodynamics course assistant

Stan:基于LLM的热力学课程助教

Eric M. Furst, Vasudevan Venkateshwaran

机构 * Department of Chemical Biomolecular Engineering, Allan P.\ Colburn Laboratory, University of Delaware, Newark, DE 19716, USA

专题命中 预训练与数据 :LLM(title);分类 cs.CL

AI总结 Stan是一种基于LLM的热力学课程助教系统,通过本地硬件运行,提供学生查询回答和教师教学记录支持,确保数据隐私和可重复性。

Comments 17 pages, 6 figures. For associated code repository, see https://github.com/EntropicLearners/stan.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19004 2026-02-04 cs.CL 74%

Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations

破损的标记?你的语言模型可以秘密处理非标准标记化

Brian Siyuan Zheng, Alisa Liu, Orevaoghene Ahia, Jonathan Hayase, Yejin Choi, Noah A. Smith

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 研究发现语言模型在面对非标准标记化时表现出意外的鲁棒性,通过指令训练可提升特定任务性能,揭示模型对标记化的依赖程度较低。

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13055 2026-01-29 eess.SP cs.LG 74%

Simplicity is Key: An Unsupervised Pretraining Approach for Sparse Radio Channels

简洁是关键:一种用于稀疏无线信道的无监督预训练方法

Jonathan Ott, Maximilian Stahlke, Tobias Feigl, Bjoern M. Eskofier, Christopher Mutschler

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 SpaRTran通过捕捉无线传播的稀疏性作为无监督学习目标,提高了无线信道的定位精度和波束成形性能。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24992 2026-01-19 cs.CL eess.AS 74%

POWSM: A Phonetic Open Whisper-Style Speech Foundation Model

POWSM:一种基于语音的开放式耳语风格语音基础模型

Chin-Jou Li, Kalvin Chang, Shikhar Bharadwaj, Eunjung Yeo, Kwanghee Choi, Jian Zhu, David Mortensen, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :foundation model(title);分类 cs.CL

AI总结 POWSM是一种能够联合执行多种语音任务的统一框架,实现了音频、文本和音素之间的无缝转换,并在低资源条件下提升了语音处理性能。

Comments 18 pages, under review. Model available at https://huggingface.co/espnet/powsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06159 2026-01-13 cs.LG 74%

Can we Improve Prediction of Psychotherapy Outcomes Through Pretraining With Simulated Data?

能否通过预训练模拟数据来提高心理治疗效果的预测?

Niklas Jacobs, Manuel C. Voelkle, Norbert Kathmann, Kevin Hilbert

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本文通过预训练模拟数据提升心理治疗效果预测,发现预训练方法在部分情况下表现不显著,而仅用真实数据训练的随机森林在第二项研究中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17209 2026-01-13 cs.CL 74%

Prompt-Based Simplification for Plain Language using Spanish Language Models

基于提示的西班牙语模型用于普通语言简化

Lourdes Moreno, Jesus M. Sanchez-Gomez, Marco Antonio Sanchez-Escudero, Paloma Martínez

机构 * HULAT-UC3M

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 本文提出利用西班牙语模型和提示工程策略,实现文本到普通语言的转换,通过评估不同模型和提示组合,优化语义相似度和可读性。

Comments 11 pages, 7 tables,

Journal ref CEUR Workshop Proceedings, Vol. 4098 (IberLEF 2025), paper 6, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18770 2026-01-06 cs.CV cs.AI cs.IR 74%

Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships

通过利用一对一关系进行多模态对抗防御以提升视觉语言模型

Futa Waseda, Antonio Tejero-de-Pablos, Isao Echizen

机构 * The University of Tokyo(东京大学) CyberAgent National Institute of Informatics(信息处理研究所)

专题命中 预训练与数据 :language model(title);分类 cs.AI

AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。

Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10829 2025-11-17 cs.LG 74%

Towards Universal Neural Operators through Multiphysics Pretraining

Mikhail Masliaev, Dmitry Gusarov, Ilya Markov, Alexander Hvatov

机构 * ITMO University(ITMO大学)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

Comments 5 pages, 1 figure, accepted for Machine Learning and the Physical Sciences Workshop, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08199 2025-11-12 cs.CL 74%

Do Syntactic Categories Help in Developmentally Motivated Curriculum Learning for Language Models?

Arzu Burcu Güven, Anna Rogers, Rob van der Goot

机构 * IT University of Copenhagen(哥本哈根IT大学)

专题命中 预训练与数据 :language model(title);分类 cs.CL

Journal ref Proceedings of the First BabyLM Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05135 2025-11-10 cs.CL 74%

ManufactuBERT: Efficient Continual Pretraining for Manufacturing

Robin Armingaud, Romaric Besançon

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments Submitted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21326 2025-10-27 cs.CL 74%

Typoglycemia under the Hood: Investigating Language Models' Understanding of Scrambled Words

Gianluca Sperduti, Alejandro Moreo

机构 * Institute of Information Science and Technologies National Research Council University of Pisa(信息科学与技术研究所国家研究 council 皮萨大学)

专题命中 预训练与数据 :language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16088 2025-09-22 cs.LG 74%

Randomized Smoothing Meets Vision-Language Models

Emmanouil Seferis, Changshun Wu, Stefanos Kollias, Saddek Bensalem, Chih-Hong Cheng

机构 * National Technical University of Athens(希腊雅典国家技术大学) Université Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CSX-AI(CSX-AI公司) Carl von Ossietzky University of Oldenburg(奥尔登堡卡尔·冯·奥西特齐大学) Chalmers University of Technology(查尔姆斯理工大学)

专题命中 预训练与数据 :language model(title);分类 cs.LG

Comments EMNLP'25 full version, including appendix (proofs, additional experiments)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15277 2025-09-22 cs.MM cs.LG 74%

Copycat vs. Original: Multi-modal Pretraining and Variable Importance in Box-office Prediction

Qin Chao, Eunsoo Kim, Boyang Li

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Business School, University of Seoul, Republic of Korea(商学学院,首尔大学,韩国) Alibaba Group and the Alibaba-NTU Joint Research Institute, Singapore(阿里巴巴集团及阿里巴巴-南洋理工大学联合研究机构,新加坡)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00920 2025-08-13 physics.chem-ph cs.LG 74%

Uni-Mol3: A Multi-Molecular Foundation Model for Advancing Organic Reaction Modeling

Lirong Wu, Junjie Wang, Zhifeng Gao, Xiaohong Ji, Rong Zhu, Xinyu Li, Linfeng Zhang, Guolin Ke, Weinan E

机构 * AI for Science Institute(人工智能科学研究院) DP Technology(DP技术) College of Chemistry and Molecular Engineering(化学与分子工程学院) School of Mathematical Sciences(数学科学学院) Center for Machine Learning Research(机器学习研究中心)

专题命中 预训练与数据 :foundation model(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00913 2025-08-05 cs.CV cs.LG 74%

TESPEC: Temporally-Enhanced Self-Supervised Pretraining for Event Cameras

Mohammad Mohammadi, Ziyi Wu, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

Comments Accepted at IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01182 2025-07-10 cs.RO cs.AI 74%

Humanoid World Models: Open World Foundation Models for Humanoid Robotics

Muhammad Qasim Ali, Aditya Sridhar, Shahbuland Matiana, Alex Wong, Mohammad Al-Sharman

机构 * University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :foundation model(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14114 2025-06-18 cs.LG 74%

Evaluating Loss Functions for Graph Neural Networks: Towards Pretraining and Generalization

Khushnood Abbas, Ruizhe Hou, Zhou Wengang, Dong Shi, Niu Ling, Satyaki Nan, Alireza Abbasi

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

Comments ACM single column 633 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06337 2025-06-13 cs.LG 74%

Pretraining Generative Flow Networks with Inexpensive Rewards for Molecular Graph Generation

Mohit Pandey, Gopeshh Subbaraj, Artem Cherkasov, Martin Ester, Emmanuel Bengio

机构 * Vancouver Prostate Centre, The University of British Columbia(温哥华前列腺中心、不列颠哥伦比亚大学) Mila - Quebec AI Institute, Université de Montréal(魁北克人工智能研究所、蒙特利尔大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2409.09702

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02595 2025-06-03 cs.CL 74%

Nemotron-CC: Transforming Common Crawl into a Refined Long-Horizon Pretraining Dataset

Dan Su, Kezhi Kong, Ying Lin, Joseph Jennings, Brandon Norick, Markus Kliegl, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

机构 * NVIDIA

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01711 2025-05-20 cs.IR cs.CL 74%

MAPS: Motivation-Aware Personalized Search via LLM-Driven Consultation Alignment

Weicong Qin, Yi Xu, Weijie Yu, Chenglei Shen, Ming He, Jianping Fan, Xiao Zhang, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) University of International Business and Economics(国际商务经济大学) AI Lab at Lenovo Research, Lenovo Group Limited(联想集团研究院人工智能实验室)

专题命中 预训练与数据 :LLM(title);分类 cs.CL

Comments accepted to ACL 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06604 2025-05-19 cs.CL 74%

Do we really have to filter out random noise in pre-training data for language models?

Jinghan Ru, Yuxin Xie, Xianwei Zhuang, Yuguo Yin, Zhihui Guo, Zhiming Liu, Qianli Ren, Yuexian Zou

机构 * School of Electronic and Computer Engineering, Peking University(北京理工大学电子与计算机工程学院) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港理工大学) Sichuan University(四川大学)

专题命中 预训练与数据 :language model(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13310 2025-04-21 cs.CV cs.AI 74%

SAR Object Detection with Self-Supervised Pretraining and Curriculum-Aware Sampling

Yasin Almalioglu, Andrzej Kucik, Geoffrey French, Dafni Antotsiou, Alexander Adam, Cedric Archambeau

专题命中 预训练与数据 :pretraining(title);分类 cs.AI

Comments Accepted to ICLR 2025 ML4RS https://ml-for-rs.github.io/iclr2025/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03329 2025-04-07 eess.AS cs.AI cs.SD eess.SP 74%

Mind the Prompt: Prompting Strategies in Audio Generations for Improving Sound Classification

Francesca Ronchini, Ho-Hsiang Wu, Wei-Cheng Lin, Fabio Antonacci

专题命中 预训练与数据 :prompting(title);分类 cs.AI

Comments Accepted at Generative Data Augmentation for Real-World Signal Processing Applications Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07064 2025-03-20 cs.CL 74%

Data Selection via Optimal Control for Language Models

Yuxian Gu, Li Dong, Hongning Wang, Yaru Hao, Qingxiu Dong, Furu Wei, Minlie Huang

专题命中 预训练与数据 :language model(title);分类 cs.CL

Comments ICLR 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏