arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2606.06360 2026-06-09 cs.AI 版本更新 90%

An Infectious Disease Spread Simulation Based on Large Language Model Decision Making

基于大语言模型决策的传染病传播模拟

Yonchanok Khaokaew, Ruochen Kong, Andreas Zufle, Hao Xue, Taylor Anderson, Chandini Raina MacIntyre, Matthew Scotch, Flora D. Salim, David J Heslop

机构 * Computer Science and Engineering Faculty of Engineering(计算机科学与工程系) The University of New South Wales(新南威尔士大学) Department of Computer Science(计算机科学系) Emory University(埃默里大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) George Mason University(乔治·马歇尔大学) The Kirby Institute Faculty of Medicine & Health(Kirby研究所医学院与健康学院) Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出一个空间显式的基于智能体的模拟框架,利用大语言模型生成自我报告流感样疾病的决策,并整合到基于人口普查的合成人群中,以捕捉社会与地理异质性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06553 2026-06-04 stat.AP cs.LG 90%

A Latent Variable Framework for Scaling Laws in Large Language Models

大型语言模型中缩放定律的潜变量框架

Peiyao Cai, Chengyu Cui, Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Mikhail Yurochkin, Yuekai Sun, Kean Ming Tan, Gongjun Xu

机构 * Department of Statistics, University of Michigan(密歇根大学统计系) IBM Research and CSAIL, MIT(IBM研究与麻省理工学院计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(MBZUAI基础模型研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出基于潜变量建模的统计框架,通过引入潜变量捕获不同模型家族和基准的异构性,以更准确地建模大型语言模型的缩放定律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12744 2026-05-22 cs.LG 90%

Resting Neurons, Active Insights: Robustifying Activation Sparsity in LLMs via Spontaneity

静息神经元,主动洞察:通过自发性增强LLM中的激活稀疏性

Haotian Xu, Jiannan Yang, Tian Gao, Tsui-Wei Weng, Tengfei Ma

机构 * IBM Thomas J. Watson Research Center, Yorktown Heights, USA(IBM 托马斯·J·沃森研究中心,美国Yorktown Heights) Halıcıoğlu Data Science Institute, UC San Diego, La Jolla, USA(哈利奇欧数据科学研究所,美国UC圣地亚哥La Jolla) Stony Brook University, Stony Brook, USA(史泰文·布鲁克大学,美国Stony Brook)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种通过引入自发神经元(SPON)来增强LLM中激活稀疏性的方法,解决了高稀疏率下模型精度下降的问题,通过分布匹配训练SPON,使模型在稀疏计算中保持稳定和泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07533 2026-05-11 cs.CL 90%

Why do Large Language Models Fail in Low-resource Translation? Unraveling the Token Dynamics of Large Language Models for Machine Translation

为何大语言模型在低资源翻译中失败?解析大语言模型在机器翻译中的令牌动态

Shenbin Qian, Yves Scherrer

机构 * Language Technology Group, Department of Informatics University of Oslo(奥斯陆大学语言技术组,信息学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究通过分析15种模型在22种语言对上的表现,发现非英语语言对翻译质量较低,引入令牌激活率指标揭示语言表示与翻译性能的关系,指出推理模型在低TAR语言中生成更多令牌可能补偿性能差异。

Comments Accepted to the 26th Annual Conference of the European Association for Machine Translation (EAMT2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22989 2026-04-28 cs.CV cs.AI 90%

CheXmix: Unified Generative Pretraining for Vision Language Models in Medical Imaging

CheXmix:用于医学影像的统一生成预训练

Ashwin Kumar, Robbie Holland, Corey Barrett, Jangwon Kim, Maya Varma, Zhihong Chen, Yunhe Gao, Greg Zaharchuk, Tara Taghavi, Krishnaram Kenthapadi, Akshay Chaudhari

机构 * Stanford AIMI, Stanford University(斯坦福大学AIMI研究所,斯坦福大学) Oracle Health AI(Oracle健康AI) Department of Radiology, Stanford University(斯坦福大学放射科)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);foundation model(abstract)

AI总结 CheXmix通过统一早融合生成方法,在医学影像中实现更精确的联合表征学习,优于现有生成模型,在多个任务上表现突出。

Comments CVPR Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22142 2026-04-27 cs.CL cs.CY 90%

Voice Under Revision: Large Language Models and the Normalization of Personal Narrative

声音的修订:大型语言模型与个人叙述的规范化

Tom van Nuenen

机构 * Social Sciences D-Lab, University of California, Berkeley(社会科学D实验室,加州大学伯克利分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究探讨大型语言模型如何通过改写影响个人叙述的风格和叙述质感,发现改写导致风格规范化,包括功能词、缩略语和第一人称代词减少,而词汇多样性、词长和标点使用增加,影响叙述方式和因果推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11810 2026-04-15 cs.DB cs.AI 90%

GRACE: A Dynamic Coreset Selection Framework for Large Language Model Optimization

GRACE:一种用于大语言模型优化的动态聚类选择框架

Tianhao Tang, Haoyang Li, Lei Chen

机构 * CSE, HKUST(香港科技大学计算机科学与工程系) Computing, PolyU(PolyU计算机系) DSA, HKUST (GZ)&HKUST Guangzhou, China(香港科技大学(广州)数据科学与应用系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 GRACE通过结合表示多样性与梯度重要性度量,动态构建和更新聚类,提升大语言模型训练效率和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05523 2026-03-31 cs.CL 90%

Pretraining Language Models for Diachronic Linguistic Change Discovery

为历时语言变化发现预训练语言模型

Elisabeth Fittschen, Sabrina Li, Tom Lippincott, Leshem Choshen, Craig Messner

机构 * University of Hamburg(汉堡大学) Center for Digital Humanities, Johns Hopkins University(约翰霍普金斯大学数字人文中心) IBM Research, MIT(麻省理工学院IBM研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出通过预训练语言模型发现历时语言变化,通过高效预训练技术处理大规模语料,发现预训练模型在训练速度和历史划分尊重方面优于微调基线,展示了在历时语言学中检测词汇变化等现象的能力。

Comments Accepted to Findings of the EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21140 2026-03-24 cs.AI 90%

ORACLE: Optimizing Reasoning Abilities of Large Language Models via Constraint-Led Synthetic Data Elicitation

ORACLE:通过约束引导的合成数据激发方法优化大语言模型的推理能力

Zhuojie Yang, Wentao Wan, Keze Wang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 ORACLE通过结合生成式模型与符号监督,实现对多步骤推理数据的细粒度验证,提升大语言模型的推理能力,在六个基准测试中表现优异。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13264 2026-03-17 cs.LG cs.IR 90%

Federated Personal Knowledge Graph Completion with Lightweight Large Language Models for Personalized Recommendations

联邦轻量级大语言模型用于个性化推荐的知识图谱补全

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出FedTREK-LM框架,结合轻量级大语言模型、演化个人知识图谱和联邦学习,实现可扩展的去中心化个性化推荐,实验显示其在电影和食谱推荐中F1分数提升超4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02400 2026-02-03 cs.LG 90%

An Empirical Study on Noisy Data and LLM Pretraining Loss Divergence

对噪声数据和LLM预训练损失发散的实证研究

Qizhen Zhang, Ankush Garg, Jakob Foerster, Niladri Chatterji, Kshitiz Malik, Mike Lewis

机构 * University of Oxford(牛津大学) FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过实证分析揭示噪声数据如何导致LLM预训练中的损失发散,并区分噪声与高学习率引起的发散模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01734 2026-02-03 cs.LG 90%

MSign: An Optimizer Preventing Training Instability in Large Language Models via Stable Rank Restoration

MSign: 通过稳定秩恢复防止大语言模型训练不稳定

Lianhai Ren, Yucheng Ding, Xiao Liu, Qianxiao Li, Peng Cheng, Yeyun Gong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 MSign通过稳定秩恢复机制防止大语言模型训练不稳定,有效减少训练失败并降低计算开销

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21947 2026-01-30 cs.AI 90%

ToolWeaver: Weaving Collaborative Semantics for Scalable Tool Use in Large Language Models

ToolWeaver: 为大语言模型中的可扩展工具使用编织协作语义

Bowen Fang, Wen Ye, Yunyue Su, Jinghao Zhang, Qiang Liu, Yesheng Liu, Xin Sun, Shu Wu, Jiabing Yang, Baole Wei, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新实验室(NLPR),自动化研究所,中国科学院(CASIA)) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 ToolWeaver通过编码工具为层次序列,解决大语言模型中工具使用中的语义和可扩展性问题,提升工具协作学习的效率与效果。

Comments 10pages, 12 figures, Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14603 2026-01-22 cs.LG 90%

Variance-Adaptive Muon: Accelerating LLM Pretraining with NSR-Modulated and Variance-Scaled Momentum

方差自适应缪子:通过NSR调制和方差缩放的动量加速大语言模型预训练

Jingru Li, Yibo Fan, Huan Li

机构 * College of Artificial Intelligence, Nankai University(人工智能学院,南开大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出缪子-NSR和缪子-VS两种方法,通过方差自适应归一化和NSR调制或方差缩放,加速大语言模型预训练,提升收敛速度并降低验证损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08692 2026-01-21 cs.CL 90%

Nationality and Region Prediction from Names: A Comparative Study of Neural Models and Large Language Models

从名字预测国籍:神经模型和大语言模型的比较研究

Keito Inoshita

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本研究比较神经模型与大语言模型在国籍预测中的表现,发现LLMs在所有粒度级别均优于神经模型,且在低频国籍上表现下降,错误类型差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05790 2025-12-15 cs.LG 90%

Breaking the Frozen Subspace: Importance Sampling for Low-Rank Optimization in LLM Pretraining

打破冻结子空间:用于大语言模型预训练低秩优化的重要性采样

Haochen Zhang, Junze Yin, Guanchu Wang, Zirui Liu, Lin F. Yang, Tianyi Zhang, Anshumali Shrivastava, Vladimir Braverman

机构 * Rice University(Rice大学) University of North Carolina at Charlotte(北卡罗来纳州立大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) University of California, Los Angeles(加州大学洛杉矶分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种具有可证明收敛性的低秩优化方法,用于大语言模型预训练,以解决主导子空间在预训练中冻结的问题,并在实验中表现出优越的性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06266 2025-12-09 cs.CL 90%

Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models

Nanbeige4-3B 技术报告:探索小型语言模型的前沿

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Wei Ruan, Xiaoqi Liu, Xiaoxue Cheng, Xiyun Xu, Yang Song, Yanzipeng Gao, Yiming Jia, Yun Xing, Yuntao Wen, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳布吉LLM实验室)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 Nanbeige4-3B通过FG-WSD调度器、DPD蒸馏和强化学习技术,实现了小型语言模型在性能和扩展定律上的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16135 2025-11-21 physics.optics cs.AI 90%

CoSP: Reconfigurable Multi-State Metamaterial Inverse Design via Contrastive Pretrained Large Language Model

CoSP: 通过对比预训练大语言模型实现可重构多状态超材料逆向设计

Shujie Yang, Xuzhe Zhao, Yuqi Zhang, Yansong Tang, Kaichen Dong

机构 * Center of Double Helix, Tsinghua Shenzhen International Graduate School, Tsinghua University(双螺旋中心,清华大学深圳国际研究生院,清华大学) Intelligent Passive Thermal Control Center, Research Institute of Tsinghua University in Shenzhen(智能被动热控制中心,清华大学深圳研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 CoSP通过对比预训练大语言模型实现可重构多状态超材料的逆向设计,能高效生成具有目标光学性能的材料结构。

Comments 5 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14023 2025-11-21 cs.CL 90%

Synthetic Data Generation Using Large Language Models: Advances in Text and Code

利用大语言模型生成合成数据:文本与代码领域的进展

Mihai Nadas, Laura Diosan, Andreea Tomescu

机构 * Faculty of Mathematics and Computer Science, Babeş-Bolyai University(巴贝什-博耶亚大学数学与计算机科学系) KlusAI Research Lab(KlusAI研究实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

AI总结 本文探讨了利用大语言模型生成合成数据在文本和代码领域的新进展,分析了其在低资源任务和代码应用中的潜力及挑战。

Comments 24 pages, 6 tables, 1 figure, 64 references

Journal ref IEEE Access 13, 134615-134633 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01090 2025-11-04 cs.CL 90%

Improving Romanian LLM Pretraining Data using Diversity and Quality Filtering

Vlad Negoita, Mihai Masala, Traian Rebedea

机构 * National University of Science and Technology(科学与技术国家大学) POLITEHNICA Bucharest(布加勒斯特理工大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14702 2025-10-17 cs.AI 90%

Cognitive-Aligned Spatio-Temporal Large Language Models For Next Point-of-Interest Prediction

Penglong Zhai, Jie Li, Fanyi Di, Yue Liu, Yifang Yuan, Jie Huang, Peng Wu, Sicong Wang, Mingyang Yin, Tingting Hu, Yao Xu, Xin Li

机构 * AMAP, Alibaba Group(阿里集团AMAP)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);SFT(abstract)

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17355 2025-10-08 cs.CL 90%

On Relation-Specific Neurons in Large Language Models

Yihong Liu, Runsheng Chen, Lea Hirlimann, Ahmad Dawar Hakimi, Mingyang Wang, Amir Hossein Kargaran, Sascha Rothe, François Yvon, Hinrich Schütze

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10743 2025-09-03 cs.AI 90%

From Anchors to Answers: A Novel Node Tokenizer for Integrating Graph Structure into Large Language Models

Yanbiao Ji, Chang Liu, Xin Chen, Dan Luo, Mei Li, Yue Ding, Wenqing Lin, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Lehigh University(莱斯大学) Tencent(腾讯)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13408 2025-08-25 cs.LG 90%

NovoMolGen: Rethinking Molecular Language Model Pretraining

Kamran Chitsaz, Roshan Balaji, Quentin Fournier, Nirav Pravinbhai Bhatt, Sarath Chandar

机构 * Mila – Quebec AI Institute(魁北克AI研究所) Wadhwani School of Data Science and AI, IIT Madras(数据科学与人工智能学院,印度理工学院马德拉斯分校) The Centre for Integrative Biology and Systems medicinE (IBSE)(整合生物学与系统医学中心) IIT Madras Zanzibar(印度理工学院马德拉斯分校(赞赞比尔)) Polytechnique Montréal Canada(蒙特利尔理工学院,加拿大) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13769 2025-08-20 cs.CL 90%

Can Large Language Models (LLMs) Describe Pictures Like Children? A Comparative Corpus Study

Hanna Woloszyn, Benjamin Gagl

机构 * Self-Learning Systems Lab, Faculty of Human Sciences, Department of Special Education and Rehabilitation(自主学习系统实验室,人文科学学院,特殊教育与康复系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13347 2025-06-24 cs.CL 90%

Craw4LLM: Efficient Web Crawling for LLM Pretraining

Shi Yu, Zhiyuan Liu, Chenyan Xiong

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19390 2025-06-04 cs.CL 90%

Checkpoint Merging via Bayesian Optimization in LLM Pretraining

Deyuan Liu, Zecheng Wang, Bingning Wang, Weipeng Chen, Chunshan Li, Zhiying Tu, Dianhui Chu, Bo Li, Dianbo Sui

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23944 2025-06-02 cs.CL 90%

Retrieval Augmented Generation based Large Language Models for Causality Mining

Thushara Manjari Naduvilakandy, Hyeju Jang, Mohammad Al Hasan

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 13 pages, 6 figures, published in knowledgeNLP-NAACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16511 2025-04-29 cs.CL 90%

QuaDMix: Quality-Diversity Balanced Data Selection for Efficient LLM Pretraining

Fengze Liu, Weidong Zhou, Binbin Liu, Zhimiao Yu, Yifan Zhang, Haobin Lin, Yifeng Yu, Bingni Zhang, Xiaohuan Zhou, Taifeng Wang, Yong Cao

机构 * ByteDance(字节跳动)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18271 2025-04-22 cs.AR cs.AI 90%

Large Language Model for Verilog Generation with Code-Structure-Guided Reinforcement Learning

Ning Wang, Bingkun Yao, Jie Zhou, Xi Wang, Zhe Jiang, Nan Guan

机构 * City University of Hong Kong(香港城市大学) Southeast University(东南大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏