arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12393 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2605.30040 2026-05-29 cs.CR cs.AI cs.CL 90%

Token Inflation: How Dishonest Providers Can Overcharge for Large Language Model Usage

Token通胀:不诚实的提供商如何对大型语言模型使用超额收费

Shahinul Hoque, Jinghuai Zhang, Jinyuan Sun, Fnu Suya

机构 * University of Tennessee, Knoxville(田纳西大学,基洛纳分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 研究揭示了基于每token计费的大型语言模型商业服务中,提供商利用审计信任悖论系统性地虚报token数量,导致用户费用大幅增加的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25704 2026-05-26 cs.CL cs.LG 90%

PowLU: An Activation Function for Stable Pre-Training of LLMs

PowLU: 一种用于LLM稳定预训练的激活函数

Peijie Jiang, Yuqi Feng, Cunyin Peng, Qian Zhao, Jia Liu, KunLong Chen, Zhiqiang Zhang, Jun Zhou

机构 * Ant Group(蚂蚁集团)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PowLU激活函数,通过有理幂函数实现自适应非线性,解决SwiGLU在低精度LLM训练中的数值不稳定问题,在大规模训练中取得与SwiGLU和SwiGLU-Clip相当的性能并提升可扩展性。

Comments 17 pages, 7 figures, techreport

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23857 2026-05-25 cs.LG cs.CL 90%

Strong Teacher Not Needed? On Distillation in LLM Pretraining

不需要强教师?关于大语言模型预训练中的蒸馏

Taiming Lu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 本文通过构造不同强弱关系的师生模型,研究大语言模型预训练中知识蒸馏的有效性,发现弱教师也能提升学生模型,且强教师不一定更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21698 2026-05-12 cs.LG cs.AI 90%

Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics

针对LLM预训练的课程学习:学习动态分析

Mohamed Elgaar, Hadi Amiri

机构 * University of Massachusetts Lowell(马萨诸塞大学洛文分校)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过对比不同课程策略,分析预训练动态,发现课程顺序影响各阶段训练时间及稳定性,尤其在小模型中更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18090 2026-04-29 cs.DL cs.AI cs.CL 90%

Named Entity Recognition of Historical Texts via Large Language Model

通过大语言模型进行历史文本的命名实体识别

Shibingfeng Zhang, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) University of Copenhagen(哥本哈根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了利用零样本和少样本提示策略,用大语言模型进行历史文档命名实体识别,实验表明在HIPE-2022数据集上表现良好,尽管不如全监督模型,但仍具潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29661 2026-04-01 cs.CL cs.AI cs.IR 90%

Agenda-based Narrative Extraction: Steering Pathfinding Algorithms with Large Language Models

基于议程的叙述提取:用大语言模型引导路径查找算法

Brian Felipe Keith-Norambuena, Carolina Inés Rojas-Córdova, Claudio Juvenal Meneses-Villegas, Elizabeth Johanna Lam-Esquenazi, Angélica María Flores-Bustos, Ignacio Alejandro Molina-Villablanca, Joshua Emanuel Leyton-Vallejos

机构 * Department of Computing and Systems Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区计算与系统工程系,安托法加斯塔,智利) Department of Industrial Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区工业工程系,安托法加斯塔,智利) Department of Chemical and Environmental Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区化学与环境工程系,安托法加斯塔,智利)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于议程的叙述提取方法,通过整合大语言模型到路径查找过程中,引导叙述构建朝向用户指定视角,提升了叙述的连贯性和多视角支持。

Comments Text2Story Workshop 2026 at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05675 2026-03-31 cs.AI cs.LG 90%

Synergizing Large Language Models and Task-specific Models for Time Series Anomaly Detection

融合大语言模型与任务特定模型用于时间序列异常检测

Feiyi Chen, Leilei Zhang, Guansong Pang, Roger Zimmermann, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Department of Computer Science and Technology, Singapore Management University(新加坡管理大学计算机科学与技术系) Department of Computer Science and Technology, National University of Singapore(新加坡国立大学计算机科学与技术系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoLLaTe框架,通过融合大语言模型与任务特定模型,解决异常检测中的表达域不匹配和预测误差累积问题,提升检测性能。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20957 2026-03-31 cs.CL cs.AI cs.CY 90%

Alignment Whack-a-Mole : Finetuning Activates Verbatim Recall of Copyrighted Books in Large Language Models

对齐的打砖块:微调激活大型语言模型对版权书籍的原文回忆

Xinyue Liu, Niloofar Mireshghallah, Jane C. Ginsburg, Tuhin Chakrabarty

机构 * Stony Brook University(石溪大学) Carnegie Mellon University(卡内基梅隆大学) Columbia Law School(哥伦比亚法学院)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);pretraining(abstract)

AI总结 研究显示微调可绕过安全对齐策略,使GPT-4o等模型能回忆85-90%的版权书籍,揭示模型权重存储版权作品的漏洞。

Comments Preprint Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22301 2026-03-25 cs.LG cs.AI 90%

Latent Semantic Manifolds in Large Language Models

大型语言模型中的潜在语义流形

Mohamed A. Mabrok

机构 * Qatar University(卡塔尔大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型中隐藏状态作为流形点的几何解释,定义表达性差距并验证其在不同架构中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09416 2026-03-11 cs.CL cs.AI 90%

Investigating Gender Stereotypes in Large Language Models via Social Determinants of Health

通过社会健康决定因素探讨大型语言模型中的性别刻板印象

Trung Hieu Ngo, Adrien Bazoge, Solen Quiniou, Pierre-Antoine Gourraud, Emmanuel Morin

机构 * Nantes Université, École Centrale Nantes, CNRS, LS2N, UMR 6004(南特大学,中央理工学院,国家科学研究中心,LS2N,UMR 6004) Nantes Université, CHU Nantes, Clinique des données, INSERM, CIC 1413(南特大学,南特大学医院,数据诊所,国家健康与医学研究院,CIC 1413)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析法语患者记录中的性别与社会健康决定因素的关系,揭示了LLM在性别决策中依赖嵌入刻板印象的现象,并提出评估SDoH因素相互作用以补充现有偏见评估方法。

Comments Accepted as Findings at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04372 2026-03-06 cs.SE cs.AI cs.LG 90%

Assessing the Impact of Code Changes on the Fault Localizability of Large Language Models

评估代码更改对大型语言模型故障定位性的影响

Sabaat Haroon, Ahmad Faraz Khan, Ahmad Humayun, Waris Gill, Abdul Haddi Amjad, Ali R. Butt, Mohammad Taha Khan, Muhammad Ali Gulzar

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过端到端评估框架评估LLM在故障定位中的鲁棒性,发现SPMs导致78%的LLM失败于之前定位的故障,表明LLM推理依赖于语法而非语义。

Comments This paper is currently Under Review. It consists of 12 pages, 11 Figures, and 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01550 2026-03-05 cs.CL cs.AI 90%

Extracting Training Dialogue Data from Large Language Model based Task Bots

从基于大语言模型的任务机器人中提取训练对话数据

Shuo Zhang, Junzhou Zhao, Junji Hou, Pinghui Wang, Chenxu Wang, Jing Tao

机构 * MOE Key Laboratory for Intelligent Networks and Network Security, Xi’an Jiaotong University(信息网络与网络安全国家重点实验室,西安交通大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种针对基于大语言模型的任务机器人数据提取攻击方法,通过系统性研究揭示LLM记忆在TODS中的继承机制,并有效提取训练对话数据。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS). \c{opyright} 2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22227 2026-03-05 cs.LG cs.AI 90%

Dynamic Adversarial Reinforcement Learning for Robust Multimodal Large Language Models

动态对抗强化学习用于鲁棒多模态大语言模型

Yicheng Bao, Xuhong Wang, Qiaosheng Zhang, Chaochao Lu, Xia Hu, Xin Tan

机构 * East China Normal University(东华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AOT方法,通过对抗训练提升多模态大语言模型的鲁棒性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09396 2026-03-05 cs.CL cs.AI 90%

Multimodal Large Language Models for Low-Resource Languages: A Case Study for Basque

多模态大语言模型用于低资源语言:巴斯克语的案例研究

Lukas Arana, Julen Etxaniz, Ander Salaberria, Gorka Azkune

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过开发巴斯克语多模态大语言模型,证明低比例多模态数据即可获得良好性能,且无需巴斯克语指导的LLM即可实现强模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20065 2026-02-24 cs.CL cs.AI 90%

Multilingual Large Language Models do not comprehend all natural languages to equal degrees

多语言大语言模型并非对所有自然语言有同等的理解能力

Natalia Moskvina, Raquel Montero, Masaya Yoshida, Ferdy Hubers, Paolo Morosi, Walid Irhaymi, Jin Yan, Tamara Serrano, Elena Pagliarini, Fritz Günther, Evelina Leivada

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现多语言大模型在不同语言上的理解能力存在差异,英语并非表现最佳,部分罗曼语系语言表现更优。

Comments 36 pages, 3 figures, 2 tables, 4 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 90%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10825 2026-02-02 cs.IR cs.AI cs.ET cs.LG 90%

Unveiling and Mitigating Bias in Large Language Model Recommendations: A Path to Fairness

揭示和缓解大型语言模型推荐中的偏见:走向公平的一条路

Anindya Bijoy Das, Shahnewaz Karim Sakib

机构 * Computer Science and Engineering, University of Tennessee at Chattanooga(计算机科学与工程系,田纳西大学查塔努加分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于LLM的推荐系统中的偏见问题,提出通过提示工程和检索增强生成策略来缓解偏见,以实现更公平的推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04177 2026-01-30 cs.CL cs.LG stat.ML 90%

Scaling Laws for Downstream Task Performance of Large Language Models

大语言模型下游任务性能的扩展定律

Berivan Isik, Natalia Ponomareva, Hussein Hazimeh, Dimitris Paparas, Sergei Vassilvitskii, Sanmi Koyejo

机构 * Google Research(谷歌研究) OpenAI(开放人工智能) Stanford University(斯坦福大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了预训练数据规模和分布对齐对大语言模型下游任务性能的影响,揭示了扩展定律在迁移学习中的应用及翻译质量的预测方法。

Comments Published at the International Conference on Learning Representations (ICLR) 2025, with title: "Scaling Laws for Downstream Task Performance in Machine Translation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23340 2026-01-29 cs.LG cs.AI cs.MA 90%

The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models

多模型协作定律:大型语言模型模型融合的扩展极限

Dakuan Lu, Jiaqi Zhang, Cheng Yuan, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多模型协作定律,揭示多模型融合在参数预算下的扩展极限,证明模型多样性是提升LLM性能的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10719 2026-01-19 cs.AI cs.CL 90%

Do You Trust Me? Cognitive-Affective Signatures of Trustworthiness in Large Language Models

你信任我吗?大型语言模型中信任worthiness的认知-情感特征

Gerard Yeo, Svetlana Churina, Kokil Jaidka

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大型语言模型通过认知-情感特征隐式编码信任worthiness,为构建可信AI系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13274 2025-12-23 cs.LG cs.CL 90%

AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining

AdaLRS: 基于损失的自适应学习率搜索用于高效基础模型预训练

Hongyuan Dong, Dingkang Yang, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Inc.(字节跳动公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 AdaLRS通过优化损失下降速度实现高效基础模型预训练,无需大量超参数调优,显著提升模型性能和鲁棒性。

Comments NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14220 2025-12-17 cs.LG cs.AI 90%

Estimating problem difficulty without ground truth using Large Language Model comparisons

无需真实数据即可利用大语言模型比较估计问题难度

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM compare方法,通过大语言模型的成对比较估计问题难度,克服传统方法在分布外问题上的局限性,具有高一致性与鲁棒性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22153 2025-12-09 cs.CL cs.AI 90%

Simplex-Optimized Hybrid Ensemble for Large Language Model Text Detection Under Generative Distribution Drif

基于简单形优化的混合集成用于在生成分布漂移下的大语言模型文本检测

Sepyan Purnama Kristanto, Lutfi Hakim, Dianni Yusuf

机构 * Department of Informatics, Politeknik Negeri Banyuwangi(信息学院,波斯瓦基国家技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于简单形优化的混合集成方法,用于在生成分布漂移下提高大语言模型文本检测的准确性和鲁棒性。

Comments 8 pages, 2 Figure, Politeknik Negeri Banyuwangi

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00007 2025-12-02 cs.IR cs.AI cs.CL 90%

Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking

使用检索增强型大语言模型代理进行长期形式的新冠事实核查

Jingyi Huang, Yuyi Yang, Mengmeng Ji, Charles Alba, Sheng Zhang, Ruopeng An

机构 * New York University, USA(纽约大学) Washington University in St. Louis, USA(华盛顿大学圣路易斯分校) Shanghai University of Sports, China(上海体育大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAFE系统,结合大语言模型与检索增强生成技术,有效提升长期新冠虚假信息的事实核查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17946 2025-11-25 cs.CL cs.AI 90%

Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models

测量词汇训练数据覆盖对大型语言模型中幻觉检测的影响

Shuo Zhang, Fabrizio Gotti, Fengran Mo, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨词汇训练数据覆盖对大型语言模型幻觉检测的影响,通过构建后缀数组和n-gram统计,发现结合出现特征与对数概率可提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19484 2025-10-23 q-bio.BM cs.AI cs.LG 90%

KnowMol: Advancing Molecular Large Language Models with Multi-Level Chemical Knowledge

Zaifei Yang, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国) University of Chinese Academy of Sciences (CAS), China(中国科学院大学(中国科学院))

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01675 2025-10-23 cs.LG cs.CL 90%

Using (Not-so) Large Language Models to Generate Simulation Models in a Formal DSL: A Study on Reaction Networks

Justin N. Kreikemeyer, Miłosz Jankowski, Pia Wilsdorf, Adelinde M. Uhrmacher

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 27 pages, 5 figures; supplemental material available at https://doi.org/10.1145/3733719

Journal ref ACM Trans. Model. Comput. Simul. 35, 4, Article 31 (October 2025), 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09566 2025-10-21 cs.CL cs.LG 90%

Zero-shot generation of synthetic neurosurgical data with large language models

Austin A. Barr, Eddie Guo, Emre Sezgin

机构 * Cumming School of Medicine University of Calgary(卡莱尔大学Cumming医学院) The Abigail Wexner Research Institute Nationwide Children’s Hospital Department of Pediatrics The Ohio State University College of Medicine(阿比盖尔·韦克斯纳研究所全国儿童医院儿科部俄亥俄州立大学医学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 13 pages, 4 figures, 4 tables (updated version, fixed typos and formatting)

Journal ref Neurosurg Focus 59(1), E17 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16551 2025-10-07 cs.CL cs.AI 90%

Rethinking the Role of Text Complexity in Language Model Pretraining

Dan John Velasco, Matthew Theodore Roque

机构 * Samsung R&D Institute Philippines(三星菲律宾研发中心)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Camera-ready version for BabyLM Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19371 2025-09-25 cs.CL cs.AI 90%

How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models

Kangtao Lv, Haibin Chen, Yujin Yuan, Langming Liu, Shilei Liu, Yongwei Wang, Wenbo Su, Bo Zheng

机构 * Zhejiang University(浙江大学) Taobao & Tmall Group of Alibaba(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏