arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2402.04177 2026-01-30 cs.CL cs.LG stat.ML 90%

Scaling Laws for Downstream Task Performance of Large Language Models

大语言模型下游任务性能的扩展定律

Berivan Isik, Natalia Ponomareva, Hussein Hazimeh, Dimitris Paparas, Sergei Vassilvitskii, Sanmi Koyejo

机构 * Google Research(谷歌研究) OpenAI(开放人工智能) Stanford University(斯坦福大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究探讨了预训练数据规模和分布对齐对大语言模型下游任务性能的影响,揭示了扩展定律在迁移学习中的应用及翻译质量的预测方法。

Comments Published at the International Conference on Learning Representations (ICLR) 2025, with title: "Scaling Laws for Downstream Task Performance in Machine Translation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23340 2026-01-29 cs.LG cs.AI cs.MA 90%

The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models

多模型协作定律:大型语言模型模型融合的扩展极限

Dakuan Lu, Jiaqi Zhang, Cheng Yuan, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多模型协作定律,揭示多模型融合在参数预算下的扩展极限,证明模型多样性是提升LLM性能的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10719 2026-01-19 cs.AI cs.CL 90%

Do You Trust Me? Cognitive-Affective Signatures of Trustworthiness in Large Language Models

你信任我吗?大型语言模型中信任worthiness的认知-情感特征

Gerard Yeo, Svetlana Churina, Kokil Jaidka

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大型语言模型通过认知-情感特征隐式编码信任worthiness,为构建可信AI系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13274 2025-12-23 cs.LG cs.CL 90%

AdaLRS: Loss-Guided Adaptive Learning Rate Search for Efficient Foundation Model Pretraining

AdaLRS: 基于损失的自适应学习率搜索用于高效基础模型预训练

Hongyuan Dong, Dingkang Yang, Xiao Liang, Chao Feng, Jiao Ran

机构 * ByteDance Inc.(字节跳动公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 AdaLRS通过优化损失下降速度实现高效基础模型预训练,无需大量超参数调优,显著提升模型性能和鲁棒性。

Comments NeurIPS 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14220 2025-12-17 cs.LG cs.AI 90%

Estimating problem difficulty without ground truth using Large Language Model comparisons

无需真实数据即可利用大语言模型比较估计问题难度

Marthe Ballon, Andres Algaba, Brecht Verbeken, Vincent Ginis

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM compare方法,通过大语言模型的成对比较估计问题难度,克服传统方法在分布外问题上的局限性,具有高一致性与鲁棒性。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22153 2025-12-09 cs.CL cs.AI 90%

Simplex-Optimized Hybrid Ensemble for Large Language Model Text Detection Under Generative Distribution Drif

基于简单形优化的混合集成用于在生成分布漂移下的大语言模型文本检测

Sepyan Purnama Kristanto, Lutfi Hakim, Dianni Yusuf

机构 * Department of Informatics, Politeknik Negeri Banyuwangi(信息学院,波斯瓦基国家技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于简单形优化的混合集成方法,用于在生成分布漂移下提高大语言模型文本检测的准确性和鲁棒性。

Comments 8 pages, 2 Figure, Politeknik Negeri Banyuwangi

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00007 2025-12-02 cs.IR cs.AI cs.CL 90%

Use of Retrieval-Augmented Large Language Model Agent for Long-Form COVID-19 Fact-Checking

使用检索增强型大语言模型代理进行长期形式的新冠事实核查

Jingyi Huang, Yuyi Yang, Mengmeng Ji, Charles Alba, Sheng Zhang, Ruopeng An

机构 * New York University, USA(纽约大学) Washington University in St. Louis, USA(华盛顿大学圣路易斯分校) Shanghai University of Sports, China(上海体育大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAFE系统,结合大语言模型与检索增强生成技术,有效提升长期新冠虚假信息的事实核查能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17946 2025-11-25 cs.CL cs.AI 90%

Measuring the Impact of Lexical Training Data Coverage on Hallucination Detection in Large Language Models

测量词汇训练数据覆盖对大型语言模型中幻觉检测的影响

Shuo Zhang, Fabrizio Gotti, Fengran Mo, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨词汇训练数据覆盖对大型语言模型幻觉检测的影响,通过构建后缀数组和n-gram统计,发现结合出现特征与对数概率可提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19484 2025-10-23 q-bio.BM cs.AI cs.LG 90%

KnowMol: Advancing Molecular Large Language Models with Multi-Level Chemical Knowledge

Zaifei Yang, Hong Chang, Ruibing Hou, Shiguang Shan, Xilin Chen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,中国) University of Chinese Academy of Sciences (CAS), China(中国科学院大学(中国科学院))

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01675 2025-10-23 cs.LG cs.CL 90%

Using (Not-so) Large Language Models to Generate Simulation Models in a Formal DSL: A Study on Reaction Networks

Justin N. Kreikemeyer, Miłosz Jankowski, Pia Wilsdorf, Adelinde M. Uhrmacher

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 27 pages, 5 figures; supplemental material available at https://doi.org/10.1145/3733719

Journal ref ACM Trans. Model. Comput. Simul. 35, 4, Article 31 (October 2025), 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09566 2025-10-21 cs.CL cs.LG 90%

Zero-shot generation of synthetic neurosurgical data with large language models

Austin A. Barr, Eddie Guo, Emre Sezgin

机构 * Cumming School of Medicine University of Calgary(卡莱尔大学Cumming医学院) The Abigail Wexner Research Institute Nationwide Children’s Hospital Department of Pediatrics The Ohio State University College of Medicine(阿比盖尔·韦克斯纳研究所全国儿童医院儿科部俄亥俄州立大学医学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 13 pages, 4 figures, 4 tables (updated version, fixed typos and formatting)

Journal ref Neurosurg Focus 59(1), E17 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16551 2025-10-07 cs.CL cs.AI 90%

Rethinking the Role of Text Complexity in Language Model Pretraining

Dan John Velasco, Matthew Theodore Roque

机构 * Samsung R&D Institute Philippines(三星菲律宾研发中心)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments Camera-ready version for BabyLM Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19371 2025-09-25 cs.CL cs.AI 90%

How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models

Kangtao Lv, Haibin Chen, Yujin Yuan, Langming Liu, Shilei Liu, Yongwei Wang, Wenbo Su, Bo Zheng

机构 * Zhejiang University(浙江大学) Taobao & Tmall Group of Alibaba(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04183 2025-09-24 cs.CL cs.AI 90%

GALLa: Graph Aligned Large Language Models for Improved Source Code Understanding

Ziyin Zhang, Hang Yu, Shijie Li, Peng Di, Jianguo Li, Rui Wang

机构 * Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15714 2025-09-22 cs.CL cs.AI 90%

Once Upon a Time: Interactive Learning for Storytelling with Small Language Models

Jonas Mayer Martins, Ali Hamza Bashir, Muhammad Rehan Khalid, Lisa Beinborn

机构 * University of Göttingen, Institute of Computer Science(哥廷根大学计算机科学学院)

专题命中 预训练与数据 :language model(title,abstract);small language model(title);large language model(abstract);pretraining(abstract)

Comments EMNLP 2025, BabyLM Challenge; 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13380 2025-09-16 cs.CL cs.AI 90%

Persona-Based Synthetic Data Generation Using Multi-Stage Conditioning with Large Language Models for Emotion Recognition

Keito Inoshita, Rushia Harada

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15836 2025-09-09 cs.CL cs.AI 90%

Soft Token Attacks Cannot Reliably Audit Unlearning in Large Language Models

Haokun Chen, Sebastian Szyller, Weilin Xu, Nageen Himayat

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Aalto University(艾尔沃斯大学) Intel Labs(英特尔实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13868 2025-08-28 stat.ME cs.CL cs.LG math.ST stat.ML stat.TH 90%

Robust Detection of Watermarks for Large Language Models Under Human Edits

Xiang Li, Feng Ruan, Huiyuan Wang, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Northwestern University(西北大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments To appear in Journal of the Royal Statistical Society: Series B

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07484 2025-08-12 cs.CL cs.AI 90%

ALOPE: Adaptive Layer Optimization for Translation Quality Estimation using Large Language Models

Archchana Sindhujan, Shenbin Qian, Chan Chi Chun Matthew, Constantin Orasan, Diptesh Kanojia

机构 * Institute for People-Centred AI and Centre for Translation Studies, School of Computer Science and Electronic Engineering, University of Surrey(以人为本的人工智能研究所和翻译研究中心,计算机科学与电子工程学院,萨里大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted to COLM 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15956 2025-07-29 cs.CL cs.AI 90%

Do Large Language Models Have an English Accent? Evaluating and Improving the Naturalness of Multilingual LLMs

Yanzhu Guo, Simone Conia, Zelin Zhou, Min Li, Saloni Potdar, Henry Xiao

机构 * Apple(苹果公司) Inria Paris(巴黎国家信息与自动化研究所) École Polytechnique(巴黎高等理工学院) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14241 2025-07-28 cs.CL cs.AI 90%

Promptomatix: An Automatic Prompt Optimization Framework for Large Language Models

Rithesh Murthy, Ming Zhu, Liangwei Yang, Jielin Qiu, Juntao Tan, Shelby Heinecke, Caiming Xiong, Silvio Savarese, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18044 2025-07-25 cs.CL cs.AI 90%

Synthetic Data Generation for Phrase Break Prediction with Large Language Model

Hoyeon Lee, Sejung Son, Ye-Eun Kang, Jong-Hwan Kim

机构 * NAVER Cloud NHNSouth Korea Yale University(耶鲁大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10972 2025-07-17 cs.LG cs.AI 90%

Predictable Scale: Part II, Farseer: A Refined Scaling Law in Large Language Models

Houyi Li, Wenzhen Zheng, Qiufeng Wang, Zhenyu Ding, Haoying Wang, Zili Wang, Shijie Xuyang, Ning Ding, Shuigeng Zhou, Xiangyu Zhang, Daxin Jiang

机构 * Fudan University(复旦大学) Xi’an Jiaotong University(西安交通大学) Megvii Technology(科大讯飞)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 34

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04478 2025-07-08 cs.LG cs.AI cs.CR 90%

Model Inversion Attacks on Llama 3: Extracting PII from Large Language Models

Sathesh P. Sivashanmugam

机构 * Senior Software Engineer American Express(美国运通高级软件工程师)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22049 2025-07-04 cs.LG cs.CL 90%

GPAS: Accelerating Convergence of LLM Pretraining via Gradient-Preserving Activation Scaling

Tianhao Chen, Xin Xu, Zijing Liu, Pengxiang Li, Xinyuan Song, Ajay Kumar Jaiswal, Fan Zhang, Jishan Hu, Yang Wang, Hao Chen, Shizhe Diao, Shiwei Liu, Yu Li, Lu Yin, Can Yang

机构 * The Hong Kong University of Science and Technology(香港科技大学) International Digital Economy Academy(国际数字经济学院) Dalian University of Technology(大连理工大学) Emory University(埃默里大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) NVIDIA(英伟达) University of Oxford(牛津大学) University of Surrey(萨里大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22518 2025-07-01 cs.CL cs.AI 90%

Weak-to-Strong GraphRAG: Aligning Weak Retrievers with Large Language Models for Graph-based Retrieval Augmented Generation

Deyu Zou, Yongqiang Chen, Mufei Li, Siqi Miao, Chenxi Liu, Bo Han, James Cheng, Pan Li

机构 * The Chinese University of Hong Kong(香港中文大学) Georgia Institute of Technology(佐治亚理工学院) Hong Kong Baptist University(香港 Baptist大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20061 2025-06-26 cs.LG cs.CL 90%

Learning Instruction-Following Policies through Open-Ended Instruction Relabeling with Large Language Models

Zhicheng Zhang, Ziyan Wang, Yali Du, Fei Fang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18674 2025-06-24 cs.CL cs.AI 90%

Is There a Case for Conversation Optimized Tokenizers in Large Language Models?

Raquel Ferrando, Javier Conde, Gonzalo Martínez, Pedro Reviriego

机构 * ETSI de Telecomunicación Universidad Politécnica de Madrid(电信工程学院马德里理工大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02572 2025-06-24 cs.CR cs.AI cs.ET cs.LG 90%

GenDFIR: Advancing Cyber Incident Timeline Analysis Through Retrieval Augmented Generation and Large Language Models

Fatma Yasmine Loumachi, Mohamed Chahine Ghanem, Mohamed Amine Ferrag

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 24 pages V5.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03573 2025-06-12 cs.SE cs.AI cs.CL 90%

AcTracer: Active Testing of Large Language Model via Multi-Stage Sampling

Yuheng Huang, Jiayang Song, Qiang Hu, Felix Juefei-Xu, Lei Ma

机构 * The University of Tokyo(东京大学) University of Alberta(阿尔伯塔大学) Tianjin University(天津大学) New York University(纽约大学) The University of Tokyo, Japan(东京大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments To appear in ACM Transactions on Software Engineering and Methodology (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏