arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2602.20052 2026-02-24 cs.CL 89%

Entropy in Large Language Models

大语言模型中的熵

Marco Scharringhausen

机构 * Carl von Ossietzky Universität Oldenburg(奥尔登堡卡尔·冯·奥西特齐克大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究比较了大语言模型与自然语言的词熵,发现LLM的词熵低于自然口语,旨在评估LLM训练数据对信息和不确定性的影响。

Comments 7 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09392 2026-02-17 cs.CR cs.AI 89%

LLMAC: A Global and Explainable Access Control Framework with Large Language Model

LLMAC: 一种全局且可解释的访问控制框架基于大语言模型

Sharif Noor Zisad, Ragib Hasan

机构 * Department of Computer Science(计算机科学系) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LLMAC利用大语言模型整合多种访问控制方法,实现高准确率和可解释性,显著优于传统方法。

Comments This paper is accepted and presented in IEEE Consumer Communications & Networking Conference (CCNC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21551 2026-02-04 cs.LG 89%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);instruction tuning(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03034 2026-01-09 cs.CL 89%

NorwAI's Large Language Models: Technical Report

NorwAI的大型语言模型:技术报告

Jon Atle Gulla, Peng Liu, Lemei Zhang

机构 * Norwegian Research Center for AI Innovation (NorwAI)(挪威人工智能创新研究中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 NorwAI开发了针对挪威语和其他斯堪的纳维亚语言的大型语言模型,通过预训练和微调策略提升性能与适应性,适用于交互和领域特定应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02830 2026-01-08 cs.CL 89%

The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture

中中美大语言模型在中华文化传播主题上的表现

Feiyan Liu, Siyan Zhao, Chenxun Zhuo, Tianming Liu, Bao Ge

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了中美开发的大语言模型在中华文化传播问题上的表现,发现中国模型在相关任务上普遍优于美国模型,且Gemini 2.5Pro和GPT-5.1表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14757 2025-12-23 cs.SE cs.AI 89%

SWE-Synth: Synthesizing Verifiable Bug-Fix Data to Enable Large Language Models in Resolving Real-World Bugs

SWE-Synth:合成可验证的bug修复数据以使大语言模型能够解决现实中的bug

Minh V. T. Pham, Huy N. Phan, Hoang N. Phan, Cuong Le Chi, Tien N. Nguyen, Nghi D. Q. Bui

机构 * FPT Software AI Center, Viet Nam(越南FPT软件AI中心) Nanyang Technological University, Singapore(新加坡南洋理工大学) University of Texas at Dallas, US(美国德克萨斯大学达拉斯分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SWE-Synth通过合成可验证的bug修复数据集,提升大语言模型在解决现实bug中的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22818 2025-12-22 cs.AI cs.CY 89%

Can Large Language Models Develop Gambling Addiction?

大语言模型能否产生赌博成瘾?

Seungpil Lee, Donghyeon Shin, Yunjeong Lee, Sundong Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology(人工智能融合系,全州科学技术院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究探讨大语言模型在老虎机实验中表现出赌博成瘾行为,揭示其决策机制与风险认知特征,指出模型行为受抽象决策特征控制而非单纯依赖训练数据。

Comments 26 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07031 2025-12-08 econ.EM cs.AI 89%

Large Language Models: An Applied Econometric Framework

大语言模型:一个应用计量经济学框架

Jens Ludwig, Sendhil Mullainathan, Ashesh Rambachan

机构 * Center for Applied Artificial Intelligence at the University of Chicago(芝加哥大学应用人工智能中心) Altman Family Fund at MIT(麻省理工学院阿尔特曼家族基金) University of Chicago(芝加哥大学) Massachusetts Institute of Technology(麻省理工学院) NBER(美国国家经济研究局)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出一个应用计量经济学框架,利用大语言模型进行文本预测和经济概念测量,强调无训练泄漏和验证样本的重要性,以提高实证分析的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21006 2025-12-01 cs.CL 89%

TrackList: Tracing Back Query Linguistic Diversity for Head and Tail Knowledge in Open Large Language Models

TrackList: 回溯查询语言多样性以探究开放式大语言模型中的头部与尾部知识

Ioana Buhnila, Aman Sinha, Mathieu Constant

机构 * ATILF, University of Lorraine - CNRS, France(ATILF,洛林大学 - CNRS,法国) Center for Data Science in Humanities, Chosun University, South Korea(人文数据科学中心,全州大学,韩国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TrackList研究了预训练数据对LLMs回答多样化语言查询的影响,发现LLMs在定义型问题表现最佳,但在例子型问题表现最差,且更倾向于改写流行知识而非尾部和技术知识。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15503 2025-11-25 cs.CL 89%

Llama2Vec: Unsupervised Adaptation of Large Language Models for Dense Retrieval

Llama2Vec: 无监督适应大型语言模型用于密集检索

Zheng Liu, Chaofan Li, Shitao Xiao, Yingxia Shao, Defu Lian

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Llama2Vec通过无监督适应LLM提升密集检索性能,实现新的最先进结果。

Comments ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14831 2025-11-19 eess.SP cs.LG 89%

Robust Transmission of Punctured Text with Large Language Model-based Recovery

Sojeong Park, Hyeonho Noh, Hyun Jong Yang

机构 * Department of Electrical Engineering, Pohang University of Science and Technology, Korea(首尔国立大学) Department of Electrical and Computer Engineering, Seoul National University, Korea(首尔国立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Transactions on Vehicular Technology, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14245 2025-11-19 cs.CL 89%

MuCPT: Music-related Natural Language Model Continued Pretraining

Kai Tian, Yirong Mao, Wendong Bi, Hanjie Wang, Que Wenhui

机构 * Tsinghua University(清华大学) Tencent Inc(腾讯公司)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14153 2025-11-19 cs.LG cs.CY 89%

A Comprehensive Study of Implicit and Explicit Biases in Large Language Models

Fatima Kazi, Alex Young, Yash Inani, Setareh Rafatirad

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18966 2025-11-18 cs.CL 89%

DataGen: Unified Synthetic Dataset Generation via Large Language Models

Yue Huang, Siyuan Wu, Chujie Gao, Dongping Chen, Qihui Zhang, Yao Wan, Tianyi Zhou, Jianfeng Gao, Chaowei Xiao, Lichao Sun, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) Huazhong University of Science and Technology(华中科技大学) MBZUAI University of Washington(华盛顿大学) Peking University(北京大学) University of Maryland, College Park(马里兰大学学院市分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Lehigh University(莱斯大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12131 2025-11-18 cs.CV cs.AI 89%

OAD-Promoter: Enhancing Zero-shot VQA using Large Language Models with Object Attribute Description

Quanxing Xu, Ling Zhou, Feifei Zhang, Jinyu Tian, Rubing Huang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09115 2025-11-11 cs.CL 89%

SinLlama -- A Large Language Model for Sinhala

H. W. K. Aravinda, Rashad Sirajudeen, Samith Karunathilake, Nisansa de Silva, Surangika Ranathunga, Rishemjit Kaur

机构 * Central Scientific Instruments Organisation, Academy of Scientific and Innovative Research(中央科学仪器组织,科学与创新研究院) School of Mathematical and Computational Sciences, Massey University(数学与计算科学学院,梅西大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03106 2025-11-06 cs.AI 89%

Large language models require a new form of oversight: capability-based monitoring

Katherine C. Kellogg, Bingyang Ye, Yifan Hu, Guergana K. Savova, Byron Wallace, Danielle S. Bitterman

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00691 2025-10-28 cs.CL 89%

Leveraging Large Language Models for Code-Mixed Data Augmentation in Sentiment Analysis

Linda Zeng

机构 * The Harker School(哈克尔学校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 17 pages, 4 figures, 11 tables, To be published in the Proceedings of the Second Workshop on Social Influence in Conversations (SICon 2024), co-located with EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10603 2025-10-24 cs.AI 89%

EA4LLM: A Gradient-Free Approach to Large Language Model Optimization via Evolutionary Algorithms

WenTao Liu, Siyu Song, Hao Hao, Aimin Zhou

机构 * Shanghai Institute of Artifical Intelligence Education, East China Normal University, Shanghai, China(上海人工智能教育研究院,东华大学,上海,中国) School of Computer Science and Technology, East China Normal University, Shanghai, China(计算机科学与技术学院,东华大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15480 2025-10-20 cs.SE cs.AI 89%

Selecting and Combining Large Language Models for Scalable Code Clone Detection

Muslim Chochlov, Gul Aftab Ahmed, James Vincent Patten, Yuanhua Han, Guoxian Lu, David Gregg, Jim Buckley

机构 * University of Limerick(利默里克大学) Trinity College Dublin(都柏林三一学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20639 2025-10-20 cs.CR cs.AI 89%

A Framework for Rapidly Developing and Deploying Protection Against Large Language Model Attacks

Adam Swanda, Amy Chang, Alexander Chen, Fraser Burch, Paul Kassianik, Konstantin Berlin

机构 * Cisco Systems(思科系统)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10179 2025-10-14 cs.SE cs.AI 89%

LLMs are All You Need? Improving Fuzz Testing for MOJO with Large Language Models

Linghan Huang, Peizhou Zhao, Huaming Chen

机构 * School of Electrical and Computer Engineering, University of Sydney(悉尼大学电气与计算机工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04848 2025-10-07 cs.CL 89%

Instability in Downstream Task Performance During LLM Pretraining

Yuto Nishida, Masaru Isonuma, Yusuke Oda

机构 * Nara Institute of Science and Technology(那拉科学与技术研究所) Tohoku University(东北大学) Research and Development Center for Large Language Models, National Institute of Informatics(大型语言模型研究与开发中心,信息学国家研究所)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23233 2025-09-30 cs.CL 89%

Detecting Corpus-Level Knowledge Inconsistencies in Wikipedia with Large Language Models

Sina J. Semnani, Jirayu Burapacheep, Arpandeep Khatua, Thanawan Atchariyachanvanit, Zheng Wang, Monica S. Lam

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04020 2025-09-29 cs.CL 89%

LLMAEL: Large Language Models are Good Context Augmenters for Entity Linking

Amy Xin, Yunjia Qi, Zijun Yao, Fangwei Zhu, Kaisheng Zeng, Xu Bin, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Beijing National Research Center for Information Science and Technology(计算机科学与技术系,北京信息科学国家研究中心) Tsinghua University(清华大学) Beijing University(北京大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.17785 2025-09-23 cs.CL 89%

Temporal Scaling Law for Large Language Models

Yizhe Xiong, Xiansheng Chen, Xin Ye, Hui Chen, Zijia Lin, Haoran Lian, Zhenpeng Su, Wei Huang, Jianwei Niu, Jungong Han, Guiguang Ding

机构 * School of Software, Tsinghua University(清华大学软件学院) BNRist, Tsinghua University(清华大学BNRist) Kuaishou Technology(快手科技) Beihang University(北航) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, BUPT(北京邮电大学计算机科学学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by EMNLP'25 Main Conference (Oral presentation), Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18655 2025-09-18 cs.CL cs.SD eess.AS 89%

Empathy Omni: Enabling Empathetic Speech Response Generation through Large Language Models

Haoyu Wang, Guangyan Zhang, Jiale Chen, Jingyu Li, Yuehai Wang, Yiwen Guo

机构 * Zhejiang University LIGHTSPEED Independent Researcher

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments 5 pages, 1 figure, submitted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12679 2025-09-17 cs.LG cs.CE quant-ph 89%

Large Language Model Scaling Laws for Neural Quantum States in Quantum Chemistry

Oliver Knitter, Dan Zhao, Stefan Leichenauer, Shravan Veerapaneni

机构 * University of Michigan(密歇根大学) SandboxAQ New York University(纽约大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 16 pages, 5 figures, to be submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09303 2025-09-12 cs.CL 89%

From scratch to silver: Creating trustworthy training data for patent-SDG classification using Large Language Models

Grazia Sveva Ascione, Nicolò Tamagnone

机构 * Department of Industrial Engineering, Polytechnic University of Turin(工业工程系,都灵理工学院) Venice School of Management, Ca Foscari University of Venice(威尼斯管理学院,威尼斯福斯卡里大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05382 2025-09-09 cs.CY cs.AI cs.CR 89%

User Privacy and Large Language Models: An Analysis of Frontier Developers' Privacy Policies

Jennifer King, Kevin Klyman, Emily Capstick, Tiffany Saade, Victoria Hsieh

机构 * Frontier Developers(前沿开发者)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments See additional files for appendices

详情

展开后加载摘要…

URL PDF HTML 收藏