arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2603.01348 2026-03-03 cs.LG cs.AI 88%

UTICA: Multi-Objective Self-Distllation Foundation Model Pretraining for Time Series Classification

UTICA:面向时间序列分类的多目标自蒸馏基础模型预训练

Yessin Moakher, Youssef Attia El Hili, Vasilii Feofanov

机构 * Ecole Polytechnique(巴黎高等师范学院) Huawei Noah’s Ark Lab(华为诺亚实验室) com(42.com)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 UTICA通过自蒸馏方法在时间序列分类中实现最先进的性能,结合增强裁剪和块掩码技术,提升模型对时间和局部结构的表征能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19548 2026-02-24 cs.CL cs.LG 88%

Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining

超越单一提取器:重新思考用于LLM预训练的HTML到文本提取

Jeffrey Li, Josh Gardner, Doug Kang, Fangping Shi, Karanjeet Singh, Chun-Liang Li, Herumb Shandilya, David Hall, Oncel Tuzel, Percy Liang, Ludwig Schmidt, Hadi Pour Ansari, Fartash Faghri

机构 * Apple(苹果公司) Stanford(斯坦福大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05495 2026-02-24 cs.CL cs.AI 88%

Transport and Merge: Cross-Architecture Merging for Large Language Models

传输与合并:面向大语言模型的跨架构合并

Chenhang Cui, Binyun Yang, Fei Shen, Yuxin Chen, Jingnan Zheng, Xiang Wang, An Zhang, Tat-Seng Chua

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于最优传输的跨架构合并框架,实现从高资源模型到低资源模型的有效知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18200 2026-01-27 cs.LG cs.AI 88%

HeterCSI: Channel-Adaptive Heterogeneous CSI Pretraining Framework for Generalized Wireless Foundation Models

HeterCSI:面向通用无线基础模型的通道自适应异构CSI预训练框架

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui, Xiaofeng Tao

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(中国移动网络技术国家工程研究中心,北京邮电大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理重点实验室,中央民族大学) China Telecom Corporation Limited Gansu Branch(中国电信集团甘肃分公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 HeterCSI通过解决CSI尺度异质性和场景多样性问题,提出一种通道自适应的异构CSI预训练框架,提升无线基础模型的泛化能力和效率。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14160 2026-01-21 cs.CL cs.AI 88%

Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law

通过合成数据实现领域适应:通过合成数据微调大型语言模型进行德国法律问答

Ali Hamza Bashir, Muhammad Rehan Khalid, Kostadin Cvejoski, Jana Birr, Jule Berghaus, Armin Berger, Sandra Halscheidt, Christian Temath, Rafet Sifa, David Berghaus

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) Georg-August-University Göttingen(哥廷根乔治-亚历山大大学) Lamarr Institute(拉马尔研究所) University of Bonn(波恩大学) JetBrains Research(JetBrains研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过合成数据生成方法微调大型语言模型,提升其在德国法律问答任务中的性能,展示合成数据在替代人工标注方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05184 2026-01-09 cs.AI cs.CL 88%

Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop

大语言模型自我消耗表现性循环中的观测与对策

Yaxuan Wang, Zhongteng Cai, Yujia Bao, Xueru Zhang, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) The Ohio State University(俄亥俄州立大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自我消耗表现性循环(SCPL)概念,通过实验发现表现性循环会增加偏好偏见并降低差异偏见,设计奖励拒绝采样策略以缓解偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12608 2025-12-23 cs.CL cs.AI 88%

Human-Inspired Learning for Large Language Models via Obvious Record and Maximum-Entropy Method Discovery

通过明显记录和最大熵方法发现实现大语言模型的人类启发式学习

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类启发式学习框架,通过明显记录和最大熵方法发现,提升大语言模型在罕见场景下的学习能力和方法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14887 2025-12-18 cs.CL cs.AI cs.IR 88%

Integrating Large Language Models and Knowledge Graphs to Capture Political Viewpoints in News Media

将大型语言模型与知识图谱结合以捕捉新闻媒体中的政治观点

Massimiliano Fadda, Enrico Motta, Francesco Osborne, Diego Reforgiato Recupero, Angelo Salatino

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大型语言模型和知识图谱结合的方法,提升新闻媒体中政治观点的识别与分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21265 2025-12-03 cs.CL cs.AI 88%

Multilingual Pretraining for Pixel Language Models

多语言预训练用于像素语言模型

Ilker Kesen, Jonas F. Lotz, Ingo Ziegler, Phillip Rust, Desmond Elliott

机构 * Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学) ROCKWOOL Foundation Research Unit(ROCKWOOL基金会研究单位)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 PIXEL-M4通过多语言预训练提升了像素语言模型对多种语言的支持能力,尤其在非拉丁字母语言中表现更优。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06031 2025-11-18 q-fin.ST cs.CL cs.LG q-fin.TR 88%

FinGPT: Open-Source Financial Large Language Models

Hongyang Yang, Xiao-Yang Liu, Christina Dan Wang

机构 * AI4Finance Foundation(AI4Finance基金会) Columbia University(哥伦比亚大学) New York University Shanghai(纽约大学上海)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by the FinLLM Symposium at IJCAI 2023. Recipient of the Best Presentation Award (Hongyang Yang). Workshop link: https://finllm.github.io/workshop. This is the first official FinGPT paper; please cite this work when referencing FinGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02494 2025-10-22 cs.LG cs.CL 88%

Analyzing Similarity Metrics for Data Selection for Language Model Pretraining

Dylan Sam, Ayan Chakrabarti, Afshin Rostamizadeh, Srikumar Ramalingam, Gui Citovsky, Sanjiv Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10085 2025-10-14 cs.CR cs.AI cs.LG 88%

Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning

Guozhi Liu, Qi Mu, Tiansheng Huang, Xinhua Wang, Li Shen, Weiwei Lin, Zhang Li

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computer Science at Georgia Institute of Technology(佐治亚理工学院计算机科学系) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) China and Pengcheng Laboratory(中 Pengcheng 实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03781 2025-10-07 cs.CL cs.AI 88%

Rezwan: Leveraging Large Language Models for Comprehensive Hadith Text Processing: A 1.2M Corpus Development

Majid Asgari-Bidhendi, Muhammad Amin Ghaseminia, Alireza Shahbazi, Sayyed Ali Hossayni, Najmeh Torabian, Behrouz Minaei-Bidgoli

机构 * Noor Avaran Jelvehaye Maanaei Najm Co.(诺尔·阿瓦兰·贾尔韦哈耶·马纳埃尼纳姆公司) Iran University of Science and Technology(伊朗科学技术大学) Islamic Azad University(伊斯兰 Azad 大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00125 2025-10-02 cs.CL cs.AI cs.CR 88%

Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning

Hong kyu Lee, Ruixuan Liu, Li Xiong

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14438 2025-09-19 cs.CL cs.AI 88%

Simulating a Bias Mitigation Scenario in Large Language Models

Kiana Kiashemshaki, Mohammad Jalili Torkamani, Negin Mahmoudi, Meysam Shirdel Bilehsavar

机构 * Department of Computer Science, Bowling Green State University(计算机科学系,布恩维尔州立大学) School of Computing, University of Nebraska–Lincoln(计算学院,内布拉斯加-林肯大学) Department of Civil, Environmental, and Ocean Engineering, Stevens Institute of Technology(土木、环境与海洋工程系,史蒂文斯理工学院) Department of Computer Science, University of South Carolina(计算机科学系,南卡罗来纳大学) Artificial Intelligence Institute, University of South Carolina(人工智能研究院,南卡罗来纳大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments preprint, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12443 2025-09-19 cs.CR cs.AI cs.LG 88%

Reconstruction of Differentially Private Text Sanitization via Large Language Models

Shuchao Pang, Zhigang Lu, Haichen Wang, Peng Fu, Yongbin Zhou, Minhui Xue

机构 * Nanjing University of Science and Technology(南京理工大学) Western Sydney University(西澳大学) Institute of Information Engineering(信息工程研究所) Chinese Academy of Sciences(中国科学院) Adelaide University(阿德莱德大学) Responsible AI Research (RAIR) Centre, The University of Adelaide(负责任人工智能研究中心,阿德莱德大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Comments RAID-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00979 2025-09-16 cs.CL cs.AI 88%

Synthesize-on-Graph: Knowledgeable Synthetic Data Generation for Continue Pre-training of Large Language Models

Shengjie Ma, Xuhui Jiang, Chengjin Xu, Cehao Yang, Liyu Zhang, Jian Guo

机构 * DataArc Tech Ltd.(DataArc科技有限公司) IDEA Research, International Digital Economy Academy(IDEA研究所、国际数字经济学院) Gaoling School of Artificial Intelligence, Renmin University of China(法律人工智能学院,中国人民大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00053 2025-09-03 cs.MM cs.AI cs.CL 88%

Traj-MLLM: Can Multimodal Large Language Models Reform Trajectory Data Mining?

Shuo Liu, Di Yao, Yan Lin, Gao Cong, Jingping Bi

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Computer Science, Aalborg University(奥胡斯大学计算机科学系) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 20 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10024 2025-08-22 cs.CR cs.AI cs.CL 88%

Private Memorization Editing: Turning Memorization into a Defense to Strengthen Data Privacy in Large Language Models

Elena Sofia Ruzzetti, Giancarlo A. Xompero, Davide Venditti, Fabio Massimo Zanzotto

机构 * Human Centric ART, University of Rome Tor Vergata(罗马托尔维加塔大学人本艺术研究中心) Almawave S.p.A.(阿尔马韦斯公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments To be published at ACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02532 2025-08-05 cs.CL cs.LG 88%

Contextual Graph Transformer: A Small Language Model for Enhanced Engineering Document Information Extraction

Karan Reddy, Mayukha Pal

专题命中 预训练与数据 :language model(title,abstract);small language model(title);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15740 2025-07-17 cs.CL cs.CR cs.IR cs.LG 88%

Protecting Copyrighted Material with Unique Identifiers in Large Language Model Training

Shuai Zhao, Linchao Zhu, Ruijie Quan, Yi Yang

机构 * ReLER Lab, AAII, University of Technology Sydney(ReLER实验室,AAII,悉尼大学) ReLER Lab, CCAI, Zhejiang University(ReLER实验室,CCAI,浙江大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments A technical report, work mainly done in the early of 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10300 2025-07-15 cs.CV cs.AI cs.CL 88%

FaceLLM: A Multimodal Large Language Model for Face Understanding

Hatef Otroshi Shahreza, Sébastien Marcel

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted in ICCV 2025 workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06138 2025-07-09 cs.CL cs.AI 88%

Coding Triangle: How Does Large Language Model Understand Code?

Taolin Zhang, Zihan Ma, Maosong Cao, Junnan Liu, Songyang Zhang, Kai Chen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Xi’an Jiaotong University(西安交通大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03433 2025-07-08 cs.CL cs.AI 88%

Improving Social Determinants of Health Documentation in French EHRs Using Large Language Models

Adrien Bazoge, Pacôme Constant dit Beaufils, Mohammed Hmitouch, Romain Bourcier, Emmanuel Morin, Richard Dufour, Béatrice Daille, Pierre-Antoine Gourraud, Matilde Karakachoff

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02335 2025-07-01 cs.LG cs.CL stat.ML 88%

Sparsing Law: Towards Large Language Models with Greater Activation Sparsity

Yuqi Luo, Chenyang Song, Xu Han, Yingfa Chen, Chaojun Xiao, Xiaojun Meng, Liqun Deng, Jiansheng Wei, Zhiyuan Liu, Maosong Sun

机构 * Dept. of Comp. Sci. \& Tech., Institute for AI, Tsinghua University, Beijing, China Huawei Noah’s Ark Lab, China

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 23 pages, 13 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13044 2025-06-17 cs.CL cs.AI 88%

Just Go Parallel: Improving the Multilingual Capabilities of Large Language Models

Muhammad Reza Qorib, Junyi Li, Hwee Tou Ng

机构 * Department of Computer Science, National University of Singapore(计算机科学系,新加坡国立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14230 2025-06-12 cs.CL cs.AI cs.CY 88%

Raising the Bar: Investigating the Values of Large Language Models via Generative Evolving Testing

Han Jiang, Xiaoyuan Yi, Zhihua Wei, Ziang Xiao, Shu Wang, Xing Xie

机构 * Tongji University(同济大学) Johns Hopkins University(约翰霍普金斯大学) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft Research Asia(微软亚洲研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17607 2025-06-10 cs.LG cs.CL 88%

Synthetic Text Generation for Training Large Language Models via Gradient Matching

Dang Nguyen, Zeman Li, Mohammadhossein Bateni, Vahab Mirrokni, Meisam Razaviyayn, Baharan Mirzasoleiman

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments 18 pages, 10 figures, 5 tables, link: https://github.com/BigML-CS-UCLA/GRADMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18927 2025-06-03 cs.CL cs.AI 88%

Moderating Harm: Benchmarking Large Language Models for Cyberbullying Detection in YouTube Comments

Amel Muminovic

机构 * Faculty of Engineering(工程学院) International Balkan University(国际巴尔干大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24788 2025-06-02 cs.CL cs.AI 88%

Drop Dropout on Single-Epoch Language Model Pretraining

Houjun Liu, John Bauer, Christopher D. Manning

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to ACL Findings; 5 pages, 2 figures, 4 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏