arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2504.02107 2025-06-09 cs.LG cs.CL 90%

TiC-LM: A Web-Scale Benchmark for Time-Continual LLM Pretraining

Jeffrey Li, Mohammadreza Armandpour, Iman Mirzadeh, Sachin Mehta, Vaishaal Shankar, Raviteja Vemulapalli, Samy Bengio, Oncel Tuzel, Mehrdad Farajtabar, Hadi Pouransari, Fartash Faghri

机构 * University of Washington(华盛顿大学) Apple(苹果公司)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

Comments Code available at: https://github.com/apple/ml-tic-lm

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17645 2025-06-03 cs.SD cs.AI cs.CL eess.AS 90%

SongComposer: A Large Language Model for Lyric and Melody Generation in Song Composition

Shuangrui Ding, Zihan Liu, Xiaoyi Dong, Pan Zhang, Rui Qian, Junhao Huang, Conghui He, Dahua Lin, Jiaqi Wang

机构 * The Chinese University of Hong Kong(中国香港大学) Beihang University(北航) Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(创新香港下的CPII)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments ACL 2025 main. project page: https://pjlab-songcomposer.github.io/ code: https://github.com/pjlab-songcomposer/songcomposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24844 2025-06-02 cs.LG cs.CL 90%

Chameleon: A Flexible Data-mixing Framework for Language Model Pretraining and Finetuning

Wanyun Xie, Francesco Tonin, Volkan Cevher

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14256 2025-05-21 cs.CL cs.AI 90%

FuxiMT: Sparsifying Large Language Models for Chinese-Centric Multilingual Machine Translation

Shaolin Zhu, Tianyu Dong, Bo Li, Deyi Xiong

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) School of Software, Tsinghua University(软件学院,清华大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10559 2025-05-16 cs.LG cs.AI physics.data-an stat.ML 90%

Neural Thermodynamic Laws for Large Language Model Training

Ziming Liu, Yizhou Liu, Jeff Gore, Max Tegmark

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10182 2025-05-16 cs.CL cs.LG 90%

Mining Hidden Thoughts from Texts: Evaluating Continual Pretraining with Synthetic Data for LLM Reasoning

Yoichi Ishibashi, Taro Yano, Masafumi Oyamada

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09949 2025-05-16 cs.LG cs.CL stat.AP 90%

Advanced Crash Causation Analysis for Freeway Safety: A Large Language Model Approach to Identifying Key Contributing Factors

Ahmed S. Abdelrahman, Mohamed Abdel-Aty, Samgyu Yang, Abdulrahman Faden

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02848 2025-05-07 cs.CY cs.AI cs.CL 90%

Aligning Large Language Models with Healthcare Stakeholders: A Pathway to Trustworthy AI Integration

Kexin Ding, Mu Zhou, Akshay Chaudhari, Shaoting Zhang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Stanford University(斯坦福大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08874 2025-04-15 cs.LG cs.AI 90%

Distilling and exploiting quantitative insights from Large Language Models for enhanced Bayesian optimization of chemical reactions

Roshan Patel, Saeed Moayedpour, Louis De Lescure, Lorenzo Kogler-Anele, Alan Cherney, Sven Jager, Yasser Jangjou

机构 * CMC Synthetics Platform, Sanofi(赛诺菲CMC合成平台) Digital R&D, Sanofi(赛诺菲数字研发部)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19363 2025-04-09 cs.CL cs.AI 90%

DataMan: Data Manager for Pre-training Large Language Models

Ru Peng, Kexin Yang, Yawen Zeng, Junyang Lin, Dayiheng Liu, Junbo Zhao

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments ICLR2025 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02883 2025-04-07 cs.CL cs.LG 90%

SemEval-2025 Task 4: Unlearning sensitive content from Large Language Models

Anil Ramakrishna, Yixin Wan, Xiaomeng Jin, Kai-Wei Chang, Zhiqi Bu, Bhanukiran Vinzamuri, Volkan Cevher, Mingyi Hong, Rahul Gupta

机构 * Amazon AGI(亚马逊AGI) UCLA(加利福尼亚大学洛杉矶分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) EPFL(洛桑联邦理工学院) University of Minnesota(明尼苏达大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13323 2025-04-01 cs.SE cs.AI cs.LG 90%

Are Large Language Models Memorizing Bug Benchmarks?

Daniel Ramos, Claudia Mamede, Kush Jain, Paulo Canelas, Catarina Gamboa, Claire Le Goues

机构 * Carnegie Mellon University(卡内基梅隆大学) INESC-ID FEUP(波尔图大学工程学院) LASIGE

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16135 2025-03-05 cs.CL cs.LG 90%

Crosslingual Capabilities and Knowledge Barriers in Multilingual Large Language Models

Lynn Chua, Badih Ghazi, Yangsibo Huang, Pritish Kamath, Ravi Kumar, Pasin Manurangsi, Amer Sinha, Chulin Xie, Chiyuan Zhang

机构 * Princeton University(普林斯顿大学) Google Research(谷歌研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04556 2025-02-26 cs.CL cs.LG 90%

How Does Code Pretraining Affect Language Model Task Performance?

Jackson Petty, Sjoerd van Steenkiste, Tal Linzen

机构 * New York University(纽约大学) Google Research(谷歌研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Journal ref Transactions on Machine Learning Research (January 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16280 2025-02-25 cs.LG cs.AI 90%

Human Preferences in Large Language Model Latent Space: A Technical Analysis on the Reliability of Synthetic Data in Voting Outcome Prediction

Sarah Ball, Simeon Allmendinger, Frauke Kreuter, Niklas Kühl

机构 * Ludwig-Maximilian-University Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Bayreuth(拜罗伊特大学) Fraunhofer Institute for Applied Information Technology FIT(弗劳恩霍夫应用信息技术研究所) University of Maryland(马里兰大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08524 2025-02-13 cs.LG cs.CL 90%

LLM Pretraining with Continuous Concepts

Jihoon Tack, Jack Lanchantin, Jane Yu, Andrew Cohen, Ilia Kulikov, Janice Lan, Shibo Hao, Yuandong Tian, Jason Weston, Xian Li

机构 * FAIR at Meta(Meta FAIR研究院) KAIST(韩国科学技术院) UC San Diego(加州大学圣迭戈分校)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08707 2025-02-13 cs.LG cs.AI 90%

Beam Prediction based on Large Language Models

Yucheng Sheng, Kai Huang, Le Liang, Peng Liu, Shi Jin, Geoffrey Ye Li

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Huawei Technologies Co., Ltd.(华为技术有限公司) Imperial College London(帝国理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00059 2025-02-04 cs.LG cs.AI 90%

Large Language Models are Few-shot Multivariate Time Series Classifiers

Yakun Chen, Zihao Li, Chao Yang, Xianzhi Wang, Guandong Xu

机构 * University of Technology Sydney(悉尼科技大学) Ocean University of China(中国海洋大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19298 2025-02-03 cs.AI cs.LG cs.NI 90%

Synthetic User Behavior Sequence Generation with Large Language Models for Smart Homes

Zhiyao Xu, Dan Zhao, Qingsong Zou, Jingyu Xiao, Yong Jiang, Zhenhui Yuan, Qing Li

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) PengCheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学) University of Warwick(华威大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16241 2025-01-28 cs.LG cs.CL hep-th physics.data-an 90%

Phase Transitions in Large Language Models and the $O(N)$ Model

Youran Sun, Babak Haghighat

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences(北京数学科学研究所) Microsoft Research Asia(微软亚洲研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18023 2025-01-16 cs.AI cs.CL 90%

Do Large Language Models Mirror Cognitive Language Processing?

Yuqi Ren, Renren Jin, Tongxuan Zhang, Deyi Xiong

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部) College of Computer and Information Engineering, Tianjin Normal University(天津师范大学计算机与信息工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05078 2025-01-10 cs.LG cs.AI 90%

Analyzing Memorization in Large Language Models through the Lens of Model Attribution

Tarun Ram Menta, Susmit Agrawal, Chirag Agarwal

机构 * Adobe MDSR IIT Hyderabad(印度理工学院海得拉巴分校) University of Virginia(弗吉尼亚大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20357 2024-12-31 cs.CL cs.AI 90%

HindiLLM: Large Language Model for Hindi

Sanjay Chouhan, Shubha Brata Nath, Aparajita Dutta

机构 * Indian Institute of Information Technology Guwahati(印度古瓦哈蒂印度信息技术学院) National Institute of Technology Silchar(锡尔恰尔印度国家技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Journal ref Pattern Recognition. ICPR 2024. Lecture Notes in Computer Science, vol 15306, pp. 255--270, Springer, Cham, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15431 2024-12-23 cs.LG cs.CL cs.CR 90%

Time Will Tell: Timing Side Channels via Output Token Count in Large Language Models

Tianchen Zhang, Gururaj Saileshwar, David Lie

机构 * University of Toronto(多伦多大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.19998 2024-12-23 cs.CL cs.AI 90%

Do Influence Functions Work on Large Language Models?

Zhe Li, Wei Zhao, Yige Li, Jun Sun

机构 * Singapore Management University(新加坡管理大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10630 2024-11-26 cs.CL cs.LG 90%

HLAT: High-quality Large Language Model Pre-trained on AWS Trainium

Haozheng Fan, Hao Zhou, Guangtai Huang, Parameswaran Raman, Xinwei Fu, Gaurav Gupta, Dhananjay Ram, Yida Wang, Jun Huan

机构 * Amazon Web Services(亚马逊网络服务) AWS AI Labs(AWS AI实验室) AGI Foundations, Amazon(亚马逊AGI基础研究部)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08262 2024-11-07 cs.CL cs.AI 90%

Pretraining and Updates of Domain-Specific LLM: A Case Study in the Japanese Business Domain

Kosuke Takahashi, Takahiro Omi, Kosuke Arima, Tatsuya Ishigaki

机构 * Stockmark(斯托克马克公司) National Institute of Advanced Industrial Science and Technology(国立先进工业科学技术研究院)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);large language model(abstract);language model(abstract)

Comments Accepted at PACLIC 38

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05188 2024-11-05 cs.CR cs.AI cs.CL 90%

Have You Merged My Model? On The Robustness of Large Language Model IP Protection Methods Against Model Merging

Tianshuo Cong, Delong Ran, Zesen Liu, Xinlei He, Jinyuan Liu, Yichen Gong, Qi Li, Anyu Wang, Xiaoyun Wang

机构 * Tsinghua University(清华大学) Xidian University(西安电子科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhongguancun Laboratory(中关村实验室) National Financial Cryptography Research Center(国家金融密码研究中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted by ACM CCS-LAMPS 2024 (Best Paper Award)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00801 2024-11-05 cs.IR cs.AI cs.CL 90%

Self-Retrieval: End-to-End Information Retrieval with One Large Language Model

Qiaoyu Tang, Jiawei Chen, Zhuoqun Li, Bowen Yu, Yaojie Lu, Cheng Fu, Haiyang Yu, Hongyu Lin, Fei Huang, Ben He, Xianpei Han, Le Sun, Yongbin Li

机构 * Chinese Academy of Sciences(中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024 Camera-ready Version. Code: https://github.com/icip-cas/SelfRetrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12670 2024-10-31 cs.AI cs.LG 90%

Stealth edits to large language models

Oliver J. Sutton, Qinghua Zhou, Wei Wang, Desmond J. Higham, Alexander N. Gorban, Alexander Bastounis, Ivan Y. Tyukin

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

Comments 28 pages, 14 figures. Open source implementation: https://github.com/qinghua-zhou/stealth-edits

详情

展开后加载摘要…

URL PDF HTML 收藏