arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2507.16852 2025-07-24 cs.CR cs.AI cs.LG 86%

SynthCTI: LLM-Driven Synthetic CTI Generation to enhance MITRE Technique Mapping

Álvaro Ruiz-Ródenas, Jaime Pujante Sáez, Daniel García-Algora, Mario Rodríguez Béjar, Jorge Blasco, José Luis Hernández-Ramos

机构 * Department of Information and Communication Engineering, Universidad de Murcia(信息与通信工程系,穆尔西亚大学) Department of Computer Systems, Universidad Politécnica de Madrid(计算机系统系,马德里理工大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16178 2025-07-23 cs.LG cs.AI 86%

LLM Data Selection and Utilization via Dynamic Bi-level Optimization

Yang Yu, Kai Han, Hang Zhou, Yehui Tang, Kaiqi Huang, Yunhe Wang, Dacheng Tao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) Huawei Noah’s Ark Lab(华为诺亚实验室) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments The 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03537 2025-07-21 cs.LG cs.AI physics.chem-ph q-bio.BM 86%

Two-Stage Pretraining for Molecular Property Prediction in the Wild

Kevin Tirta Wijaya, Minghao Guo, Michael Sun, Hans-Peter Seidel, Wojciech Matusik, Vahid Babaei

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11393 2025-07-15 cs.LG cs.CL 86%

DataDecide: How to Predict Best Pretraining Data with Small Experiments

Ian Magnusson, Nguyen Tai, Ben Bogin, David Heineman, Jena D. Hwang, Luca Soldaini, Akshita Bhagia, Jiacheng Liu, Dirk Groeneveld, Oyvind Tafjord, Noah A. Smith, Pang Wei Koh, Jesse Dodge

机构 * Allen Institute for AI Paul G. Allen School of Computer Science \& Engineering, University of Washington University of Pennsylvania

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21384 2025-06-27 cs.CL cs.AI cs.IR 86%

Leveraging LLM-Assisted Query Understanding for Live Retrieval-Augmented Generation

Guanting Dong, Xiaoxi Li, Yuyao Zhang, Mengjie Deng

机构 * Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at SIGIR 2025 LiveRAG Workshop (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17264 2025-06-24 cs.LG cs.AI 86%

OAT-Rephrase: Optimization-Aware Training Data Rephrasing for Zeroth-Order LLM Fine-Tuning

Jikai Long, Zijian Hu, Xiaodong Yu, Jianwen Xie, Zhaozhuo Xu

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Lambda, Inc.(Lambda公司)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04287 2025-06-23 cs.AI cs.LG 86%

Automated Skill Discovery for Language Agents through Exploration and Iterative Feedback

Yongjin Yang, Sinjae Kang, Juyong Lee, Dongjun Lee, Se-Young Yun, Kimin Lee

专题命中 预训练与数据 :language agent(title);LLM(abstract);large language model(abstract);language model(abstract)

Comments Preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12388 2025-06-17 cs.CL cs.AI 86%

Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model

Chong Li, Yingzhuo Deng, Jiajun Zhang, Chengqing Zong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

Comments ACL 2025, our codes and models are available at https://github.com/ZNLP/DMoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03009 2025-06-17 cs.LG cs.CL 86%

Scaling Laws for Upcycling Mixture-of-Experts Language Models

Seng Pei Liew, Takuya Kato, Sho Takase

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments ICML 2025. 16 figures, 8 tables. Code available at https://github.com/sbintuitions/sparse-upcycling-scaling-laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11485 2025-06-16 cs.CL cs.AI 86%

Relational Schemata in BERT Are Inducible, Not Emergent: A Study of Performance vs. Competence in Language Models

Cole Gawin

机构 * Cole Gawin(独立研究者)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06150 2025-06-04 cs.CL cs.AI 86%

A Scaling Law for Token Efficiency in LLM Fine-Tuning Under Fixed Compute Budgets

Ryan Lagasse, Aidan Kierans, Avijit Ghosh, Shiri Dori-Hacohen

机构 * University of Connecticut Storrs(康涅狄格大学斯托尔斯分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00958 2025-05-14 cs.CV cs.CL cs.LG 86%

2.5 Years in Class: A Multimodal Textbook for Vision-Language Pretraining

Wenqi Zhang, Hang Zhang, Xin Li, Jiashuo Sun, Yongliang Shen, Weiming Lu, Deli Zhao, Yueting Zhuang, Lidong Bing

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03019 2025-05-07 cs.CL cs.AI 86%

Memorization or Interpolation ? Detecting LLM Memorization through Input Perturbation Analysis

Albérick Euraste Djiré, Abdoul Kader Kaboré, Earl T. Barr, Jacques Klein, Tegawendé F. Bissyandé

机构 * ucl.ac.uk(伦敦大学学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12881 2025-04-28 cs.AI cs.CL 86%

MIND: Math Informed syNthetic Dialogues for Pretraining LLMs

Syeda Nahida Akter, Shrimai Prabhumoye, John Kamalu, Sanjeev Satheesh, Eric Nyberg, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 31 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.00448 2025-04-15 cs.LG cs.CL 86%

Beyond Chinchilla-Optimal: Accounting for Inference in Language Model Scaling Laws

Nikhil Sardana, Jacob Portes, Sasha Doubov, Jonathan Frankle

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments 16 pages, 7 figures, In the 41st International Conference on Machine Learning, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.00786 2025-04-10 cs.CL cs.LG 86%

CroissantLLM: A Truly Bilingual French-English Language Model

Manuel Faysse, Patrick Fernandes, Nuno M. Guerreiro, António Loison, Duarte M. Alves, Caio Corro, Nicolas Boizard, João Alves, Ricardo Rei, Pedro H. Martins, Antoni Bigata Casademunt, François Yvon, André F. T. Martins, Gautier Viaud, Céline Hudelot, Pierre Colombo

机构 * Illuin Technology(伊卢因科技) Unbabel(昂巴贝尔公司) Equall(伊阔尔公司) Diabolocom(迪亚博洛科姆公司) MICS, CentraleSupélec(中央理工学院MICS实验室) Instituto de Telecomunicações, Lisboa(里斯本电信研究所) INESC-ID, Lisboa(里斯本INESC-ID研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) Sorbonne Université, CNRS, ISIR, Paris(巴黎索邦大学法国国家科学研究中心智能与机器人系统研究所) Imperial College London(伦敦帝国学院) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.05816 2025-03-11 cs.CL cs.LG stat.ML 86%

Improving Pretraining Data Using Perplexity Correlations

Tristan Thrush, Christopher Potts, Tatsunori Hashimoto

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01900 2025-03-05 cs.LG cs.AI 86%

LLM-Empowered Class Imbalanced Graph Prompt Learning for Online Drug Trafficking Detection

Tianyi Ma, Yiyue Qian, Zehong Wang, Zheyuan Zhang, Chuxu Zhang, Yanfang Ye

机构 * University of Notre Dame(圣母大学) Amazon(亚马逊公司) University of Connecticut(康涅狄格大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07693 2025-03-04 cs.CL cs.AI 86%

Large, Small or Both: A Novel Data Augmentation Framework Based on Language Models for Debiasing Opinion Summarization

Yanyue Zhang, Pengfei Li, Yilong Lai, Deyu Zhou, Yulan He

机构 * Southeast University(东南大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

Journal ref COLING2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04665 2025-02-26 cs.CL cs.AI 86%

LLM-based MOFs Synthesis Condition Extraction using Few-Shot Demonstrations

Lei Shi, Zhimeng Liu, Yi Yang, Weize Wu, Yuyang Zhang, Hongbo Zhang, Jing Lin, Siyu Wu, Zihan Chen, Ruiming Li, Nan Wang, Zipeng Liu, Huobin Tan, Hongyi Gao, Yue Zhang, Ge Wang

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08661 2025-02-18 cs.CL cs.AI 86%

Few-shot LLM Synthetic Data with Distribution Matching

Jiyuan Ren, Zhaocheng Du, Zhihao Wen, Qinglin Jia, Sunhao Dai, Chuhan Wu, Zhenhua Dong

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 5 figures, accepted at www 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08145 2025-02-13 cs.LG cs.AI cs.DC 86%

Democratizing AI: Open-source Scalable LLM Training on GPU-based Supercomputers

Siddharth Singh, Prajwal Singhania, Aditya Ranjan, John Kirchenbauer, Jonas Geiping, Yuxin Wen, Neel Jain, Abhimanyu Hans, Manli Shu, Aditya Tomar, Tom Goldstein, Abhinav Bhatele

机构 * University of Maryland(马里兰大学) ELLIS Institute Tübingen(蒂宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10450 2025-02-11 cs.AI cs.CL 86%

KBLaM: Knowledge Base augmented Language Model

Xi Wang, Taketomo Isazawa, Liana Mikaelyan, James Hensman

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05083 2025-02-05 cs.CV cs.CL cs.IR cs.LG 86%

DREAM: Improving Video-Text Retrieval Through Relevance-Based Augmentation Using Large Foundation Models

Yimu Wang, Shuai Yuan, Bo Xue, Xiangru Jian, Wei Pang, Mushi Wang, Ning Yu

机构 * University of Waterloo(滑铁卢大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) Netflix Eyeline Studios(Netflix Eyeline工作室)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00894 2025-02-04 cs.CL cs.AI 86%

MorphBPE: A Morpho-Aware Tokenizer Bridging Linguistic Complexity for Efficient LLM Training Across Morphologies

Ehsaneddin Asgari, Yassine El Kheir, Mohammad Ali Sadraei Javaheri

机构 * Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Technical University of Berlin(柏林工业大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13491 2025-01-24 cs.CL cs.AI 86%

RECALL: Library-Like Behavior In Language Models is Enhanced by Self-Referencing Causal Cycles

Munachiso Nwadike, Zangir Iklassov, Toluwani Aremu, Tatsuya Hiraoka, Velibor Bojkovic, Benjamin Heinzerling, Hilal Alqaubeh, Martin Takáč, Kentaro Inui

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) RIKEN AIP(理化学研究所人工智能项目) Tohoku University(东北大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04512 2024-12-31 cs.CL cs.LG 86%

Chain-of-Translation Prompting (CoTR): A Novel Prompting Technique for Low Resource Languages

Tejas Deshpande, Nidhi Kowtal, Raviraj Joshi

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at PACLIC 38 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01865 2024-12-11 cs.LG cs.CL stat.ML 86%

What Will My Model Forget? Forecasting Forgotten Examples in Language Model Refinement

Xisen Jin, Xiang Ren

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments ICML 2024 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01505 2024-12-03 cs.CL cs.LG 86%

Scaling Law for Language Models Training Considering Batch Size

Xian Shuai, Yiding Wang, Yimeng Wu, Xin Jiang, Xiaozhe Ren

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17135 2024-11-27 cs.AI cs.CL 86%

LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble

Yujeong Lee, Sangwoo Shin, Wei-Jin Park, Honguk Woo

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Findings of EMNLP-2024 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏