arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140401 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12502 篇

2607.22652 2026-07-28 cs.AI 新提交 91%

KG2Code: Bridging Knowledge Graphs and Large Language Models via Executable Code for Question Answering

KG2Code:通过可执行代码连接知识图谱与大语言模型以进行问答

Yike Wu, Nan Hu, Guilin Qi, Guohui Xiao, Chen Jiang, Xinchun Zou, Yuchen Lu, Songlin Zhai, Yongrui Chen, Yuyang Zhang, Xiaoguang Li, Lifeng Shang, Jiaoyan Chen, Jeff Z. Pan

机构 * Southeast University(东南大学) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其交叉应用重点实验室(东南大学)) Huawei Technologies(华为技术有限公司) University of Manchester(曼彻斯特大学) University of Edinburgh(爱丁堡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 研究针对知识图谱问答中现有方法的局限,提出KG2Code方法,将知识图谱转换为代码表示,在此基础上构建KG2Code-QA框架,把KGQA作为代码生成任务,还构建代码语料库,训练后的模型在KGQA任务中表现优异且泛化性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30634 2026-06-30 cs.LG 91%

One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

一步梯度延迟并非大规模异步流水线并行LLM预训练的障碍

Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.LG

AI总结 本文挑战异步流水线并行中一步梯度延迟导致不稳定的普遍观点,发现延迟影响取决于优化器选择,Muon等新优化器具有鲁棒性,并提出基于误差反馈的修正方法,在10B参数模型上实现与同步训练相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29773 2026-06-30 cs.LG 91%

GLIP: Graph and LLM Joint Pretraining for Graph-Level Tasks

GLIP:面向图级任务的图与大型语言模型联合预训练

Haoxin Sun, Yiqing Lin, Yajun Huang, Chenhui Dong, Mingjun Li, Zhongzhi Zhang

机构 * Fudan University(复旦大学) ByteDance(字节跳动)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出GLIP框架,通过图增强、多令牌选择策略和扩散投影器,联合预训练图神经网络和大型语言模型,在图级分类与推理任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20381 2026-06-19 cs.AI 新提交 91%

Rethinking Shrinkage Bias in LLM FP4 Pretraining: Geometric Origin, Systemic Impact, and UFP4 Recipe

重新思考LLM FP4预训练中的收缩偏差:几何起源、系统影响与UFP4方案

Qian Zhao, Kunlong Chen, Changxin Tian, Zhonghui Jiang, Haitao Zhang, Chaofan Yu, Peijie Jiang, Mingliang Gong, Jia Liu, Ziqi Liu, Zhiqiang Zhang, Jun Zhou

机构 * Ling Team, Ant Group(蚂蚁集团灵团队)

专题命中 预训练与数据 :LLM(title,title_cn);pretraining(title,abstract);分类 cs.AI

AI总结 本文发现E2M1格式因几何不对称导致收缩偏差,该偏差经随机哈达玛变换放大,造成训练不稳定;提出均匀网格E1M2/INT4及UFP4训练方案,在多种模型上实现更低损失。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06048 2026-06-19 cs.LG 版本更新 91%

BLISS: A Lightweight Bilevel Influence Scoring Method for Data Selection in Language Model Pretraining

BLISS: 一种用于语言模型预训练数据选择的轻量级双层影响评分方法

Jie Hao, Rui Yu, Wei Zhang, Huixia Wang, Jie Xu, Mingrui Liu

机构 * Department of Computer Science, George Mason University, USA(乔治·马歇尔大学计算机科学系) IBM T.J. Watson Research Center, USA(IBM T.J. Watson研究部) Department of Statistics, Rice University(里士大学统计系) Department of System Engineering & Operations Research, George Mason University, USA(乔治·马歇尔大学系统工程与运营管理系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 提出一种无需外部预训练模型的轻量级数据选择方法BLISS,通过双层优化和代理模型估计训练样本的长期影响,实现高效数据筛选,在C4数据集上预训练多种规模模型,显著加速收敛并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19170 2026-06-18 cs.CL 新提交 91%

Dango: A Strictly L1-Only Large Language Model for Studying Second Language Acquisition

Dango:一个严格仅L1的大型语言模型,用于研究第二语言习得

Shiho Matta, Yin Jou Huang, Fei Cheng, Takashi Kodama, Hirokazu Kiyomaru, Yugo Murawaki

机构 * Kyoto University(京都大学) NII-LLMC(日本国立信息与通信技术研究所-语言模型中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 提出1.8B参数的Dango模型,通过过滤L2污染和微调L2学习课程,模拟人类L2产出模式,优于未过滤和多语言基线。

Comments 8 pages main text, 20 pages total including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06738 2026-02-17 cs.CL 91%

AWM: Accurate Weight-Matrix Fingerprint for Large Language Models

AWM: 用于大型语言模型的准确权重矩阵指纹

Boyi Zeng, Lin Chen, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 AWM通过基于权重矩阵的无训练指纹方法,利用线性分配问题和无偏中心核对齐相似性,实现对大型语言模型训练来源的可靠识别。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08500 2026-01-14 cs.CL 91%

It's All About the Confidence: An Unsupervised Approach for Multilingual Historical Entity Linking using Large Language Models

信心才是关键:一种用于多语言历史实体链接的无监督方法,使用大语言模型

Cristian Santini, Marieke Van Erp, Mehwish Alam

机构 * Department of Humanities, University of Macerata(马切拉塔大学人文学科系) KNAW Humanities Cluster, DHLab(荷兰人文集群、DHLab) INFRES Department, Télécom Paris(巴黎电信学院INFRES部门)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

AI总结 本文提出MHEL-LLaMo,一种结合小型语言模型和大语言模型的无监督方法,用于多语言历史实体链接,通过置信度评分降低计算成本并提升准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11496 2025-09-16 cs.CL 91%

AKCIT-FN at CheckThat! 2025: Switching Fine-Tuned SLMs and LLM Prompting for Multilingual Claim Normalization

Fabrycio Leite Nakano Almada, Kauan Divino Pouso Mariano, Maykon Adriell Dutra, Victor Emanuel da Silva Monteiro, Juliana Resplande Sant'Anna Gomes, Arlindo Rodrigues Galvão Filho, Anderson da Silva Soares

机构 * Institute of Informatics, Federal University of Goiás, Brazil(信息学院,戈亚斯联邦大学,巴西) Advanced Knowledge Center in Immersive Technology (AKCIT), Federal University of Goiás, Brazil(沉浸式技术高级知识中心(AKCIT),戈亚斯联邦大学,巴西)

专题命中 预训练与数据 :LLM(title,abstract);prompting(title,abstract);large language model(abstract);language model(abstract)

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00203 2025-03-11 cs.CL 91%

Llamarine: Open-source Maritime Industry-specific Large Language Model

William Nguyen, An Phan, Konobu Kimura, Hitoshi Maeno, Mika Tanaka, Quynh Le, William Poucher, Christopher Nguyen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13395 2023-10-23 cs.CL 91%

Cache me if you Can: an Online Cost-aware Teacher-Student framework to Reduce the Calls to Large Language Models

Ilias Stogiannidis, Stavros Vassos, Prodromos Malakasiotis, Ion Androutsopoulos

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Short paper (5 pages), accepted at Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25657 2026-08-27 cs.AI cs.LG cs.PL cs.SE 新提交 91%

Narcissus: Program Synthesis Using Context-Aware LLM Approximations

Narcissus:使用上下文感知大语言模型近似值的程序合成

Tilman Hinnerichs, Sebastijan Dumancic, Neil Yorke-Smith

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 预训练与数据 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 Narcissus是一种程序合成器,通过保留LLM提议的语法树并结合上下文评分与正则化项,在多领域搜索中优于静态引导及修复提议的方法,解决ARC任务的比例显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24737 2026-05-26 cs.CL cs.AI cs.CY 91%

Who judges the judges? Governance from metrics: a runtime framework for continuous LLM compliance monitoring

谁来评判评判者?基于指标的治理:面向持续LLM合规监控的运行时框架

Jehanne Dussert

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);small language model(abstract);SLM(abstract_cn)

AI总结 针对AI合规作为审计时二元判定而非生产系统持续可测量属性的问题,提出基于指标的治理原则,并开发开源框架govllm,通过运行时可观测性信号实现持续合规监控,验证了多模型陪审团设计在监管评估中的有效性。

Comments 41 pages, 8 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21845 2026-05-22 cs.CL cs.AI 91%

Comparing LLM and Fine-Tuned Model Performance on NVDRS Circumstance Extraction with Varying Prompt Complexity

对比LLM和微调模型在不同提示复杂度下的NVDRS情境提取性能

Geoffrey Martin, Xuan Zhong Feng, Yifan Peng

机构 * Department of Population Health Sciences, Weill Cornell Medicine(人群健康科学系,威尔·康奈尔医学学院) Systems Engineering, Cornell University(系统工程,康奈尔大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在不同提示复杂度下,LLM与微调模型在NVDRS情境提取任务中的表现差异,提出了一种复杂度评分算法,并展示了一个混合方法,通过不同情境选择提示策略,发现LLM在低 prevalence 情境中表现更优,且框架能跨不同前沿LLM通用。

Comments Accepted at IEEE ICHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15556 2025-09-22 cs.CL cs.AI 91%

Exploring Polyglot Harmony: On Multilingual Data Allocation for Large Language Models Pretraining

Ping Guo, Yubing Ren, Binbin Liu, Fengze Liu, Haobin Lin, Yifan Zhang, Bingni Zhang, Taifeng Wang, Yin Zheng

机构 * ByteDance(字节跳动) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17400 2025-08-26 cs.LG cs.AI cs.IR 91%

Retrieval Capabilities of Large Language Models Scale with Pretraining FLOPs

Jacob Portes, Connor Jennings, Erica Ji Yuen, Sasha Doubov, Michael Carbin

机构 * Databricks Mosaic Research(Databricks Mosaic研究)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);LLM(abstract)

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07463 2025-06-10 cs.CL cs.AI 91%

CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models

Guang Liu, Liangdong Wang, Jijie Li, Yang Yu, Yao Xu, Jiabei Chen, Yu Bai, Feng Liao, Yonghua Lin

机构 * Data Research Team(数据研究团队) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(title);language model(title);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00869 2024-12-20 cs.CL cs.AI 91%

KnowledgePrompts: Exploring the Abilities of Large Language Models to Solve Proportional Analogies via Knowledge-Enhanced Prompting

Thilini Wijesiriwardene, Ruwan Wickramarachchi, Sreeram Vennam, Vinija Jain, Aman Chadha, Amitava Das, Ponnurangam Kumaraguru, Amit Sheth

机构 * AI Institute, University of South Carolina(南卡罗来纳大学人工智能学院) IIIT Hyderabad(印度信息技术与管理研究所海得拉巴分校) Meta AI Amazon GenAI(亚马逊生成式人工智能部门)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI

Comments Accepted at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00905 2024-06-21 cs.CL cs.AI 91%

All Languages Matter: On the Multilingual Safety of Large Language Models

Wenxuan Wang, Zhaopeng Tu, Chang Chen, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, Michael R. Lyu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)

Comments Accepted by ACL 2024 Findings. The first multilingual safety benchmark for large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12276 2024-03-25 cs.HC cs.AI cs.CL cs.ET 91%

LLMR: Real-time Prompting of Interactive Worlds using Large Language Models

Fernanda De La Torre, Cathy Mengying Fang, Han Huang, Andrzej Banburski-Fahey, Judith Amores Fernandez, Jaron Lanier

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI

Comments 46 pages, 18 figures; Matching version accepted at CHI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03025 2023-05-05 cs.CL cs.AI 91%

Panda LLM: Training Data and Evaluation for Open-Sourced Chinese Instruction-Following Large Language Models

Fangkai Jiao, Bosheng Ding, Tianze Luo, Zhanfeng Mo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26511 2026-03-30 cs.CL cs.AI cs.LG 91%

AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese

AMALIA技术报告:一个完全开源的大型语言模型用于葡萄牙语(欧洲葡萄牙语)

Afonso Simplício, Gonçalo Vinagre, Miguel Moura Ramos, Diogo Tavares, Rafael Ferreira, Giuseppe Attanasio, Duarte M. Alves, Inês Calvo, Inês Vieira, Rui Guerra, James Furtado, Beatriz Canaverde, Iago Paulo, Vasco Ramos, Diogo Glória-Silva, Miguel Faria, Marcos Treviso, Daniel Gomes, Pedro Gomes, David Semedo, André Martins, João Magalhães

机构 * NOVA School of Science and Technology(新大学科学与技术学院) NOVA LINCS(新大学LINCS实验室) Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) Fundação para a Ciência e Tecnologia(科学技术基金会)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)

AI总结 AMALIA是一个完全开源的大型语言模型,专注于欧洲葡萄牙语,通过增加高质量数据提升模型性能,并发布新基准测试以评估葡萄牙语生成和语言能力。

Comments PROPOR 2026 - The 17th International Conference on Computational Processing of Portuguese

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00819 2026-03-12 cs.LG cs.AI cs.CL 91%

Large Language Models for Travel Behavior Prediction

基于大语言模型的出行行为预测

Baichuan Mo, Hanyong Xu, Ruoyun Ma, Jung-Hoon Cho, Dingyi Zhuang, Xiaotong Guo, Jinhua Zhao

机构 * Department of Civil Engineering, Tsinghua University, Beijing, China(清华大学土木工程系) Department of Civil and Environmental Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139(麻省理工学院土木与环境工程系) Department of Urban Studies and Planning, Massachusetts Institute of Technology, Cambridge, MA 20139(麻省理工学院城市研究与规划系) Department of Management Science and Engineering, Stanford University, Stanford, CA 94305(斯坦福大学管理科学与工程系)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型进行出行行为预测,通过零样本提示和文本嵌入两种方法,实现了与传统模型相当的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07017 2026-03-10 cs.CL cs.AI cs.LG 91%

Can Safety Emerge from Weak Supervision? A Systematic Analysis of Small Language Models

安全能否从弱监督中涌现?小型语言模型的系统分析

Punyajoy Saha, Sudipta Halder, Debjyoti Mondal, Subhadarshi Panda

机构 * Samsung Research Institute(三星研究院)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);large language model(abstract);preference optimization(abstract)

AI总结 Self-MOA通过弱监督实现小型语言模型的安全对齐,显著提升安全性的同时保持有用性,减少对人工标注数据的依赖。

Comments 19 pages, 10 tables, 7 figures, under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04871 2025-12-05 cs.AI cs.CL cs.LG 91%

STELLA: Guiding Large Language Models for Time Series Forecasting with Semantic Abstractions

STELLA: 通过语义抽象引导大型语言模型进行时间序列预测

Junjie Fan, Hongye Zhao, Linduo Wei, Jiayu Rao, Guijia Li, Jiaxin Yuan, Wenqi Xu, Yong Qi

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 STELLA通过动态语义抽象机制,提升大型语言模型在时间序列预测中的表现,实现更精准的长期和短期预测。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18080 2025-04-28 cs.CL cs.AI cs.LG 91%

Stabilizing Reasoning in Medical LLMs with Continued Pretraining and Reasoning Preference Optimization

Wataru Kawakami, Keita Suzuki, Junichiro Iwasawa

机构 * Preferred Networks Inc.(Preferred Networks公司) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 预训练与数据 :pretraining(title,abstract);preference optimization(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22269 2025-03-12 cs.LG cs.AI cs.CL stat.ML 91%

Fourier Head: Helping Large Language Models Learn Complex Probability Distributions

Nate Gillman, Daksh Aggarwal, Michael Freeman, Saurabh Singh, Chen Sun

机构 * Brown University(布朗大学) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)

Comments Camera ready version (ICLR 2025). Code at https://nategillman.com/fourier-head

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10254 2025-03-07 cs.LG cs.AI cs.CL stat.ML 91%

LoLCATs: On Low-Rank Linearizing of Large Language Models

Michael Zhang, Simran Arora, Rahul Chalamala, Alan Wu, Benjamin Spector, Aaryan Singhal, Krithik Ramesh, Christopher Ré

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments 58 pages, 25 figures, 26 tables, ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14985 2025-03-04 cs.CL cs.AI cs.LG 91%

Generalization v.s. Memorization: Tracing Language Models' Capabilities Back to Pretraining Data

Xinyi Wang, Antonis Antoniades, Yanai Elazar, Alfonso Amayuelas, Alon Albalak, Kexun Zhang, William Yang Wang

机构 * University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学) SynthLabs Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);LLM(abstract);large language model(abstract)

Comments Accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01720 2025-02-07 cs.AI cs.CL cs.LG 91%

Towards a Theoretical Understanding of Synthetic Data in LLM Post-Training: A Reverse-Bottleneck Perspective

Zeyu Gan, Yong Liu

专题命中 预训练与数据 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏