arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2606.29654 2026-06-30 cs.AI cs.MA 89%

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

预算约束下的多智能体LLM“行动或延迟”协商与局部可靠性界限

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) General Motors (GM)(通用汽车(GM))

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种预算约束下的“行动或延迟”决策框架,通过k近邻下置信界评估LLM协商的可靠性,在满足用户指定的错误行动预算时自动执行,否则延迟人工审核,并在六个基准上验证了有效性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01163 2026-06-25 cs.LG stat.ML 版本更新 89%

How Does the Pretraining Distribution Shape In-Context Learning? A Fundamental Trade-Off

预训练分布如何塑造上下文学习?一个基本的权衡

Waïss Azizian, Ali Hasan

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 通过理论框架和实验,揭示预训练分布的统计特性(如重尾行为)在上下文学习中导致任务选择鲁棒性与泛化能力之间的基本权衡。

Comments 57 pages, 15 figures; to be presented at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17581 2026-06-17 cs.PL cs.AI 新提交 89%

Visored: A Controlled-Natural-Language Prover for LLM-Generated Mathematics

Visored: 一种面向LLM生成数学的受控自然语言证明器

Xiyu Zhai, Xinyi Chen, Yiping Wang, Runlong Zhou, Liao Zhang, Simon S. Du

机构 * University of Washington(华盛顿大学) University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种基于依赖类型的证明器,其表面模仿数学自然语言,并通过规则驱动的自动化层填补常规步骤,使LLM无需专用训练数据即可在miniF2F基准上有效使用,并输出可检查的Lean文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07002 2026-06-09 cs.CL 版本更新 89%

Automated Attribution Graph Interpretation via Probe Prompting

通过探针提示实现自动化归因图解释

Giuseppe Birardi, Gonçalo Paulo

机构 * University of Cambridge(剑桥大学)

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出探针提示方法,利用跨提示激活签名将归因图特征分组为概念对齐的超节点,并通过因果干预验证标签,在Gemma-2-2B上实现100%的预测转向行为。

Comments 35 pages, 24 figures, 18 tables. Code and interactive demo available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05805 2026-06-05 cs.AI 89%

From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents

从风险分类到行动方案修复:一种基于护栏反馈驱动的LLM代理框架

Yuhao Sun, Jiacheng Zhang, Shaanan Cohney, Zhexin Zhang, Feng Liu, Xingliang Yuan

机构 * The University of Melbourne(墨尔本大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出TRIAD框架,通过护栏生成的言语反馈引导代理在规划步骤中保持良性目标,实现安全与效用的最佳平衡。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05610 2026-06-05 cs.CL 89%

Predictable Scaling Laws of Optimal Hyperparameters for LLM Continued Pre-training

LLM持续预训练中最优超参数的可预测缩放定律

Yongwei Zhou, Juncheng Diao, Junlin Shang, Peiguang Li, Rongxiang Weng

机构 * MeiTuan(美团) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文发现持续预训练中学习率和批大小等最优超参数遵循稳定可预测的缩放定律,并提出一个两阶段框架,通过小规模代理模型和状态感知预测,将超参数搜索开销降低90%且性能相当或更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04876 2026-06-04 cs.LG 89%

Towards Pretraining Text Encoders for TabPFN

面向TabPFN的文本编码器预训练

Mustafa Tajjar, Alexander Pfefferle, Lennart Purucker, Frank Hutter

机构 * University of California, Berkeley(加州大学伯克利分校) DeepMind(深度思维)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract,abstract_cn);language model(abstract);foundation model(abstract)

AI总结 提出TabPFN文本适配器,通过轻量级适配器将文本嵌入映射到TabPFN的嵌入空间,避免PCA瓶颈,保留TabPFN数值优势,训练效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04067 2026-06-04 cs.CR cs.AI 89%

Need to Know: Contextual-Integrity-Grounded Query Rewriting for Privacy-Conscious LLM Delegation

须知:基于语境完整性的隐私意识LLM委托查询重写

Xinyue Huang, Xiaochun Cao, Wenyuan Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.AI

AI总结 针对LLM委托中查询隐私泄露问题,提出基于语境完整性的查询重写框架,通过CI引导的强化学习训练重写器,在保留任务关键信息的同时抑制非必要敏感披露,实现最佳隐私-效用权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01364 2026-06-02 cs.CR cs.AI cs.SE 89%

Needles at Scale: LLM-Assisted Target Selection for Windows Vulnerability Research

大规模针尖:LLM辅助的Windows漏洞研究目标选择

Michael J. Bommarito

机构 * Microsoft(微软) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 提出Symbolicate-Enrich-Sample流水线,通过符号恢复、结构特征提取和低成本语言模型排序,从Windows系统数千万函数中筛选出约2.2万个候选目标,解决漏洞研究中目标选择瓶颈问题。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12325 2026-06-02 cs.CL 89%

$M^3$ Scaling Law: Optimizing Multi-Epoch, Multi-Lingual, and Multi-Stage Training for Low-Resource Language Models

$M^3$ 缩放定律:优化低资源语言模型的多周期、多语言和多阶段训练

Kosuke Akimoto, Taiki Miyagawa, Masafumi Oyamada

机构 * NEC Corporation(日本电报电话株式会社)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);pretraining(abstract)

AI总结 本文提出 $M^3$ 缩放定律,统一预测模型规模、目标语料周期数、平均目标语言比例和最终阶段目标语言比例对低资源语言模型预训练损失的影响,并推导出最优训练策略的实用指南。

Comments 35 pages, 14 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14315 2026-05-29 cs.LG math.OC 89%

Enhancing LLM Training via Spectral Clipping

通过谱裁剪增强大语言模型训练

Xiaowen Jiang, Andrei Semenov, Sebastian U. Stich

机构 * CISPA Helmholtz Center for Information Security(信息安全研究中心) EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出SPECTRA框架,通过对优化器更新进行谱裁剪以约束谱范数、对梯度进行预谱裁剪以抑制噪声尖峰,从而提升多种优化器在大语言模型预训练中的性能。

Comments v2: ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24448 2025-11-04 cs.CV cs.AI 89%

Rethinking Visual Intelligence: Insights from Video Pretraining

Pablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20046 2025-09-23 cs.CL cs.HC 89%

Exploring Large Language Models to generate Easy to Read content

Paloma Martínez, Lourdes Moreno, Alberto Ramos

机构 * Computer Science and Engineering Department Universidad Carlos III de Madrid(计算机科学与工程系卡洛斯三世大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref (2024) Exploring Large Language Models to generate Easy to Read content. Front. Comput. Sci. 6:1394705

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00101 2025-03-21 eess.SP cs.HC cs.LG 89%

NeuroLM: A Universal Multi-task Foundation Model for Bridging the Gap between Language and EEG Signals

Wei-Bang Jiang, Yansen Wang, Bao-Liang Lu, Dongsheng Li

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments The Thirteenth International Conference on Learning Representations

Journal ref The Thirteenth International Conference on Learning Representations, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16588 2025-01-29 cs.LG cs.SY eess.SY 89%

Fine-Tuned Language Models as Space Systems Controllers

Enrico M. Zucchelli, Di Wu, Julia Briden, Christian Hofmann, Victor Rodriguez-Fernandez, Richard Linares

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

Journal ref Proceedings of the AAS/AIAA Astrodynamics Specialist Conference, paper number AAS 24-445, Broomfield, CO, August 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08197 2025-01-15 cs.CL 89%

OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training

Yijiong Yu, Ziyun Dai, Zekun Wang, Wei Wang, Ran Chen, Ji Pei

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments The datasets are available on https://huggingface.co/collections/opencsg/chinese-fineweb-66cfed105f502ece8f29643e ; The code is on https://github.com/yuyijiong/fineweb-edu-chinese

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04424 2024-12-06 cs.CV cs.AI 89%

Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion

Jiuhai Chen, Jianwei Yang, Haiping Wu, Dianqi Li, Jianfeng Gao, Tianyi Zhou, Bin Xiao

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12392 2024-05-31 cs.CL 89%

PiVe: Prompting with Iterative Verification Improving Graph-based Generative Capability of LLMs

Jiuzhou Han, Nigel Collier, Wray Buntine, Ehsan Shareghi

专题命中 预训练与数据 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments Our code and data are at https://github.com/Jiuzhouh/PiVe (accepted to ACL 2024 Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00299 2023-10-10 cs.CL 89%

RelBERT: Embedding Relations with Language Models

Asahi Ushio, Jose Camacho-Collados, Steven Schockaert

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.10860 2019-07-24 cs.CL 89%

Can You Tell Me How to Get Past Sesame Street? Sentence-Level Pretraining Beyond Language Modeling

Alex Wang, Jan Hula, Patrick Xia, Raghavendra Pappagari, R. Thomas McCoy, Roma Patel, Najoung Kim, Ian Tenney, Yinghui Huang, Katherin Yu, Shuning Jin, Berlin Chen, Benjamin Van Durme, Edouard Grave, Ellie Pavlick, Samuel R. Bowman

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

Comments ACL 2019. This paper supercedes "Looking for ELMo's Friends: Sentence-Level Pretraining Beyond Language Modeling", an earlier version of this work by the same authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.10062 2023-06-21 cs.CL cs.AI cs.LG 89%

Revealing the structure of language model capabilities

Ryan Burnell, Han Hao, Andrew R. A. Conway, Jose Hernandez Orallo

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);instruction tuning(abstract)

Comments 10 pages, 3 figures + references and appendices, for data and analysis code see https://github.com/RyanBurnell/revealing-LLM-capabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18816 2026-08-20 cs.CL cs.AI 新提交 88%

Do Large Language Models Hallucinate Electric Fata Morganas?

大语言模型会产生“电气海市蜃楼”式的幻觉吗?

Kristina Šekrst

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型幻觉的哲学意义,通过两项实证研究分析其成因,结合相关理论指出模型的情感自我陈述属于幻觉范畴,未来机器意识或因与高级幻觉无法区分而无法被认知。

Journal ref Journal of Consciousness Studies 32 (11): 96-120. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14198 2026-08-17 cs.LG cs.CL 新提交 88%

MINT: A Universal Zero-Shot Predictor for Transaction Data

MINT:一种用于交易数据的通用零样本预测器

Parameswaran Kamalaruban, Viktor Drobnyi, Maeve Madigan, Julia Rozanova, David Sutton, Stuart Burrell

机构 * Visa Inc.(维萨公司)

专题命中 预训练与数据 :LLM(summary_cn,abstract);foundation model(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出通用零样本预测框架MINT,通过轻量级嵌入注入等技术连接交易序列编码器与LLM,在交易预测问答任务中性能领先且资源消耗更低,证实紧凑交易嵌入更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28008 2026-08-17 cs.CL cs.AI 版本更新 88%

RepBench: Compiling Benchmarks into Capability Representations for Large Language Models

RepBench:将基准编译为大语言模型的能力表征

Yanshi Li, Xueru Bai, Shuman Liu, Long Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 RepBench构建多基准支撑的大语言模型能力表征探测数据层,揭示读出方式与聚合准则对评估的重要性,相关资源以闭环工作流形式发布。

Comments 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03818 2026-08-13 cs.LG cs.AI cs.PL 版本更新 88%

Program Semantic Inequivalence Game with Large Language Models

基于大语言模型的程序语义不等价博弈

Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani

机构 * University of Edinburgh(爱丁堡大学) Cisco Systems(思科系统)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24769 2026-07-29 cs.AI cs.CL 新提交 88%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22458 2026-07-27 cs.LG cs.AI 新提交 88%

Phylogenetic signal in marine mammal and bird vocalizations captured by audio foundation models: the limited benefit of domain-specific pretraining

音频基础模型捕捉到的海洋哺乳动物和鸟类发声中的系统发育信号:特定领域预训练的有限益处

Víctor Rincón Yepes

机构 * Earth Species Project(地球物种计划)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究利用四个预训练音频模型从物种发声恢复系统发育距离,在海洋哺乳动物和鸟类中,通用基础模型能恢复信号,特定领域预训练的BirdNET等未超越,表明预训练音频嵌入可携带进化信息,特定领域预训练非必需。

Comments 17 pages, 5 figures, 2 supplementary tables. Code, embeddings and derived matrices: https://github.com/rinvictor/bioacoustic-phylogeny-embeddings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20548 2026-07-24 cs.LG cs.AI 新提交 88%

SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales

SOAP、Muon及其他:推动语言模型预训练规模

Mikail Khona, Aditya Vavre, Boxiang Wang, Deyu Fu, Hao Wu, Mike Chrzanowski, Bryan Catanzaro, Dheevatsa Mudigere, Jeff Pool, Michael Lightstone, Mohammad Shoeybi, Mostofa Patwary, Nima Tajbakhsh, Tijmen Blankevoort

机构 * NVIDIA(英伟达)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对高阶优化器在大规模语言模型预训练中的挑战,通过改进预处理梯度方法、统一实证研究不同优化器、引入分层分布式优化器及系统级改进,提升训练效果,最终发布含新兴优化算法的代码库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19992 2026-07-23 cs.CL cs.AI cs.DL cs.HC 新提交 88%

TINY_SCHILLER: A Drop-In German Drama Corpus for Small Language Models

TINY_SCHILLER:用于小语言模型的即插即用德语戏剧语料库

Mark Schutera

机构 * Duale Hochschule Baden-Württemberg Ravensburg(巴登-符腾堡双元制应用技术大学 Ravensburg)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对德语文学文本在小语言模型相关应用的空白,提出Tiny_schiller语料库,经特定处理,可通过单文件和一行代码让小语言模型接触德语文学文本,填补了相关研究和应用的空白。

Comments 5 pages. Dataset: https://huggingface.co/datasets/mrkschtr/tiny_schiller ; Code: https://github.com/schutera/tiny_schiller

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09204 2026-07-13 cs.CL cs.LG 新提交 88%

Complexity-Guided Component-wise Initialization for Language Model Pretraining

用于语言模型预训练的复杂度引导的逐组件初始化

Konstantin Garbers, Nicholas Oh

机构 * Peking University(北京大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 研究预训练语言模型中反复出现的谱模式能否用于初始化,通过分析多个检查点构建初始化方案并与其他方法比较,发现预训练权重复用有竞争力,但仅粗略谱匹配非可靠策略,预训练谱是有用诊断,有效复用需保留更多信息。

详情

展开后加载摘要…

URL PDF HTML 收藏