arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-03 至 2026-02-03 共收录 608 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 40 篇

2602.02400 2026-02-03 cs.LG 90%

An Empirical Study on Noisy Data and LLM Pretraining Loss Divergence

对噪声数据和LLM预训练损失发散的实证研究

Qizhen Zhang, Ankush Garg, Jakob Foerster, Niladri Chatterji, Kshitiz Malik, Mike Lewis

机构 * University of Oxford(牛津大学) FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过实证分析揭示噪声数据如何导致LLM预训练中的损失发散,并区分噪声与高学习率引起的发散模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01734 2026-02-03 cs.LG 90%

MSign: An Optimizer Preventing Training Instability in Large Language Models via Stable Rank Restoration

MSign: 通过稳定秩恢复防止大语言模型训练不稳定

Lianhai Ren, Yucheng Ding, Xiao Liu, Qianxiao Li, Peng Cheng, Yeyun Gong

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 MSign通过稳定秩恢复机制防止大语言模型训练不稳定,有效减少训练失败并降低计算开销

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06876 2026-02-03 cs.CL cs.AI cs.LG 90%

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

混合数据还是融合模型?通过模型融合平衡大型语言模型的有用性、诚实性和无害性

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang, Jun Zhou, Fei Wu, Kun Kuang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RESM方法,通过改进的参数融合策略提升大型语言模型在有用性、诚实性和无害性方面的平衡对齐效果。

Comments arxiv version of NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17492 2026-02-03 cs.IR 89%

Towards Fair Large Language Model-based Recommender Systems without Costly Retraining

迈向无需昂贵重训练的公平大型语言模型推荐系统

Jin Li, Huilin Gu, Shoujin Wang, Qi Zhang, Shui Yu, Chen Wang, Xiwei Xu, Fang Chen

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 FUDLR提出一种无需昂贵重训练的高效去偏方法,通过两阶段机器无学习提升LLM推荐系统的公平性,同时保持推荐准确性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02266 2026-02-03 cs.CL cs.AI 88%

OpenSeal: Good, Fast, and Cheap Construction of an Open-Source Southeast Asian LLM via Parallel Data

OpenSeal: 通过并行数据高效构建开源东南亚LLM

Tan Sang Nguyen, Muhammad Reza Qorib, Hwee Tou Ng

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 OpenSeal通过并行数据高效构建了首个开源东南亚LLM,实现了与现有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00446 2026-02-03 cs.LG cs.CR 87%

Towards Building Non-Fine-Tunable Foundation Models

构建不可微调的基础模型

Ziyao Wang, Nizhang Li, Pingzhi Li, Guoheng Sun, Tianlong Chen, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) Macau University of Science and Technology(澳门科学技术大学) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出PMP框架,通过构建不可微调的基础模型,限制未经授权微调的适应性提升,从而提高模型的安全性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01268 2026-02-03 cs.CL cs.AI cs.LG stat.ML 87%

AdaDetectGPT: Adaptive Detection of LLM-Generated Text with Statistical Guarantees

AdaDetectGPT:具有统计保证的自适应检测LLM生成文本

Hongyi Zhou, Jin Zhu, Pingfan Su, Kai Ye, Ying Yang, Shakeel A O B Gavioli-Akilagun, Chengchun Shi

机构 * Department of Mathematics(数学系) Tsinghua University(清华大学) School of Mathematics(数学学院) University of Birmingham(伯明翰大学) Department of Statistics(统计系) LSE London, UK(伦敦经济学院) Department of Statistics and Data Science(统计与数据科学系) Department of Decision Analytics and Operations(决策分析与运营系) City University Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdaDetectGPT通过自适应学习见证函数,提高LLM生成文本检测的性能,改进幅度可达37%。

Comments Accepted by NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24012 2026-02-03 cs.LG 86%

Pretraining Scaling Laws for Generative Evaluations of Language Models

生成评估的预训练扩展定律

Rylan Schaeffer, Noam Levi, Brando Miranda, Sanmi Koyejo

机构 * Computer Science Stanford University(计算机科学 斯坦福大学) AI Center EPFL(人工智能中心 EPFL)

专题命中 预训练与数据 :pretraining(title,abstract);language model(title);分类 cs.LG

AI总结 本文提出三种预训练扩展定律,用于生成评估的性能预测,揭示了不同扩展定律在稳定性与预测性能上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01162 2026-02-03 cs.CL 85%

Typologically-Informed Candidate Reranking for LLM-based Translation into Low-Resource Languages

基于语言类型学的候选重排序用于基于大语言模型的低资源语言翻译

Nipuna Abeykoon, Ashen Weerathunga, Pubudu Wijesinghe, Parameswari Krishnamurthy

机构 * ZWAG AI Ltd(ZWAG人工智能有限公司) Dubai AI Campus(迪拜人工智能校园) DIFC(迪拜国际科技论坛)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种基于语言类型学的候选重排序框架,通过语言类型学分析提升低资源语言翻译质量,无需平行数据或模型重训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00866 2026-02-03 cs.AI cs.CL 84%

Foundation CAN LM: A Pretrained Language Model For Automotive CAN Data

基础CAN语言模型:一种用于汽车CAN数据的预训练语言模型

Akiharu Esashi, Pawissanutt Lertpongrujikorn, Justin Makino, Yuibi Fujimoto, Mohsen Amini Salehi

专题命中 预训练与数据 :language model(title);foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基础CAN语言模型,通过预训练实现对汽车CAN数据的多目标下游泛化,推动汽车AI中的可泛化表征学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21802 2026-02-03 cs.LG cs.AI 84%

ChaosNexus: A Foundation Model for ODE-based Chaotic System Forecasting with Hierarchical Multi-scale Awareness

ChaosNexus: 一种基于微分方程的混沌系统预测的基础模型,具有分层多尺度意识

Chang Liu, Bohao Zhao, Jingtao Ding, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University, Beijing, China(电子工程系,BNRist,清华大学,北京,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 ChaosNexus通过ScaleFormer架构和MoE层实现对混沌系统多尺度和频谱特征的捕捉,提升长期预测精度和实际应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19790 2026-02-03 cs.LG cs.AI cs.DB 84%

Mixtera: A Data Plane for Foundation Model Training

Mixtera: 一个用于基础模型训练的数据平面

Maximilian Böther, Xiaozhe Yao, Tolga Kerimoglu, Dan Graur, Viktor Gsteiger, Ana Klimovic

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Mixtera是一种用于基础模型训练的数据平面,允许用户声明性地控制数据样本的比例和顺序,以提升模型训练效果。

Comments accepted at SIGMOD'26; two column layout version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00497 2026-02-03 cs.CL cs.AI 84%

Culturally-Grounded Governance for Multilingual Language Models: Rights, Data Boundaries, and Accountable AI Design

基于文化背景的治理框架用于多语言语言模型:权利、数据边界与可问责的AI设计

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱维大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于文化背景的多语言模型治理框架,强调权利、数据边界和可问责AI设计,以应对文化边缘社区的系统性风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14865 2026-02-03 cs.CL 83%

Midtraining Bridges Pretraining and Posttraining Distributions

中期训练连接预训练和后训练分布

Emmy Liu, Graham Neubig, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University, USA(语言技术研究所,卡内基梅隆大学,美国)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 中期训练通过提供更好的初始化提升模型性能,尤其在与通用预训练数据距离较远的领域表现突出,且起始时间和混合权重的相互作用影响其效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00816 2026-02-03 stat.ML cs.LG 83%

Hessian Spectral Analysis at Foundation Model Scale

基础模型规模下的Hessian谱分析

Diego Granziol, Khurshid Juarev

机构 * Mathematical Institute, University of Oxford, UK(牛津大学数学研究所)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 本研究在大规模基础模型上实现了Hessian谱的准确分析,揭示了块对角曲率近似在中等规模LLM中的失效问题,展示了谱探测的计算效率与实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00405 2026-02-03 cs.AI 83%

RobustDebias: Debiasing Language Models using Distributionally Robust Optimization

RobustDebias: 使用分布鲁棒优化去偏语言模型

Deep Gandhi, Katyani Singh, Nidhi Hegde

机构 * Deep Gandhi University of Alberta(Deep Gandhi 阿尔伯塔大学) Katyani Singh University of Alberta(Katyani Singh 阿尔伯塔大学) Nidhi Hegde University of Alberta(Nidhi Hegde 阿尔伯塔大学) Alberta Machine Intelligence Institute(阿尔伯塔人工智能研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 RobustDebias通过分布鲁棒优化在微调过程中减少语言模型的偏见,有效缓解偏见的同时保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01954 2026-02-03 cs.CV 82%

Beyond Open Vocabulary: Multimodal Prompting for Object Detection in Remote Sensing Images

超越开放词汇:面向遥感图像的目标检测多模态提示

Shuai Yang, Ziyue Huang, Jiaxin Chen, Qingjie Liu, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(计算机科学与工程学院,北京航空航天大学,中国)

专题命中 预训练与数据 :prompting(title,abstract);pretraining(abstract)

AI总结 RS-MPOD提出了一种多模态开放词汇检测框架,通过整合视觉和文本提示提升遥感图像中目标检测的稳定性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00604 2026-02-03 cs.SD eess.AS 82%

The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels

TMU系统用于XACLE挑战:利用CLAP伪标签训练大型音频语言模型

Ayuto Tsutsumi, Kohei Tanaka, Sayaka Shiota

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract)

AI总结 TMU系统通过CLAP伪标签预训练,在XACLE挑战中实现0.632的SRCC成绩,优于基线系统并获得第三名。

Comments 3 pages; 2 figures; 2 tables; Accepted at ICASSP 2026 Workshop (SP Grand Challenges, GC-12: XACLE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03244 2026-02-03 cs.LG cs.AI 81%

FoMEMO: Towards Foundation Models for Expensive Multi-objective Optimization

FoMEMO:面向昂贵多目标优化的基础模型

Yiming Yao, Fei Liu, Liang Zhao, Xi Lin, Yilu Liu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Xi’an Jiaotong University(西安交通大学)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 FoMEMO提出一种基础模型,通过预训练合成数据提升昂贵多目标优化的泛化和优化性能,无需后续训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01678 2026-02-03 cs.LG cs.AI cs.CE eess.SP 81%

LEAD: An EEG Foundation Model for Alzheimer's Disease Detection

LEAD:一种用于阿尔茨海默病检测的EEG基础模型

Yihe Wang, Nan Huang, Nadia Mammone, Marco Cecchi, Xiang Zhang

机构 * Department of Computer Science, University of North Carolina at Charlotte, United States(北卡罗来纳州立大学计算机科学系) DICEAM Department, University Mediterranea of Reggio Calabria, Italy(雷焦卡拉布里亚地中海大学DICEAM系)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 LEAD是一种基于EEG的阿尔茨海默病检测基础模型,通过门控时间-空间Transformer和受试者正则化策略,实现大规模数据集上的高效检测与泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11085 2026-02-03 cs.LG cs.AI 81%

On the Importance of Pretraining Data Alignment for Atomic Property Prediction

关于预训练数据对齐在原子性质预测中的重要性

Yasir Ghunaim, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒-阿齐兹大学科学与技术学院)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文发现,通过精心选择的任务对齐数据集预训练,可提升原子性质预测的性能,且比大规模混合数据集预训练更有效。

Comments Published in Transactions on Machine Learning Research (TMLR), 2026

Journal ref Transactions on Machine Learning Research (TMLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02425 2026-02-03 cs.LG q-bio.QM 79%

Repurposing Protein Language Models for Latent Flow-Based Fitness Optimization

重新利用蛋白质语言模型进行潜在流基于的适应度优化

Amaru Caceres Arroyo, Lea Bogensperger, Ahmed Allam, Michael Krauthammer, Konrad Schindler, Dominik Narnhofer

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 CHASE通过重新利用预训练蛋白质语言模型的进化知识,结合潜在流匹配模型,在蛋白质设计中实现高适应度变体的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15048 2026-02-03 cs.CL 79%

MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language

MaiBERT: 一种针对低资源马尔瓦里语的预训练语料库和语言模型

Sumit Yadav, Raju Kumar Yadav, Utsav Maskey, Gautam Siddharth Kashyap, Ganesh Gautam, Usman Naseem

机构 * IOE, Pulchowk Campus, Lalitpur, Nepal(尼泊尔拉利特普尔 Pulchowk 校区 IOE) Macquarie University, Sydney, Australia(澳大利亚悉尼麦考瑞大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 MaiBERT是一种针对马尔瓦里语的预训练语言模型,通过掩码语言建模技术在新构建的语料库上训练,实现了新闻分类任务中的高准确率,优于现有区域模型。

Comments Accepted at EACL LoResLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00573 2026-02-03 cs.CL 79%

Training a Utility-based Retriever Through Shared Context Attribution for Retrieval-Augmented Language Models

通过共享上下文归因训练基于效用的检索器以增强检索增强语言模型

Yilong Xu, Jinhua Gao, Xiaoming Yu, Yuanhai Xue, Baolong Bi, Huawei Shen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) Key Lab of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 SCARLet通过共享上下文归因和多任务泛化提升检索增强语言模型的检索性能。

Comments EMNLP 2025 Main Conference (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00594 2026-02-03 cs.CL cs.SD eess.AS 79%

Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling

Kanade:一种简单的解耦语音分词器用于语音语言建模

Zhijie Huang, Stephen McIntosh, Daisuke Saito, Nobuaki Minematsu

机构 * The University of Tokyo(东京大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 Kanade是一种单层解耦语音分词器,通过分离声学常量实现高质量语音建模,达到最先进的说话人解耦和词汇可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10173 2026-02-03 cs.SE 75%

ATLAS: Automated Toolkit for Large-Scale Verified Code Synthesis

ATLAS:大规模验证代码合成的自动化工具包

Mantas Baksys, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Soonho Kong, Sean B. Holden

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 ATLAS通过生成验证代码提升LLM在形式验证领域的性能,其在DafnyBench和DafnySynthesis上的表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21571 2026-02-03 cs.LG cs.AI cs.CL 75%

Shaping capabilities with token-level data filtering

通过令牌级数据过滤塑造能力

Neil Rathi, Alec Radford

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过令牌级数据过滤在预训练过程中有效减少语言模型的不期望能力,提升模型在特定领域的性能与对齐性。

Comments update figure 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00576 2026-02-03 cs.LG cs.AI 73%

Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs

数据分布作为引导优化器实现LLM超一般化的杠杆

Tushaar Gangavarapu, Jiping Li, Christopher Vattheuer, Zhangyang Wang, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过调整训练数据分布降低简单性偏见,提升大型语言模型的泛化能力,实验表明在数学推理任务中性能提升达18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01485 2026-02-03 cs.LG stat.ML 70%

Predicting and improving test-time scaling laws via reward tail-guided search

通过奖励尾部引导搜索预测并改进测试时间扩展规律

Muheng Li, Jian Qian, Wenlong Mou

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Department of AI and Data Science, University of Hong Kong(香港大学人工智能与数据科学系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过奖励尾部引导搜索预测并改进LLM测试时间扩展规律,通过动态分配计算资源提升推理能力。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13811 2026-02-03 cs.LG 70%

Context-Free Synthetic Data Mitigates Forgetting

无上下文合成数据缓解遗忘

Parikshit Bansal, Sujay Sanghavi

机构 * Parikshit Bansal(独立研究者) Sujay Sanghavi(独立研究者)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 通过无上下文生成缓解语言模型微调中的遗忘问题,保持零样本和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏