arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-04 至 2026-02-04 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 21 篇

2506.21551 2026-02-04 cs.LG 89%

Grokking in LLM Pretraining? Monitor Memorization-to-Generalization without Test

在LLM预训练中“Grokking”?无需测试即可监控记忆到泛化的过程

Ziyue Li, Chenrui Fan, Tianyi Zhou

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,学院公园)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);instruction tuning(abstract);分类 cs.LG

AI总结 本文研究了LLM预训练中“Grokking”现象,通过分析训练数据路径的动态变化,提出两种新度量标准以监控模型泛化能力,无需额外成本。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03702 2026-02-04 cs.LG cs.AI math.OC stat.ML 86%

Anytime Pretraining: Horizon-Free Learning-Rate Schedules with Weight Averaging

任意时间预训练:无时间范围的学习率调度与权重平均

Alexandru Meterez, Pranav Ajit Nair, Depen Morwani, Cengiz Pehlevan, Sham Kakade

机构 * Harvard University(哈佛大学) Kempner Institute at Harvard University(哈佛大学凯默纳研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种无需时间范围的学习率调度方法,通过权重平均实现与余弦调度相当的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03690 2026-02-04 cs.LG cs.AI 86%

LLM-Inspired Pretrain-Then-Finetune for Small-Data, Large-Scale Optimization

受大语言模型启发的小数据、大规模优化的预训练-微调方法

Zishi Zhang, Jinhui Han, Ming Hu, Yijie Peng

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种受大语言模型启发的预训练-微调方法,用于解决小数据下的大规模决策优化问题,通过预训练注入领域知识并利用合成数据,微调提升与真实数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06548 2026-02-04 cs.CL cs.LG 84%

Reusing Overtrained Language Models Saturates Scaling

重用过训练的语言模型饱和了扩展

Seng Pei Liew, Takuya Kato

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究发现重用过训练的语言模型在扩展时效率下降,揭示了多阶段预训练中的权衡关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03269 2026-02-04 q-bio.NC 82%

Systematic review of self-supervised foundation models for brain network representation using electroencephalography

基于脑网络表示的自监督基础模型系统综述:使用脑电图

Hannah Portmann, Yosuke Morishima

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文综述了基于脑电图的自监督基础模型,探讨了其预训练方法、模型架构及下游任务应用,指出需更多多样化数据和标准化评估以提升模型通用性。

Comments 19 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03023 2026-02-04 cs.SD cs.LG 81%

Rethinking Music Captioning with Music Metadata LLMs

重新思考基于音乐元数据的音乐描述生成

Irmak Bukey, Zhepei Wang, Chris Donahue, Nicholas J. Bryan

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出基于元数据的音乐描述生成方法,通过训练元数据预测模型和预训练LLMs,实现更灵活的描述生成和元数据填补。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02511 2026-02-04 cs.CY cs.AI 79%

Training Data Governance for Brain Foundation Models

脑基础模型的训练数据治理

Margot Hanley, Jiunn-Tyng Yeh, Ryan Rodriguez, Jack Pilkington, Nita Farahany

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文探讨了在神经数据上训练基础模型所面临的伦理挑战,提出治理框架以规范数据使用和保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00514 2026-02-04 cs.RO 78%

A Low-Cost Vision-Based Tactile Gripper with Pretraining Learning for Contact-Rich Manipulation

一种低成本的基于视觉的触觉夹具,用于接触丰富的操作

Yaohua Liu, Binkai Ou, Zicheng Qiu, Ce Hao, Hengjun Zhang

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Innovation and Research and Development Department, BoardWare Information System Company Ltd.(创新与研发部,BoardWare信息系统有限公司) School of Artificial Intelligence, Nanjing Agricultural University(人工智能学院,南京农业大学) School of Computing, National University of Singapore(计算机学院,新加坡国立大学) School of Electronic Engineering and Automation, Guilin University of Electronic Technology(电子工程与自动化学院,桂林电子科技大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究提出了一种低成本的视觉-触觉夹具,通过融合视觉和触觉反馈,提升接触丰富环境中的操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19004 2026-02-04 cs.CL 74%

Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations

破损的标记?你的语言模型可以秘密处理非标准标记化

Brian Siyuan Zheng, Alisa Liu, Orevaoghene Ahia, Jonathan Hayase, Yejin Choi, Noah A. Smith

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 研究发现语言模型在面对非标准标记化时表现出意外的鲁棒性,通过指令训练可提升特定任务性能,揭示模型对标记化的依赖程度较低。

Comments NeurIPS 2025 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03772 2026-02-04 cs.LG cs.AI 73%

UniGeM: Unifying Data Mixing and Selection via Geometric Exploration and Mining

UniGeM: 通过几何探索与挖掘统一数据混合与选择

Changhao Wang, Yunfei Yu, Xinhao Yao, Jiaolong Yang, Riccardo Cantoro, Chaobo Li, Qing Cui, Jun Zhou

机构 * Politecnico di Torino(托斯大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Institute of Microelectronics of the CAS(中国科学院微电子研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 UniGeM通过几何探索与挖掘统一数据混合与选择,提升大语言模型的数据效率和推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00508 2026-02-04 cs.CV 67%

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen:迈向通用的交错多模态生成

Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Shubham Pachori, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。

Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02526 2026-02-04 cs.LG cs.AI cs.CL physics.comp-ph 60%

The "Robert Boulton" Singularity: Semantic Tunneling and Manifold Unfolding in Recursive AI

‘罗伯特·布尔顿’奇点:递归AI中的语义隧道与流形展开

Pengyue Hou

专题命中 预训练与数据 :分类 cs.CL、cs.AI、cs.LG;large language model(comments);language model(comments)

AI总结 本文提出MNCIS框架,通过ASNC方法解决递归AI中语义隧道问题,提升流形多样性与语义多样性。

Comments Companion paper to arXiv:2601.11594. Provides empirical validation of the MNCIS framework in Large Language Models (GPT-2) using a recursive training protocol (N=1500). Includes complete, reproducible Python implementation of Adaptive Spectral Negative Coupling (ASNC) and Effective Rank metrics in the Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02539 2026-02-04 cs.LG cs.CV 57%

How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs

视觉标记能承载多少信息?VLMs中识别限制的缩放定律

Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

机构 * City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港理工大学) Centre for Artificial Intelligence and Robotics, Chinese Academy of Sciences(中国科学院人工智能与机器人研究院)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本研究通过压力测试揭示了视觉标记的信息上限,提出了一种统一的缩放定律,为优化视觉上下文压缩的效率-精度权衡提供了实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02525 2026-02-04 cs.SI cs.AI 57%

Community Norms in the Spotlight: Enabling Task-Agnostic Unsupervised Pre-Training to Benefit Online Social Media

社区规范受到关注:实现任务无关的无监督预训练以造福在线社交媒体

Liam Hebert, Lucas Kopp, Robin Cohen

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出通过无监督预训练实现任务无关的在线社交媒体AI系统,以更好地理解和应对社区规范问题。

Comments Submitted to ICWSM Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15468 2026-02-04 cs.LG cs.DS stat.ML 57%

Learning from Synthetic Data: Limitations of ERM

从合成数据学习:经验风险最小化方法的局限性

Kareem Amin, Alex Bie, Weiwei Kong, Umar Syed, Sergei Vassilvitskii

机构 * Google Research(谷歌研究)

专题命中 预训练与数据 :LLM(abstract);分类 cs.LG

AI总结 本文研究了在合成数据混合情况下经验风险最小化方法的局限性,发现其在估计均值和PAC学习中存在不足,但存在更优算法能有效学习正确假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15280 2026-02-04 cs.AI cs.CY cs.GT 57%

If It's Nice, Do It Twice: We Should Try Iterative Corpus Curation

如果很好,就再做一次:我们应该尝试迭代语料库整理

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出通过迭代语料库整理来提升模型安全性和可解释性,通过多次过滤和训练生成更干净的语料库,并探讨其在模型安全与能力之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11442 2026-02-04 cs.CV 50%

MultiMAE for Brain MRIs: Robustness to Missing Inputs Using Multi-Modal Masked Autoencoder

MultiMAE用于脑部MRI:通过多模态掩码自编码器提高对缺失输入的鲁棒性

Ayhan Can Erdur, Christian Beischl, Daniel Scholz, Jiazhen Pan, Benedikt Wiestler, Daniel Rueckert, Jan C Peeken

机构 * Department of Radiation Oncology, TUM University Hospital, Munich, Germany(辐射肿瘤科,技术大学慕尼黑医院,慕尼黑,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM)(医疗与医学人工智能教研室,技术大学慕尼黑(TUM)) TUM University Hospital, Munich, Germany(技术大学慕尼黑医院,慕尼黑,德国) Chair for AI for Image-Guided Diagnosis and Therapy, Technical University of Munich (TUM)(图像引导诊断与治疗人工智能教研室,技术大学慕尼黑(TUM)) Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国) Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国) Deutsches Konsortium für Translationale Krebsforschung (DKTK), Partner Site Munich, Munich, Germany(德国转化癌症研究联盟(DKTK),慕尼黑合作伙伴站点,慕尼黑,德国) Institute of Radiation Medicine (IRM), Department of Radiation Sciences (DRS), Helmholtz Center Munich, Munich, Germany(辐射医学研究所(IRM),辐射科学部门(DRS),慕尼黑海德堡中心,慕尼黑,德国)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 MultiMAE通过多模态掩码自编码器提升脑部MRI在缺失输入下的鲁棒性,实现分割和分类任务的性能提升。

Comments Official implementation: https://github.com/chris-beischl/multimae-for-brain-mri

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03247 2026-02-04 math.NA cs.NA 50%

Physics informed learning of orthogonal features with applications in solving partial differential equations

基于物理的正交特征学习:用于求解偏微分方程的应用

Qianxing Jia, Dong Wang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出物理驱动的正交特征方法,通过物理信息预训练和正交性正则化提升特征空间逼近能力,用于求解各类偏微分方程时表现出更优的精度和泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03181 2026-02-04 cs.SE 50%

Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging

通过自我调试合成文件级数据用于单元测试生成的链式思考

Ziyue Hua, Tianyu Chen, Yeyun Gong, Shuai Lu, Peng Cheng, Qinglin Zhu, Yibo He, Yingjie Fu, Wenpin Jiao, Wei Yang, Tao Xie

专题命中 预训练与数据 :LLM(abstract)

AI总结 通过自我调试合成文件级数据用于单元测试生成,提升测试生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01661 2026-02-04 cs.CV 50%

From Frames to Sequences: Temporally Consistent Human-Centric Dense Prediction

从帧到序列:面向时间一致的人本密集预测

Xingyu Miao, Junting Dong, Qin Zhao, Yuhang Yang, Junhao Chen, Yang Long

机构 * Durham University(杜伦大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) USTC(中科大) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出了一种可扩展的合成数据管道,结合静态预训练与动态序列监督,训练出统一的ViT密集预测器,以实现时间一致的人本密集预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01615 2026-02-04 cs.CV 50%

Saliency-Guided DETR for Moment Retrieval and Highlight Detection

基于显著性的DETR用于时刻检索和突出检测

Aleksandr Gordeev, Vladimir Dokholyan, Irina Tolstykh, Maksim Kuprashevich

机构 * SALUTEDEV LLC

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于显著性的DETR架构,通过引入显著性引导交叉注意力机制和混合DETR结构,提升视频时刻检索和突出检测性能,并在多个基准上取得最佳结果。

Comments 8 pages, 2 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏