arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-25 至 2026-02-25 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2602.20799 2026-02-25 cs.SE 86%

Unseen-Codebases-Domain Data Synthesis and Training Based on Code Graphs

基于代码图的未见代码库数据合成与训练

Guangsheng Ou, Qiming Zhang, Sirong Chen, Anji Li, Dong Xu, Tiancheng Luo, Dekun Dai, Cuiyun Gao, Long Wang, Jun Zhou, Mingwei Liu, Zibin Zheng

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出UCD-Training框架,通过代码图构建和两阶段训练,提升模型对未见代码库的推理能力和数据合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12927 2026-02-25 cs.CL 85%

SEFL: A Framework for Generating Synthetic Educational Assignment Feedback with LLM Agents

SEFL:一种生成合成教育作业反馈的框架

Mike Zhang, Amalie Pernille Dilling, Léon Gondelman, Niels Erik Ruan Lyngdorf, Euan D. Lindsay, Johannes Bjerva

机构 * University of Copenhagen, Denmark(哥本哈根大学) Aalborg University, Denmark(奥尔堡大学) Pioneer Centre for AI, Denmark(AI先锋中心)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SEFL通过合成数据框架生成高质量教育作业反馈,提升反馈质量与效率,适用于高等教育领域。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20580 2026-02-25 cs.CL cs.AI cs.CR cs.LG 85%

Personal Information Parroting in Language Models

语言模型中的个人信息重复

Nishant Subramani, Kshitish Ghate, Mona Diab

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所) University of Washington(华盛顿大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究开发了检测个人信息的正则表达式和规则套件,发现语言模型会记忆并重复个人信息,建议加强数据过滤和匿名化以降低隐私风险。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21193 2026-02-25 cs.CL 83%

On Data Engineering for Scaling LLM Terminal Capabilities

关于扩大LLM终端能力的数据工程

Renjie Pi, Grace Lam, Mohammad Shoeybi, Pooya Jannaty, Bryan Catanzaro, Wei Ping

机构 * NVIDIA

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Terminal-Task-Gen和Terminal-Corpus,通过训练Nemotron-Terminal模型显著提升终端任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00994 2026-02-25 cs.CL 83%

Should We Still Pretrain Encoders with Masked Language Modeling?

我们还应该用掩码语言模型预训练编码器吗?

Hippolyte Gisserot-Boukhlef, Nicolas Boizard, Manuel Faysse, Duarte M. Alves, Emmanuel Malherbe, André F. T. Martins, Céline Hudelot, Pierre Colombo

机构 * Artefact Research Center(Artefact 研究中心) Diabolocom TransPerfect Cohere MICS, CentraleSupélec, Université Paris-Saclay(MICS,CentraleSupélec,巴黎萨克雷大学) Instituto de Telecomunicações(电信研究所) Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本大学(里斯本 ELLIS 单位))

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文研究了在文本表示任务中,使用CLM还是MLM预训练编码器的优劣,发现双阶段训练策略在计算预算固定时表现最佳,并展示了从预训练CLM模型初始化的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07712 2026-02-25 cs.LG 81%

Towards Robust Scaling Laws for Optimizers

面向优化器的稳健缩放定律

Alexandra Volkova, Mher Safaryan, Christoph H. Lampert, Dan Alistarh

机构 * Institute of Science and Technology Austria (ISTA)(科学与技术奥地利研究所) Lancaster University(兰卡斯特大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了不同优化器的稳健缩放定律,提出了一种共享幂律指数和优化器特定重缩放因子的更稳健定律,并通过理论分析证明了Chinchilla式缩放定律的自然产生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20307 2026-02-25 cs.LG 79%

In-context Pre-trained Time-Series Foundation Models adapt to Unseen Tasks

上下文预训练时间序列基础模型适应于未见任务

Shangqing Xu, Harshavardhan Kamarthi, Haoxin Liu, B. Aditya Prakash

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出ICTP框架,通过增强时间序列基础模型的上下文学习能力,使其无需微调即可提升在未见任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18310 2026-02-25 econ.GN cs.AI cs.CY cs.HC cs.LG q-fin.EC 79%

How much does context affect the accuracy of AI health advice?

上下文对AI健康建议准确性的影响有多大?

Prashant Garg, Thiemo Fetzer

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了上下文对AI健康建议准确性的影响,发现语言、主题和信息源显著影响LLM的健康声明验证性能,强调了多语言和领域特定评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27219 2026-02-25 cs.CV 78%

SpecAware: A Spectral-Content Aware Foundation Model for Unifying Multi-Sensor Learning in Hyperspectral Remote Sensing Mapping

SpecAware: 一种面向光谱-内容的统一多传感器学习的超光谱遥感制图基础模型

Renjie Ji, Xue Wang, Chao Niu, Wen Zhang, Yong Mei, Kun Tan

机构 * Key Laboratory of Spatial-Temporal Big Data Analysis and Application of Natural Resources in Megacities (Ministry of Natural Resources), East China Normal University(空间-时间大数据分析与应用国家级重点实验室(自然资源部),东华师范大学) School of Geospatial Artificial Intelligence, East China Normal University(地理信息人工智能学院,东华师范大学) Key Laboratory of Geographic Information Science (Ministry of Education), East China Normal University(地理信息科学重点实验室(教育部),东华师范大学) School of Geographic Sciences, East China Normal University(地理科学学院,东华师范大学) Shanghai Municipal Institute of Surveying and Mapping(上海市测绘院) Institute of Defense Engineering, AMS(工程院,AMS)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 SpecAware是一种基于光谱-内容感知的超光谱遥感制图基础模型,通过统一多传感器学习框架实现跨传感器的高效联合学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18777 2026-02-25 cs.AI cs.CL cs.LG 75%

Programming by Backprop: An Instruction is Worth 100 Examples When Finetuning LLMs

通过反向传播编程:在微调LLMs时,一条指令的价值相当于100个示例

Jonathan Cook, Silvia Sapora, Arash Ahmadian, Akbir Khan, Tim Rocktaschel, Jakob Foerster, Laura Ruis

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) Cohere & Cohere Labs(Cohere及Cohere实验室) Anthropic UCL AI Centre(UCL人工智能中心) MIT(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过反向传播编程(PBB)使LLMs能从声明性指令中学习程序性知识,提升训练效率并减少对大量示例的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20092 2026-02-25 cs.CL 70%

BabyLM Turns 4 and Goes Multilingual: Call for Papers for the 2026 BabyLM Workshop

BabyLM四周年暨多语言研究:2026年BabyLM研讨会征文通知

Leshem Choshen, Ryan Cotterell, Mustafa Omer Gul, Jaap Jumelet, Tal Linzen, Aaron Mueller, Suchir Salhan, Raj Sanjay Shah, Alex Warstadt, Ethan Gotlieb Wilcox

机构 * IBM Research(IBM研究院) MIT(麻省理工学院) ETH Zürich(苏黎世联邦理工学院) Cornell University(康奈尔大学) University of Groningen(格罗宁根大学) NYU(纽约大学) Boston University(波士顿大学) University of Cambridge(剑桥大学) Georgia Tech(佐治亚理工学院) UC San Diego(南加州大学) Georgetown University(乔治城大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 BabyLM研讨会征文通知,聚焦多语言预训练与认知建模,包含训练效率、小规模数据集、模型评估等主题

Comments 8 pages, 1 table. arXiv admin note: substantial text overlap with arXiv:2502.10645

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20166 2026-02-25 cs.CL cs.AI 62%

ConceptRM: The Quest to Mitigate Alert Fatigue through Consensus-Based Purity-Driven Data Cleaning for Reflection Modelling

ConceptRM: 通过基于共识的纯度驱动数据清洗缓解警报疲劳的探索

Yongda Yu, Lei Zhang, Xinxin Guo, Minghui Yu, Zhengqi Zhuang, Guoping Rong, Haifeng Shen, Zhengfeng Li, Boge Wang, Guoan Zhang, Bangyu Xiang, Xiaobin Xu

机构 * Southern Cross University, Gold Coast, Australia(南方十字大学,黄金海岸,澳大利亚) TRE, Alibaba Inc., Hangzhou, China(TRE,阿里巴巴公司,杭州,中国)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 ConceptRM通过基于共识的纯度驱动数据清洗方法,有效提高虚假警报拦截能力,减少人工标注成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24694 2026-02-25 cs.CL cs.AI 62%

Repurposing Synthetic Data for Fine-grained Search Agent Supervision

将合成数据重新利用于细粒度搜索代理的监督

Yida Zhao, Kuan Li, Xixi Wu, Liwen Zhang, Dingchu Zhang, Baixuan Li, Maojia Song, Zhuo Chen, Chenxi Wang, Xinyu Wang, Kewei Tu, Pengjun Xie, Jingren Zhou, Yong Jiang

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Shanghai Engineering Research Center of Intelligent Vision and Imaging(智能视觉与成像上海工程研究中心) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出E-GRPO框架,通过利用训练中被丢弃的实体信息,提升搜索代理的细粒度学习和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04448 2026-02-25 cs.LG cond-mat.dis-nn stat.ML 57%

Transfer Learning in Infinite Width Feature Learning Networks

在无限宽度特征学习网络中进行迁移学习

Clarissa Lauditi, Blake Bordelon, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering and Applied Sciences(约翰·A·保罗森工程与应用科学学院) Center for Mathematical Sciences and Applications(数学科学与应用中心) Kempner Institute for the Study of Natural and Artificial Intelligence(自然与人工智能研究 institute) Harvard University(哈佛大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 该研究提出在无限宽神经网络中迁移学习的理论,分析预训练对泛化能力的影响,并通过实验验证了不同任务设置下的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09321 2026-02-25 eess.AS cs.SD 50%

Evaluating CNN with Stacked Feature Representations and Audio Spectrogram Transformer Models for Sound Classification

基于堆叠特征表示和音频频谱变换器模型的CNN评估用于声音分类

Parinaz Binandeh Dehaghania, Danilo Penab, A. Pedro Aguiar

机构 * SYSTEC-ARISE, Faculty of Engineering University of Porto, Portugal(SYSTEC-ARISE,工程学院,波尔图大学,葡萄牙)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于堆叠特征表示的CNN模型,用于环境声音分类,通过对比不同特征组合和预训练方法,验证其在资源受限场景下的有效性。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏