arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-09 至 2026-02-09 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 11 篇

2602.06183 2026-02-09 cs.LG 85%

To 2:4 Sparsity and Beyond: Neuron-level Activation Function to Accelerate LLM Pre-Training

迈向2:4稀疏性:神经元层面激活函数加速LLM预训练

Meghana Madhyastha, Daniel Haziza, Jesse Cai, Newsha Ardalani, Zhiqi Bu, Carole-Jean Wu

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过神经元层面的激活函数稀疏性技术,加速LLM预训练,提升训练效率1.4-1.7倍,适用于NVIDIA A100及后续GPU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06394 2026-02-09 cs.AI cs.CE q-bio.GN q-fin.CP 83%

Unlocking Noisy Real-World Corpora for Foundation Model Pre-Training via Quality-Aware Tokenization

通过质量感知的分词解锁噪声真实世界语料用于基础模型预训练

Arvid E. Gollwitzer, Paridhi Latawa, David de Gruijl, Deepak A. Subramanian, Adrián Noriega de la Colina

机构 * Broad Institute of MIT and Harvard, Cambridge, MA, USA(麻省理工学院与哈佛大学Broad研究所) Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院) Koch Institute for Integrative Cancer Research, MIT, Cambridge, MA, USA(麻省理工学院Koch整合癌症研究 institute) Department of Neurology and Neurosurgery, McGill University, Montreal, Canada(麦吉尔大学神经学与神经外科系) The Montreal Neurological Hospital-Institute, Montreal, Canada(蒙特利尔神经科学医院-研究所)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 本研究提出质量感知分词方法,通过双层优化、强化学习和自适应参数学习机制,提升基础模型在基因组和金融领域的预训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06184 2026-02-09 cs.CV cs.CL 83%

PhenoLIP: Integrating Phenotype Ontology Knowledge into Medical Vision-Language Pretraining

PhenoLIP:将表型本体知识整合到医学视觉-语言预训练中

Cheng Liang, Chaoyi Wu, Weike Zhao, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 PhenoLIP通过整合表型本体知识提升医学视觉-语言模型的表型识别与跨模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06654 2026-02-09 cs.IR cs.AI 79%

Multimodal Generative Retrieval Model with Staged Pretraining for Food Delivery on Meituan

具有分阶段预训练的多模态生成检索模型用于美团外卖

Boyu Chen, Tai Guo, Weiyu Cui, Yuqing Li, Xingxing Wang, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出一种具有分阶段预训练的多模态生成检索模型,通过分阶段任务优化和语义ID利用,提升美团外卖检索性能与商业收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06772 2026-02-09 cs.LG 77%

Calibrating Generative AI to Produce Realistic Essays for Data Augmentation

校准生成式AI以生成真实论文用于数据增强

Edward W. Wolfe, Justin O. Barber

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 本研究通过比较三种提示方法,发现预测下文和25个示例策略在生成真实论文用于数据增强方面效果最佳。

Comments Artificial Intelligence in Measurement and Education Conference (AIME-Con)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06949 2026-02-09 cs.RO cs.AI cs.CV cs.LG 73%

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

DreamDojo:从大规模人类视频中学习通用机器人世界模型

Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K. R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, Linxi "Jim" Fan

机构 * NVIDIA HKUST(香港科技大学) UC Berkeley(加州大学伯克利分校) Stanford(斯坦福大学) KAIST(韩国科学技术院) UofT(多伦多大学) UCSD(加州大学圣地亚哥分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 DreamDojo通过大规模人类视频学习通用机器人世界模型,解决动作标签稀缺问题,实现高精度物理理解和实时交互。

Comments Project page: https://dreamdojo-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04301 2026-02-09 cs.LG cs.CL 73%

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06602 2026-02-09 cs.SD cs.AI cs.LG eess.AS 62%

Scaling Speech Tokenizers with Diffusion Autoencoders

通过扩散自编码器扩展语音标记器

Yuancheng Wang, Zhenyu Tang, Yun Wang, Arthur Hinsvark, Yingru Liu, Yinghao Li, Kainan Peng, Junyi Ao, Mingbo Ma, Mike Seltzer, Qing He, Xubo Liu

机构 * Meta Superintelligence Labs(Meta超智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SiTok,一种基于扩散自编码器的语音标记器,通过监督学习实现语义丰富的表示,并在低token率和比特率下实现高保真音频重建。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05975 2026-02-09 cs.IR cs.CL 57%

SAGE: Benchmarking and Improving Retrieval for Deep Research Agents

SAGE:深度研究代理检索的基准测试与改进

Tiansheng Hu, Yilun Zhao, Canyu Zhang, Arman Cohan, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) Yale University(耶鲁大学) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 SAGE基准测试评估了深度研究代理的检索能力,发现BM25在推理密集型检索中表现优于大语言模型检索器,并提出基于语料库的测试时扩展框架提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06460 2026-02-09 cs.SD 50%

EMG-to-Speech with Fewer Channels

通过更少的通道实现EMG到语音

Injune Hwang, Jaejun Lee, Kyogu Lee

机构 * Department of Intelligence and Information, Seoul National University, Republic of Korea(智能与信息系,首尔国立大学,韩国) Artificial Intelligence Institute, Seoul National University, Republic of Korea(人工智能研究所,首尔国立大学,韩国) Interdisciplinary Program in Artificial Intelligence, Seoul National University, Republic of Korea(人工智能跨学科项目,首尔国立大学,韩国)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文通过预训练和通道意识设计,研究了减少通道对EMG到语音性能的影响,发现微调优于从头训练,支持轻量级静默语音系统开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05527 2026-02-09 cs.CV 50%

Generalization of Self-Supervised Vision Transformers for Protein Localization Across Microscopy Domains

自监督视觉变换器在跨显微镜领域的蛋白质定位中的泛化

Ben Isselmann, Dilara Göksu, Andreas Weinmann

机构 * Hochschule Darmstadt(达姆施塔特应用技术大学) Technische Hochschule Würzburg-Schweinfurt(维尔茨堡-施维林特技术大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文通过预训练视觉变换器在不同显微镜领域中实现蛋白质定位的泛化,展示了领域相关自监督学习在跨领域迁移中的有效性。

Comments Preprint; not yet peer reviewed. AMEE Conference Proceeding 2025, 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏