arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2405.17009 2024-05-30 cs.AI 81%

Position: Foundation Agents as the Paradigm Shift for Decision Making

Xiaoqian Liu, Xingzhou Lou, Jianbin Jiao, Junge Zhang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

Comments 17 pages, camera-ready version of ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05049 2024-05-09 cs.CL 81%

Seeds of Stereotypes: A Large-Scale Textual Analysis of Race and Gender Associations with Diseases in Online Sources

Lasse Hyldig Hansen, Nikolaj Andersen, Jack Gallifant, Liam G. McCoy, James K Stone, Nura Izath, Marcela Aguirre-Jerez, Danielle S Bitterman, Judy Gichoya, Leo Anthony Celi

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07811 2024-04-11 cs.CL 81%

In-context Learning Generalizes, But Not Always Robustly: The Case of Syntax

Aaron Mueller, Albert Webson, Jackson Petty, Tal Linzen

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00415 2024-04-02 cs.CL 81%

CoDa: Constrained Generation based Data Augmentation for Low-Resource NLP

Chandra Kiran Reddy Evuru, Sreyan Ghosh, Sonal Kumar, Ramaneswaran S, Utkarsh Tyagi, Dinesh Manocha

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted to NAACL 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05136 2024-03-12 cs.AI cs.CV 81%

InstructDET: Diversifying Referring Object Detection with Generalized Instructions

Ronghao Dang, Jiangyan Feng, Haodong Zhang, Chongjian Ge, Lin Song, Lijun Gong, Chengju Liu, Qijun Chen, Feng Zhu, Rui Zhao, Yibing Song

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 29 pages (include Appendix) Published in ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06354 2024-03-12 cs.CL 81%

Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages

Michael Andersland

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07779 2023-12-14 cs.AI 81%

Tell, don't show: Declarative facts influence how LLMs generalize

Alexander Meinke, Owain Evans

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.15794 2023-11-15 cs.LG q-bio.GN 81%

HyenaDNA: Long-Range Genomic Sequence Modeling at Single Nucleotide Resolution

Eric Nguyen, Michael Poli, Marjan Faizi, Armin Thomas, Callum Birch-Sykes, Michael Wornow, Aman Patel, Clayton Rabideau, Stefano Massaroli, Yoshua Bengio, Stefano Ermon, Stephen A. Baccus, Chris Ré

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

Comments NeurIPS 2023 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05640 2023-11-13 cs.CL 81%

FinGPT: Large Generative Models for a Small Language

Risto Luukkonen, Ville Komulainen, Jouni Luoma, Anni Eskelinen, Jenna Kanerva, Hanna-Mari Kupari, Filip Ginter, Veronika Laippala, Niklas Muennighoff, Aleksandra Piktus, Thomas Wang, Nouamane Tazi, Teven Le Scao, Thomas Wolf, Osma Suominen, Samuli Sairanen, Mikko Merioksa, Jyrki Heinonen, Aija Vahtola, Samuel Antao, Sampo Pyysalo

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 17 pages (10 main), 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03269 2023-10-06 q-bio.BM cs.CL 81%

InstructProtein: Aligning Human and Protein Language via Knowledge Instruction

Zeyuan Wang, Qiang Zhang, Keyan Ding, Ming Qin, Xiang Zhuang, Xiaotong Li, Huajun Chen

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10378 2023-09-13 cs.CL 81%

Data Curation Alone Can Stabilize In-context Learning

Ting-Yun Chang, Robin Jia

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments ACL 2023 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11807 2023-08-24 cs.CL 81%

Towards an On-device Agent for Text Rewriting

Yun Zhu, Yinxiao Liu, Felix Stahlberg, Shankar Kumar, Yu-hui Chen, Liangchen Luo, Lei Shu, Renjie Liu, Jindong Chen, Lei Meng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03381 2023-07-10 cs.LG 81%

Teaching Arithmetic to Small Transformers

Nayoung Lee, Kartik Sreenivasan, Jason D. Lee, Kangwook Lee, Dimitris Papailiopoulos

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18138 2026-08-20 cs.CL cs.AI 新提交 81%

Language Models for Portuguese: A Systematic Mapping Study

面向葡萄牙语的语言模型:一项系统映射研究

Jhessica Silva, Carlos Caetano, Helena Maia, Breno Bernard Nicolau de França, Sandra Avila, Helio Pedrini

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过系统映射梳理出46个葡萄牙语语言模型,分析其特征、演变及关系,明确研究缺口并展望未来方向,为该领域发展提供全面概览。

Comments 37 pages; 7 figures; 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18094 2026-08-20 cs.CL cs.AI 新提交 81%

NE-BERT: A Multilingual Language Model for Nine Northeast Indian Languages

NE-BERT:适用于9种印度东北部语言的多语言语言模型

Badal Nyalang

机构 * MWire Labs(MWire实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对印度东北部9种低资源语言的代表性不足问题,提出NE-BERT多语言语言模型,通过加权采样等技术提升性能,解决词汇碎片化,发布资源推动当地NLP研究与数字包容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01781 2026-08-20 cs.CV cs.AI cs.LG 81%

Subimage Overlap Prediction: Task-Aligned Self-Supervised Pretraining For Semantic Segmentation In Remote Sensing Imagery

子图像重叠预测:面向遥感图像语义分割的任务对齐自监督预训练

Lakshay Sharma, Alex Marin

机构 * Instacart New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出子图像重叠预测任务,通过少量预训练数据提升遥感图像语义分割性能,实现更快收敛和同等或更优的mIoU表现。

Comments Accepted at CV4EO Workshop at WACV 2026

Journal ref Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) Workshops, 2026, pp. 1414-1423

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21333 2026-08-18 cs.CL cs.AI 版本更新 81%

SymbolicLight V1: Spike-Gated Dual-Path Language Modeling at High Activation Sparsity

SymbolicLight V1: 一种具有高激活稀疏性和亚十亿级预训练证据的脉冲门双路径语言建模

Ting Liu

机构 * SymbolicLight Research(SymbolicLight研究院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SymbolicLight V1,一种结合二进制Leaky Integrate-and-Fire脉冲动力学与连续残差流的脉冲门双路径语言模型,通过长程记忆的指数衰减聚合路径和短程精度的脉冲门局部注意力路径,实现了高激活稀疏性和亚十亿级预训练证据。

Comments 25 pages, 4 figures, 24 tables. Revised preprint: quality-gap framing, token-weighted versus unweighted domain PPL, and tightened architecture claims. Code and checkpoints: AGI/SymbolicLight-V1" target="_blank" rel="noopener">https://github.com/SymbolicLight-AGI/SymbolicLight-V1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04032 2026-08-18 cs.CL cs.AI cs.CV 版本更新 81%

jina-vlm: Small Multilingual Vision Language Model

Jina-VLM:小规模多语言视觉语言模型

Andreas Koukounas, Georgios Mastrapas, Florian Hönicke, Sedigheh Eslami, Guillaume Roncari, Han Xiao

机构 * Jina AI

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 Jina-VLM是一款24亿参数的多语言视觉语言模型,通过结合SigLIP2视觉编码器与Qwen3语言主干,实现了高效多语言视觉问答性能。

Comments 23 pages, 1-10 main content, 11-23 references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09028 2026-08-11 cs.AI cs.CL cs.DB cs.LO 新提交 81%

PolicyKG: An Agentic LLM Pipeline for Translating Institutional Policies into SHACL Knowledge Graphs

PolicyKG:一种用于将机构政策转换为SHACL知识图谱的智能体大语言模型流水线

Ponkrit Kaewsawee, Chaklam Silpasuwanchai, Chutiporn Anutariya

机构 * Asian Institute of Technology(亚洲理工学院)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PolicyKG流水线,可自动将机构政策转换为SHACL知识图谱,在AIT语料库上取得高分类准确率,适配新领域仅需替换注册表,解决了人工转换的效率问题。

Comments 23 pages, 3 figures, 4 tables. Under review at IJCKG 2026, Bangkok, Thailand

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28551 2026-08-11 cs.CV cs.CL cs.LG 版本更新 81%

DataComp-VLM: Improved Open Datasets for Vision-Language Models

DataComp-VLM:改进的视觉语言模型开放数据集

Matteo Farina, Vishaal Udandarao, Thao Nguyen, Selim Kuzucu, Maximilian Böther, Andreas Hochlehnert, Adhiraj Ghosh, Marianna Nezhurina, Karsten Roth, Joschka Struber, Yuhui Zhang, Sebastian Dziadzio, Elaine Sui, Soumya Jahagirdar, Dhruba Ghosh, Hasan Hammoud, Thomas De Min, Simone Caldarella, Jehanzeb Mirza, Sedrick Keh, Mehdi Cherti, Hilde Kuehne, Bernt Schiele, Serena Yeung-Levy, Muhammad Ferjad Naeem, Federico Tombari, Ana Klimovic, Elisa Ricci, Matthias Bethge, Sewoong Oh, Ameya Prabhu, Alessio Tonioni, Jenia Jitsev, Massimiliano Mancini, Ludwig Schmidt, Nikhil Parthasarathy

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出DataComp-VLM基准,通过数据混合(而非过滤)策略提升视觉语言模型训练效果,在8B模型上达到63.6%准确率,比现有最优数据集提升5.4个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00383 2026-08-04 cs.LO cs.AI cs.LG 新提交 81%

Pretrain on Small Synthetic Data, Scale Large for Free: Symmetry-Aware Foundation Model for Logic Rule Induction

在小型合成数据上预训练,免费实现大规模扩展:用于逻辑规则归纳的感知对称性基础模型

Yin Jun Phua

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出一种感知对称性的逻辑规则归纳基础模型,通过构造强制对称性将小型合成数据预训练的Neural Rule Inducer扩展至更大模式,提升了规则的可迁移性与保真度。

Comments Accepted at 20th Conference on Neurosymbolic Learning and Reasoning (NeSy 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29484 2026-08-03 cs.CL cs.LG 新提交 81%

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

证据类型竞争:干预数据何时能教会语言模型因果方向?

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。

Comments 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28994 2026-08-03 cs.NI cs.AI cs.CV cs.LG 新提交 81%

Point2Radio: A Foundation Model for Cross-Scene Radio Fields from Material-Aware Point Clouds

Point2Radio:面向材料感知点云的跨场景无线电场基础模型

Chaozheng Wen, Chenghong Bian, Hongze Chen, Jun Zhang

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Point2Radio是从多环境学习可迁移传播先验的基础模型,基于材料感知点云实现跨场景无线电场预测,在路径增益预测上较UNet基线误差降76.7%,轻量微调可提升环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15011 2026-07-31 cs.LG cs.AI cs.CY cs.MA 版本更新 81%

Epistemic diversity across language models mitigates knowledge collapse

语言模型中的知识崩溃与认知多样性

Damian Hodel, Jevin D. West

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究通过增加语言模型多样性缓解知识崩溃,发现单一模型短期表现好但长期崩溃加剧,多样性水平随训练迭代增加而提升,实验显示生态多样性对缓解崩溃至关重要。

Comments 30 pages, 21 figures. v3 changelog: updated introduction. v2 changelog: added experimental variations, updated theory, writing revisions, updated metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25271 2026-07-29 cs.LG cs.AI cs.PF 新提交 81%

Bridging Compute- and Data-Optimal Pretraining

弥合计算最优和数据最优预训练之间的差距

Tian Qin, Kimia Hamidieh, David Alvarez-Melis

机构 * Harvard University(哈佛大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对计算增长快于高质量数据可用性的问题,提出计算-数据(CD)缩放定律框架,通过引入令牌有效性函数η拟合数据扩展策略,划分训练操作模式,指出经典计算最优分配在多数实际设置下次优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19524 2026-07-23 cs.LG cs.AI cs.DC 新提交 81%

SynPre-FL: Synthetic data-driven pretraining integrated Federated Learning training framework

SynPre-FL:合成数据驱动的预训练集成联邦学习训练框架

Akarsh K Nair, Muhammad Arifur Rahman, Nicholas Shopland, Andy Burton, Jun He, Yuan Shen, David Baldwin, Emma O'Dowd, Amna Burzic, Mufti Mahmud, David J. Brown

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对联邦学习在临床风险预测中面临的问题及局限,提出SynPre-FL框架,结合合成EHR生成与合成预训练联邦学习,通过潜在自动编码器扩散模型等技术,提升非IID条件下预测的稳健性、可扩展性与可解释性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11020 2026-07-15 cs.CL cs.LG 版本更新 81%

Can a Language Model Learn Facts Continually in Its Weights?

语言模型能否在其权重中持续学习事实?

Charles O'Neill

机构 * Baseten(巴斯滕)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型能否在权重中持续学习事实,通过追踪写入Qwen3模型的虚构事实及实验发现,训练数据广度决定知识类型,事实可行为遗忘但不擦除,广泛数据能创建可用知识,可靠通道是上下文而非权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09955 2026-07-14 cs.LG cs.AI 新提交 81%

A Foundation Model for Multimodal Event Sequences in Financial Applications

金融应用中多模态事件序列的基础模型

Nikita Rusakov, Vladislav Meshkov, Konstantin Zorin, Gleb Zaripov, Alexander Uglov, Alexey Vasilev, Anton Klenitskiy

机构 * Sber(俄罗斯储蓄银行) Sber AI Lab(俄罗斯储蓄银行人工智能实验室)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究金融应用中多模态事件序列预测建模,提出预训练基础变压器模型统一多源事件成序列,经下一个事件预测学习通用表示,结合现有特征训练轻量级神经模型用于多下游任务,优于传统模型并减少开发开销且已应用取得业务改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09487 2026-07-13 cs.LG cs.CL stat.ML 新提交 81%

Neural Collapse Is Forbidden: Information Floors in Language Models

语言模型中的信息下限:神经坍缩是被禁止的

Bruno Abrahao

机构 * NYU Shanghai Leonard N. Stern School of Business, New York University(纽约大学上海纽约大学斯特恩商学院)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型中信息分配定律,通过单行中心化恒等式等方法,揭示宏观类别结构与令牌内上下文方差占比,理论上说明权重衰减影响,证明二元类别下限,表明定律在多方面成立及预训练中类别份额变化规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08162 2026-07-10 cs.CV cs.AI cs.LG 新提交 81%

ProsMAE: Multi-Source MAE Pretraining for ISUP Grade Classification

ProsMAE:用于ISUP分级分类的多源MAE预训练

Anna Jung, Kyeonghun Kim, Youngung Han, Eunseob Choi, Jiwon Yang, Ken Ying-Kai Liao, Hyuk-Jae Lee, Nam-Joon Kim

机构 * Seoul National University(首尔国立大学) GIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 针对全切片图像模型训练难题,提出多源MAE框架ProsMAE,利用多数据集切片预训练编码器,通过ProsCLS用于ISUP分级分类,在不相交PANDA分割下比普通MAE冻结线性探针基线有更高QWK。

Comments Accepted to APCCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏