arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2506.01687 2026-04-22 cs.CL 88%

StochasTok: Improving Fine-Grained Subword Understanding in LLMs

StochasTok:提升大语言模型的细粒度子词理解

Anya Sims, Thom Foster, Klara Kaleb, Tuan-Duy H. Nguyen, Joseph Lee, Jakob N. Foerster, Yee Whye Teh, Cong Lu

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出StochasTok,一种高效的随机分词方法,通过在训练中随机分割token,提升LLM在子词层面的任务表现,包括字符计数和数学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12463 2026-04-02 cs.CL 88%

Community size rather than grammatical complexity better predicts Large Language Model accuracy in a novel Wug Test

社区规模而非语法复杂性更能预测大型语言模型在新型Wug测试中的准确性

Nikoleta Pantelidou, Evelina Leivada, Raquel Montero, Paolo Morosi

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Institució Catalana de Recerca i Estudis Avançats(加泰罗尼亚高等研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过多语言Wug测试评估大型语言模型在形态泛化任务中的表现,发现模型准确性更受语言社区规模和数据量影响,而非语法复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19660 2026-03-30 cs.CV cs.LG 88%

Towards Knowledge Guided Pretraining Approaches for Multimodal Foundation Models: Applications in Remote Sensing

面向多模态基础模型的知识引导预训练方法:遥感应用

Praveen Ravirathinam, Ajitesh Parthasarathy, Ankush Khandelwal, Rahul Ghosh, Vipin Kumar

机构 * University of Minnesota(明尼苏达大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出KG-VSF方法,通过条件生成任务建模预测,提升遥感任务中因果关系的建模能力,提升下游任务性能。

Comments 33 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21584 2026-03-24 cs.LG cs.CV 88%

SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models

SSAM:奇异子空间对齐用于融合多模态大语言模型

Md Kaykobad Reza, Ameya Patil, Edward Ayrapetian, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 SSAM通过参数空间对齐融合多模态大语言模型,无需训练数据实现跨模态统一,提升性能并降低资源消耗。

Comments 25 Pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18013 2026-03-20 cs.CL 88%

Learned but Not Expressed: Capability-Expression Dissociation in Large Language Models

学会但未表达:大型语言模型中的能力-表达脱节

Toshiyuki Shigemura

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在特定条件下能重构训练数据内容,但无法在常规生成任务中表现的能力脱节现象,发现生成输出中未出现非因果解决方案框架。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14563 2026-03-17 cs.CL 88%

Multilingual TinyStories: A Synthetic Combinatorial Corpus of Indic Children's Stories for Training Small Language Models

多语言TinyStories:一种印度儿童故事的合成组合语料库,用于训练小型语言模型

Deepon Halder, Angira Mukherjee

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 本文提出一个多语言TinyStories语料库,包含17种印度语言的儿童故事,用于训练和评估小型语言模型,通过混合编纂流程生成了132,942个故事和9390万词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14178 2026-03-12 cs.CV cs.AI 88%

UniWeTok: An Unified Binary Tokenizer with Codebook Size $\mathit{2^{128}}$ for Unified Multimodal Large Language Model

UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型

Shaobin Zhuang, Yuang Ai, Jiaming Han, Weijia Mao, Xiaohui Li, Fangyikang Wang, Xiao Wang, Yan Li, Shanchuan Lin, Kun Xu, Zhenheng Yang, Huaibo Huang, Xiangyu Yue, Hao Chen, Yali Wang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。

Comments 29 pages, 9 figures, 33 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23184 2026-03-10 cs.CL 88%

PonderLM-2: Pretraining LLM with Latent Thoughts in Continuous Space

PonderLM-2: 在连续空间中通过潜在思想预训练语言模型

Boyi Zeng, He Li, Shixiang Song, Yixuan Wang, Zitong Wang, Ziwei He, Xinbing Wang, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL

AI总结 PonderLM-2通过在预训练过程中引入潜在思想的连续空间优化,提升了语言模型的生成能力与下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04478 2026-03-06 cs.LG 88%

Standing on the Shoulders of Giants: Rethinking EEG Foundation Model Pretraining via Multi-Teacher Distillation

站在巨人肩膀上:通过多教师蒸馏重新思考EEG基础模型预训练

Chenqi Li, Yu Liu, Shuo Zhang, Timothy Denison, Tingting Zhu

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出MTDP框架,通过多教师蒸馏预训练EEG基础模型,提升模型性能并减少预训练数据需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00253 2026-03-04 cs.LG 88%

CoPeP: Benchmarking Continual Pretraining for Protein Language Models

CoPeP:蛋白质语言模型持续预训练基准测试

Darshan Patil, Pranshu Malviya, Mathieu Reymond, Quentin Fournier, Sarath Chandar

机构 * Mila - Quebec AI Institute(魁北克AI研究所) Polytechnique Montréal(蒙特利尔理工学院) Chandar Research Lab(昌达尔研究实验室) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 CoPeP基准测试通过评估持续学习方法在蛋白质语言模型中的表现,揭示了整合时间元信息对模型性能的提升效果。

Comments 29 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21485 2026-02-26 cs.CL cs.HC 88%

Evaluating the Usage of African-American Vernacular English in Large Language Models

评估大型语言模型中非裔美国人俚语英语的使用情况

Deja Dunlap, R. Thomas McCoy

机构 * Yale University(耶鲁大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究评估了大型语言模型对非裔美国人俚语英语的表示准确性,发现模型在语法使用上存在偏差,并复制了刻板印象,需改进训练数据和公平性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03313 2026-02-24 cs.LG 88%

Scaling Laws Revisited: Modeling the Role of Data Quality in Language Model Pretraining

再论缩放定律:建模数据质量在语言模型预训练中的作用

Anirudh Subramanyam, Yuxin Chen, Robert L. Grossman

机构 * Center for Translational Data Science(转化数据科学中心) Department of Computer Science(计算机科学系) Department of Medicine(医学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出了一种考虑数据质量的缩放定律,通过实验展示了高质量数据可减少模型规模和计算需求。

Comments 21 pages, 5 figures

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18468 2026-02-24 cs.CY cs.CL 88%

The Algorithmic Unconscious: Structural Mechanisms and Implicit Biases in Large Language Models

算法无意识:大型语言模型中的结构机制与隐性偏见

Philippe Boisnard

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨了大型语言模型中结构性机制与隐性偏见,揭示了分词、注意力等机制对偏见的影响,并提出技术诊所框架以促进AI基础设施的批判性利用。

Comments 18 pages, 5 figures, Extended version of a paper presented at the international conference 'Artificial Intelligence and Transformations of Information' (LOGOS/FLSH, Hassan II University of Casablanca, Morocco, December 2025), accepted for publication in LOGOS after double-blind peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09655 2026-02-12 cs.CR cs.AI 88%

Data Provenance Auditing of Fine-Tuned Large Language Models with a Text-Preserving Technique

针对微调大型语言模型的数据来源审计技术与文本保留技术

Yanming Li, Cédric Eichler, Nicolas Anciaux, Alexandra Bensamoun, Lorena Gonzalez Manzano, Seifeddine Ghozzi

机构 * Inria(法国国家信息与自动化技术研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于文本保留技术的审计系统,用于检测微调大型语言模型时敏感文本的使用情况,通过不可见Unicode字符构建标记并利用统计保证实现高检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07540 2026-02-10 cs.CV cs.LG 88%

LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing

基于LLM的诊断证据对齐用于有限配对情况下的医学视觉-语言预训练

Huimin Yan, Liang Bai, Xian Yang, Long Chen

机构 * Institute of Intelligent Information Processing, Shanxi University(山西大学智能信息处理研究所) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学阿利安斯商学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出LLM引导的诊断证据对齐方法,旨在解决有限配对数据下医学视觉-语言预训练的诊断表示学习问题,通过提取关键诊断证据提升跨模态对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11300 2026-02-06 cs.HC cs.AI 88%

Beyond touch-based human-machine interface: Control your machines in natural language by utilizing large language models and OPC UA

超越基于触控的人机界面:通过利用大语言模型和OPC UA控制机器

Bernd Hofmann, Niklas Piechulek, Sven Kreitlein, Joerg Franke, Patrick Bruendl

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 利用大语言模型和OPC UA实现自然语言控制机器,通过工具调用提升工业人机交互的自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07687 2026-01-27 cs.CL 88%

Large Language Models as Proxies for Theories of Human Linguistic Cognition

大语言模型作为人类语言认知理论的代理

Imry Ziv, Nur Lan, Emmanuel Chemla, Roni Katzir

机构 * Tel Aviv University(特拉维夫大学) École Normale Supérieure(高等师范学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文探讨了大语言模型作为人类语言认知理论代理的潜力,分析了其在解释语言模式获取和类型学验证中的作用,指出其帮助有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15892 2026-01-26 cs.CL 88%

Stable-DiffCoder: Pushing the Frontier of Code Diffusion Large Language Model

Stable-DiffCoder:推动代码扩散大语言模型的前沿

Chenghao Fan, Wen Heng, Bo Li, Sichen Liu, Yuxuan Song, Jing Su, Xiaoye Qu, Kai Shen, Wei Wei

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);pretraining(abstract);分类 cs.CL

AI总结 Stable-DiffCoder通过基于扩散的训练方法,在代码生成任务中超越了传统自回归模型,提升了代码建模的质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10986 2026-01-19 cs.CL 88%

ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models

ZPD检测器:基于能力-难度对齐的数据选择用于大语言模型

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Shijian Li

机构 * State Key Laboratory of Brain–Machine Intelligence(脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ZPD检测器通过能力-难度对齐动态选择高价值样本,提升大语言模型的数据利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09100 2026-01-16 cs.AI 88%

DScheLLM: Enabling Dynamic Scheduling through a Fine-Tuned Dual-System Large language Model

DScheLLM:通过微调双系统大语言模型实现动态调度

Lixiang Zhang, Chenggong Zhao, Qing Gao, Xiaoke Zhao, Gengyi Bai, Jinhu Lv

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 DScheLLM通过微调双系统大语言模型,首次在动态环境中应用大语言模型解决作业车间调度问题,展示其在智能调度优化中的潜力。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19631 2026-01-16 cs.AI 88%

Leveraging Open-Source Large Language Models for encoding Social Determinants of Health using an Intelligent Router

利用开源大型语言模型对健康社会决定因素进行编码的方法

Akul Goel, Surya Narayanan Hari, Belinda Waltman, Matt Thomson

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于开源LLM的智能路由系统,用于高准确率提取SDOH相关医疗记录信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05776 2026-01-12 cs.CL 88%

One Script Instead of Hundreds? On Pretraining Romanized Encoder Language Models

一个脚本而不是数百个?关于预训练罗马化编码语言模型

Benedikt Ebing, Lennart Keller, Goran Glavaš

机构 * Center for Artificial Intelligence and Data Science(人工智能与数据科学中心) University of Würzburg(乌尔姆大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL

AI总结 研究通过预训练罗马化和原始文本,探讨罗马化在多语言模型中的有效性,发现分段脚本语言性能损失小,而形态音节脚本语言需更高保真度罗马化以缓解退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01491 2026-01-07 cs.CL 88%

The Homogenizing Effect of Large Language Models on Human Expression and Thought

大语言模型对人类表达与思维的同质化效应

Zhivar Sourati, Alireza S. Ziabari, Morteza Dehghani

机构 * Department of Computer Science(计算机科学系) Center for Computational Language Sciences(计算语言学中心) Department of Psychology, University of Southern California(心理学系,南加州大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 大语言模型通过标准化语言和推理,加剧了人类认知多样性的同质化效应,影响集体智慧和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00869 2026-01-06 cs.AI 88%

Cultural Encoding in Large Language Models: The Existence Gap in AI-Mediated Brand Discovery

大语言模型中的文化编码:AI介导的品牌发现中的存在缺口

Huang Junyao, Situ Ruimin, Ye Renqin

机构 * OmniEdge (Zhizibianjie) AI Consulting Co., Ltd.(OmniEdge(智比特)人工智能咨询有限公司)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本研究揭示大语言模型中文化编码导致的品牌存在缺口,提出数据护城河框架,帮助品牌通过本地化提升AI可见性。

Comments 19 pages, 5 tables. Dataset and code available at https://github.com/zhizibianjie-omniedge/geo-cultural-encoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01495 2026-01-05 cs.CL 88%

C-VARC: A Large-Scale Chinese Value Rule Corpus for Value Alignment of Large Language Models

C-VARC:一个大规模的中文价值观规则语料库用于大语言模型的价值对齐

Ping Wu, Guobin Shen, Dongcheng Zhao, Yuwei Wang, Yiting Dong, Yu Shi, Enmeng Lu, Feifei Zhao, Yi Zeng

机构 * BrainCog Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所脑认知实验室,北京,中国) Beijing Key Laboratory of Safe AI and Superalignment, Beijing, China(北京安全人工智能与超对齐关键实验室,北京,中国) Beijing Institute of AI Safety and Governance, Beijing, China(北京人工智能安全与治理研究所,北京,中国) The School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) Long-term AI, Beijing, China(长期人工智能,北京,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 C-VARC通过构建大规模中文价值观规则语料库,提供了一种基于中国核心价值观的价值对齐方法,有效提升了大语言模型在不同文化背景下的伦理评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12411 2025-12-30 cs.CL 88%

The Cultural Gene of Large Language Models: A Study on the Impact of Cross-Corpus Training on Model Values and Biases

大语言模型的文化基因:跨语料库训练对模型价值观与偏见的影响研究

Emanuel Z. Fenech-Borg, Tilen P. Meznaric-Kos, Milica D. Lekovic-Bojovic, Arni J. Hentze-Djurhuus

机构 * Department of Communications(通讯系) University of Malta(马耳他大学) Faculty of Mathematics(数学系) University of Primorska(普里摩尔卡大学) Faculty of Electrical Engineering(电气工程系) University of Montenegro(黑山大学) Faculty of Science & Technology(科学与技术系) University of the Faroe Islands(法罗群岛大学) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过跨文化探针数据集分析大语言模型在个人主义-集体主义和权力距离维度上的文化偏见,揭示模型价值观与训练语料文化背景的关联。

Comments 10 pages, 5 figures, IEEE conference format, submitted to [Conference Name]

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18027 2025-12-23 cs.CL cs.CY cs.SI 88%

CoPE: A Small Language Model for Steerable and Scalable Content Labeling

CoPE:一种可调节且可扩展的内容标注小语言模型

Samidh Chakrabarti, David Willner, Kevin Klyman, Tiffany Saade, Emily Capstick, Sabina Nong

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 CoPE是一种可调节且可扩展的内容标注小语言模型,通过矛盾示例训练和双目标注方法,实现高效准确的内容标注,并在小规模下达到与前沿模型相当的性能。

Comments 21 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17669 2025-12-22 cs.CL 88%

Generating Completions for Broca's Aphasic Sentences Using Large Language Models

利用大语言模型生成布罗卡失语症患者句子的完成

Sijbren van Vaals, Yevgen Matusevych, Frank Tsiwah

机构 * Center for Language and Cognition Groningen, University of Groningen(格罗宁根大学语言与认知中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究利用大语言模型生成布罗卡失语症患者句子的完成,通过合成数据训练模型以提升其在语法规则缺失句子重建中的性能。

Comments in IEEE Journal of Biomedical and Health Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12770 2025-12-16 cs.CL 88%

Curió-Edu 7B: Examining Data Selection Impacts in LLM Continued Pretraining

Curió-Edu 7B: 探究数据选择对LLM持续预训练的影响

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

机构 * Institute of Computing (IC) University of Campinas (UNICAMP)(计算研究所(IC)坎皮纳斯大学(UNICAMP)) School of Electrical and Computer Engineering (FEEC) University of Campinas (UNICAMP)(电气与计算机工程学院(FEEC)坎皮纳斯大学(UNICAMP))

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL

AI总结 Curió-Edu 7B通过数据选择在有限计算资源下超越完整语料库模型,证明数据质量对语言适应的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03270 2025-12-12 cs.CL 88%

SCALE: Upscaled Continual Learning of Large Language Models

SCALE:大规模语言模型的扩展持续学习

Jin-woo Lee, Junhwa Choi, Bongkyu Hwang, Jinho Choo, Bogun Kim, JeongSeon Yi, Joonseok Lee, DongYoung Jung, Jaeseon Park, Kyoungwon Park, Suk-hoon Jung

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 SCALE通过宽度扩展架构在持续学习中平衡稳定性与可塑性,减少遗忘并提升多语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏