arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2511.17849 2025-12-01 cs.DC 92%

Pier: Efficient Large Language Model pretraining with Relaxed Global Communication

Pier:通过放松全局通信实现高效的大型语言模型预训练

Shuyuan Fan, Zhao Zhang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);LLM(abstract)

AI总结 Pier通过放松全局通信,提升大型语言模型预训练的效率,实现训练速度提升和运行时间减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21006 2025-12-01 cs.CL 89%

TrackList: Tracing Back Query Linguistic Diversity for Head and Tail Knowledge in Open Large Language Models

TrackList: 回溯查询语言多样性以探究开放式大语言模型中的头部与尾部知识

Ioana Buhnila, Aman Sinha, Mathieu Constant

机构 * ATILF, University of Lorraine - CNRS, France(ATILF,洛林大学 - CNRS,法国) Center for Data Science in Humanities, Chosun University, South Korea(人文数据科学中心,全州大学,韩国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TrackList研究了预训练数据对LLMs回答多样化语言查询的影响,发现LLMs在定义型问题表现最佳,但在例子型问题表现最差,且更倾向于改写流行知识而非尾部和技术知识。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22612 2025-12-01 cs.CL 85%

Improving LLM-based Ontology Matching with fine-tuning on synthetic data

通过在合成数据上微调提升基于LLM的本体匹配

Guilherme Sousa, Rinaldo Lima, Cassia Trojahn

机构 * Univ. Grenoble Alpes, Inria, CNRS, Grenoble INP(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、法国国家信息与自动化研究所、格勒诺布尔理工大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过生成合成数据并微调LLM,提升本体匹配任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15390 2025-12-01 cs.CL cs.LG 84%

Exploiting Vocabulary Frequency Imbalance in Language Model Pre-training

利用词汇频率不平衡性在语言模型预训练中

Woojin Chung, Jeonghoon Kim

机构 * KAIST(韩国科学技术院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过扩大词汇表降低分词文本复杂性,揭示了语言模型预训练中词汇规模与性能的关系。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21861 2025-12-01 cs.LG cs.AI 84%

Towards a Foundation Model for Partial Differential Equations Across Physics Domains

面向跨物理领域的偏微分方程基础模型

Eduardo Soares, Emilio Vital Brazil, Victor Shirasuna, Breno W. S. R. de Carvalho, Cristiano Malossi

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PDE-FM是一种跨物理领域预训练的基础模型,通过统一空间、谱和时间推理,实现复杂物理动态的高效建模与跨领域泛化。

Comments Accepted to the AAAI 2026 AI2ASE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22674 2025-12-01 cs.LG 81%

Modèles de Fondation et Ajustement : Vers une Nouvelle Génération de Modèles pour la Prévision des Séries Temporelles

基础模型与调整:迈向新一代时间序列预测模型

Morad Laglil, Emilie Devijver, Eric Gaussier, Bertrand Pracca

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 本文提出通过预训练后微调提升时间序列预测模型在长周期预测中的性能

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22482 2025-12-01 cs.CL cs.AI 62%

Exploring Performance Variations in Finetuned Translators of Ultra-Low Resource Languages: Do Linguistic Differences Matter?

探索在超低资源语言中微调翻译器的性能差异:语言差异是否起作用?

Isabel Gonçalves, Paulo Cavalin, Claudio Pinhanez

机构 * PUC-Rio(里约热内卢联邦大学) IBM Research Brazil(IBM巴西研究院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了超低资源语言中微调翻译器的性能差异,发现语言差异可能对翻译器生成能力有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21746 2025-12-01 cs.CL 57%

DELTA: Language Diffusion-based EEG-to-Text Architecture

DELTA: 基于语言扩散的EEG到文本架构

Mingyu Jeon, Hyobin Kim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 DELTA通过结合残差向量量化和语言扩散模型,提升了EEG到文本的语义对齐和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09082 2025-12-01 cs.CV 50%

Taming generative video models for zero-shot optical flow extraction

驯服生成视频模型以实现零样本光流提取

Seungwoo Kim, Khai Loong Aw, Klemen Kotar, Cristobal Eyzaguirre, Wanhee Lee, Yunong Liu, Jared Watrous, Stefan Stojanov, Juan Carlos Niebles, Jiajun Wu, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :prompting(abstract)

AI总结 本文提出KL-tracing方法,通过反事实提示实现生成视频模型的零样本光流提取,无需微调即可在现实和合成数据集上竞争现有最佳模型。

Comments Project webpage: https://neuroailab.github.io/projects/kl_tracing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22236 2025-12-01 cs.CV 50%

Bridging 3D Deep Learning and Curation for Analysis and High-Quality Segmentation in Practice

弥合3D深度学习与整理:用于分析和实践中的高质量分割

Simon Püttmann, Jonathan Jair Sànchez Contreras, Lennart Kowitz, Peter Lampen, Saumya Gupta, Davide Panzeri, Nina Hagemann, Qiaojie Xiong, Dirk M. Hermann, Cao Chen, Jianxu Chen

机构 * Leibniz-Institut für Analytische Wissenschaften - ISAS - e.V.(莱比锡分析科学研究所 - ISAS - 非营利组织) Stony Brook University(石溪大学) Department of Neurology, University Hospital Essen, University of Duisburg-Essen(神经科部门,埃森大学医院,杜伊斯堡-埃森大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 VessQC通过不确定性指导的整理方法提升3D显微图像分割的准确性,实现高效的人工参与修正,填补了不确定性估计与实际应用间的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏