arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2602.23804 2026-03-02 cs.LG 79%

Actor-Critic Pretraining for Proximal Policy Optimization

行为克隆预训练用于近端策略优化

Andreas Kernbach, Amr Elsheikh, Nicolas Grupp, René Nagel, Marco F. Huber

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于行为克隆的actor-critic预训练方法,用于近端策略优化,通过初始化actor和critic网络提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07452 2026-02-27 cs.CR cs.CL 79%

PATCH: Mitigating PII Leakage in Language Models with Privacy-Aware Targeted Circuit PatcHing

PATCH: 通过隐私意识的针对性电路修补缓解语言模型中的PII泄露

Anthony Hughes, Vasisht Duddu, N. Asokan, Nikolaos Aletras, Ning Ma

机构 * University of Sheffield(谢菲尔德大学) University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 PATCH通过针对性电路修补减少语言模型中的PII泄露,实现更好的隐私-实用性平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20307 2026-02-25 cs.LG 79%

In-context Pre-trained Time-Series Foundation Models adapt to Unseen Tasks

上下文预训练时间序列基础模型适应于未见任务

Shangqing Xu, Harshavardhan Kamarthi, Haoxin Liu, B. Aditya Prakash

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出ICTP框架,通过增强时间序列基础模型的上下文学习能力,使其无需微调即可提升在未见任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16552 2026-02-23 cs.IR cs.CL 79%

Revela: Dense Retriever Learning via Language Modeling

Revela:通过语言建模进行密集检索器学习

Fengyu Cai, Tong Chen, Xinran Zhao, Sihao Chen, Hongming Zhang, Sherry Tongshuang Wu, Iryna Gurevych, Heinz Koeppl

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Tencent AI Lab(腾讯人工智能实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 Revela通过语言建模方法实现自监督检索器学习,无需标注数据即可在多个基准上超越监督模型。

Comments Accepted to ICLR 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16696 2026-02-19 q-bio.GN cs.LG q-bio.QM 79%

Parameter-free representations outperform single-cell foundation models on downstream benchmarks

无需参数的表示方法在下游基准测试中优于单细胞基础模型

Huan Souza, Pankaj Mehta

机构 * Department of Physics, Boston University, Boston, MA, 02215, USA Faculty of Computing Data Science, Boston University, \ , MA, 02215, USA

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 无需参数的表示方法在单细胞基础模型的下游任务中表现优异,通过简单线性方法超越传统深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16422 2026-02-19 eess.IV cs.AI cs.CV 79%

Automated Histopathology Report Generation via Pyramidal Feature Extraction and the UNI Foundation Model

通过金字塔特征提取和UNI基础模型实现自动化病理报告生成

Ahmet Halici, Ece Tugba Cebeci, Musa Balci, Mustafa Cini, Serkan Sokmen

机构 * ViseurAI

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出基于UNI基础模型和Transformer解码器的框架,通过金字塔特征提取和生物医学术语分词技术,实现全切片图像的自动化报告生成,并通过检索验证提升可靠性。

Comments 9 pages. Equal contribution: Ahmet Halici, Ece Tugba Cebeci, Musa Balci

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15897 2026-02-19 cs.CL 79%

Mitigating Gradient Inversion Risks in Language Models via Token Obfuscation

通过令牌混淆缓解语言模型中的梯度倒置风险

Xinguo Feng, Zhongkui Ma, Zihan Wang, Alsharif Abuadbba, Guangdong Bai

机构 * The University of Queensland(昆士兰大学) CSIRO's Data61(CSIRO的数据61部门) City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文提出GHOST机制,通过令牌混淆解耦梯度、嵌入和令牌空间的联系,有效缓解语言模型的梯度倒置风险,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19919 2026-02-18 cs.CL 79%

Your AI Bosses Are Still Prejudiced: The Emergence of Stereotypes in LLM-Based Multi-Agent Systems

你的AI老板仍然有偏见:基于LLM的多智能体系统中刻板印象的出现

Jingyu Guo, Yingying Xu

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL

AI总结 研究发现基于LLM的多智能体系统中会自发产生刻板印象,且这种现象在互动轮次和决策权力增加时更加显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02674 2026-02-18 cs.CL 79%

Examining Language Modeling Assumptions Using an Annotated Literary Dialect Corpus

利用标注的文学方言语料库检验语言模型假设

Craig Messner, Tom Lippincott

机构 * Center for Digital Humanities(数字人文中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文通过标注的文学方言语料库,探讨了不同语言建模假设对正写法变化信息提取的影响,发现词标注方案对模型表现有显著影响。

Comments Accepted to NLP4DH@EMNLP2024

Journal ref Proceedings of the 4th International Conference on Natural Language Processing for Digital Humanities (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07087 2026-02-11 cs.LG 79%

When Should We Introduce Safety Interventions During Pretraining?

在预训练过程中何时引入安全干预

Dylan Sam, Sachin Goyal, Pratyush Maini, Alexander Robey, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文研究了在预训练过程中何时引入安全干预以提高模型鲁棒性,发现20%-60%的预训练阶段引入干预效果最佳,且早期干预能更清晰地区分安全与有害内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15792 2026-02-11 cs.LG physics.chem-ph 79%

Deep Learning Foundation Models from Classical Molecular Descriptors

从经典分子描述符构建深度学习基础模型

Jackson W. Burns, Akshat Shirish Zalte, Charlles R. A. Abreu, Jochen Sieg, Christian Feldmann, Miriam Mathea, William H. Green

机构 * BASF SE(巴斯夫股份有限公司)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 CheMeleon通过低噪声分子描述符学习,实现超越经典方法的分子性质预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06654 2026-02-09 cs.IR cs.AI 79%

Multimodal Generative Retrieval Model with Staged Pretraining for Food Delivery on Meituan

具有分阶段预训练的多模态生成检索模型用于美团外卖

Boyu Chen, Tai Guo, Weiyu Cui, Yuqing Li, Xingxing Wang, Chuan Shi, Cheng Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 本文提出一种具有分阶段预训练的多模态生成检索模型,通过分阶段任务优化和语义ID利用,提升美团外卖检索性能与商业收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05347 2026-02-06 cs.CL 79%

How Do Language Models Acquire Character-Level Information?

语言模型如何获取字符级信息?

Soma Sato, Ryohei Sasano

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比不同训练设置,揭示了语言模型获取字符级信息的机制,发现合并规则、正字法约束以及子字符串的语义关联和句法信息是关键因素。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17923 2026-02-05 cs.CL 79%

Language models can learn implicit multi-hop reasoning, but only if they have lots of training data

语言模型可以学习隐式多跳推理,但只有在有大量训练数据的情况下

Yuekun Yao, Yupei Du, Dawei Zhu, Michael Hahn, Alexander Koller

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了语言模型通过大量训练数据学习隐式多跳推理的能力,并发现训练数据量随推理跳数呈指数增长,但通过课程学习可部分缓解这一需求。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02511 2026-02-04 cs.CY cs.AI 79%

Training Data Governance for Brain Foundation Models

脑基础模型的训练数据治理

Margot Hanley, Jiunn-Tyng Yeh, Ryan Rodriguez, Jack Pilkington, Nita Farahany

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI

AI总结 本文探讨了在神经数据上训练基础模型所面临的伦理挑战,提出治理框架以规范数据使用和保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02425 2026-02-03 cs.LG q-bio.QM 79%

Repurposing Protein Language Models for Latent Flow-Based Fitness Optimization

重新利用蛋白质语言模型进行潜在流基于的适应度优化

Amaru Caceres Arroyo, Lea Bogensperger, Ahmed Allam, Michael Krauthammer, Konrad Schindler, Dominik Narnhofer

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 CHASE通过重新利用预训练蛋白质语言模型的进化知识,结合潜在流匹配模型,在蛋白质设计中实现高适应度变体的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15048 2026-02-03 cs.CL 79%

MaiBERT: A Pre-training Corpus and Language Model for Low-Resourced Maithili Language

MaiBERT: 一种针对低资源马尔瓦里语的预训练语料库和语言模型

Sumit Yadav, Raju Kumar Yadav, Utsav Maskey, Gautam Siddharth Kashyap, Ganesh Gautam, Usman Naseem

机构 * IOE, Pulchowk Campus, Lalitpur, Nepal(尼泊尔拉利特普尔 Pulchowk 校区 IOE) Macquarie University, Sydney, Australia(澳大利亚悉尼麦考瑞大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 MaiBERT是一种针对马尔瓦里语的预训练语言模型,通过掩码语言建模技术在新构建的语料库上训练,实现了新闻分类任务中的高准确率,优于现有区域模型。

Comments Accepted at EACL LoResLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00573 2026-02-03 cs.CL 79%

Training a Utility-based Retriever Through Shared Context Attribution for Retrieval-Augmented Language Models

通过共享上下文归因训练基于效用的检索器以增强检索增强语言模型

Yilong Xu, Jinhua Gao, Xiaoming Yu, Yuanhai Xue, Baolong Bi, Huawei Shen, Xueqi Cheng

机构 * State Key Lab of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) Key Lab of AI Safety, Chinese Academy of Sciences(人工智能安全重点实验室,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 SCARLet通过共享上下文归因和多任务泛化提升检索增强语言模型的检索性能。

Comments EMNLP 2025 Main Conference (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00594 2026-02-03 cs.CL cs.SD eess.AS 79%

Kanade: A Simple Disentangled Tokenizer for Spoken Language Modeling

Kanade:一种简单的解耦语音分词器用于语音语言建模

Zhijie Huang, Stephen McIntosh, Daisuke Saito, Nobuaki Minematsu

机构 * The University of Tokyo(东京大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 Kanade是一种单层解耦语音分词器,通过分离声学常量实现高质量语音建模,达到最先进的说话人解耦和词汇可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18302 2026-01-27 cs.CL 79%

Suppressing Final Layer Hidden State Jumps in Transformer Pretraining

抑制变换器预训练中的最终层隐藏状态跳跃

Keigo Shibata, Kazuki Yano, Ryosuke Takahashi, Jaesung Lee, Wataru Ikeda, Jun Suzuki

机构 * Tohoku University(东京东京大学) RIKEN(日本研究机构) NII LLMC(国家信息基础设施(NII)语言大模型中心)

专题命中 预训练与数据 :pretraining(title);language model(abstract);分类 cs.CL

AI总结 本文提出JREG正则化器,通过抑制变换器预训练中的最终层隐藏状态跳跃,提升模型任务性能。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17047 2026-01-27 cs.CV cs.LG eess.IV 79%

A Contrastive Pre-trained Foundation Model for Deciphering Imaging Noisomics across Modalities

一种用于跨模态解码成像噪声组学的对比预训练基础模型

Yuanjie Gu, Yiqun Wang, Chaohui Yu, Ang Xuan, Fan Wang, Zhi Lu, Biqin Dong

机构 * College of Biomedical Engineering, Yiwu Research Institute, Fudan University, Shanghai, China(复旦大学生物医学工程学院) Department of Psychological and Cognitive Sciences, Tsinghua University, Beijing, China(清华大学心理学与认知科学系) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) DAMO Academy, Alibaba Group, Beijing, China(阿里云达摩院) Hupan Laboratory, Hangzhou, Zhejiang, China(华平实验室)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出CoP基础模型,通过对比学习解码成像噪声,实现无需大量数据的高性能噪声分析,提升跨模态成像诊断的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13223 2026-01-26 cs.LG 79%

Data Matters Most: Auditing Social Bias in Contrastive Vision Language Models

数据最为关键:审计对比视觉语言模型中的社会偏见

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦女王学院) Institut Jožef Stefan(Jožef Stefan研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 研究通过对比CLIP和OpenCLIP模型,发现数据来源是偏见的主要驱动因素,不同去偏策略在不同模型和数据规模下效果各异。

Comments Published at TMLR; updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12930 2026-01-21 cs.LG cs.NI 79%

Universal Embedding Function for Traffic Classification via QUIC Domain Recognition Pretraining: A Transfer Learning Success

通过QUIC领域识别预训练实现通用嵌入函数用于流量分类:一种迁移学习的成功

Jan Luxemburk, Karel Hynek, Richard Plný, Tomáš Čejka

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本文提出通过预训练QUIC领域识别模型实现通用嵌入函数,用于提升加密流量分类的迁移学习性能。

Journal ref IEEE Transactions on Network and Service Management, vol. 23, pp. 1647-1663, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12594 2026-01-21 eess.AS cs.AI cs.SD 79%

SLAP: Scalable Language-Audio Pretraining with Variable-Duration Audio and Multi-Objective Training

SLAP: 可扩展的语言-音频预训练与可变时长音频及多目标训练

Xinhao Mei, Gael Le Lan, Haohe Liu, Zhaoheng Ni, Varun Nagaraja, Yang Liu, Yangyang Shi, Vikas Chandra

机构 * Meta

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 SLAP通过可变时长音频和多目标训练,提升语言-音频预训练的规模和效果,实现更丰富的音频表示并在多个任务中取得新突破。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11350 2026-01-21 cs.SD cs.CL eess.AS 79%

GLAP: General contrastive audio-text pretraining across domains and languages

GLAP: 跨领域和语言的通用对比音频-文本预训练

Heinrich Dinkel, Zhiyong Yan, Tianzi Wang, Yongqing Wang, Xingwei Sun, Yadong Niu, Jizhong Liu, Gang Li, Junbo Zhang, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., China(小米公司)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL

AI总结 GLAP通过多语言和多领域能力扩展CLAP,实现跨语言和跨领域的音频-文本预训练,在多个基准测试中表现优异。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08773 2026-01-14 cs.SE cs.AI 79%

Reliable Graph-RAG for Codebases: AST-Derived Graphs vs LLM-Extracted Knowledge Graphs

可靠的代码库图-RAG:基于AST的图与LLM提取的知识图谱

Manideep Reddy Chinthareddy

机构 * Software Engineer, Centerville, USA(美国辛斯维尔软件工程师)

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.AI

AI总结 本文比较了基于AST的图谱和LLM提取的知识图谱在代码库中的检索性能,发现确定性AST图谱在索引成本和多跳推理方面更具优势。

Comments 46 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06400 2026-01-13 cs.CL 79%

MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan

MITRA:一种大规模并行语料库和多语言预训练语言模型,用于机器翻译和语义检索(巴利语、梵语、佛教汉语和藏语)

Sebastian Nehrdich, Kurt Keutzer

机构 * Center for Integrated Japanese Studies, Tohoku University(东京东京大学综合日语研究机构) University of California, Berkeley(加州大学伯克利分校) Berkeley Artificial Intelligence Research (BAIR)(伯克利人工智能研究(BAIR))

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 MITRA框架通过大规模并行语料库和预训练模型,实现了对梵语、巴利语、佛教汉语和藏语的机器翻译和语义检索,达到英语翻译的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04890 2026-01-09 cs.LG 79%

Learnable Multipliers: Freeing the Scale of Language Model Matrix Layers

可学习的乘数:解放语言模型矩阵层的尺度

Maksim Velikanov, Ilyas Chahed, Jingwei Zuo, Dhia Eddine Rhaiem, Younes Belkada, Hakim Hacid

机构 * Falcon LLM Team(Falcon 语言模型团队)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.LG

AI总结 本研究提出可学习乘数方法,通过引入可学习的行和列乘数来优化语言模型矩阵层的尺度,提升性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10069 2026-01-07 cs.AI cs.MM 79%

SyncLipMAE: Contrastive Masked Pretraining for Audio-Visual Talking-Face Representation

SyncLipMAE:用于音频视觉谈话面部表示的对比掩码预训练

Zeyu Ling, Xiaodong Gu, Jiangnan Tang, Changqing Zou

机构 * State Key Laboratory of CAD&CG(CAD与CG国家重点实验室) ByteDance(字节跳动)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 SyncLipMAE通过对比掩码预训练实现音频视觉谈话面部的同步感知表示,适用于多下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24231 2026-01-01 cs.CV cs.LG 79%

MotivNet: Evolving Meta-Sapiens into an Emotionally Intelligent Foundation Model

MotivNet: 将元人进化为情感智能基础模型

Rahul Medicharla, Alper Yilmaz

机构 * Photogrammetric Computer Vision Lab(摄影测量计算机视觉实验室) The Ohio State University(俄亥俄州立大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 MotivNet通过使用元人作为骨干网络,在不进行跨领域训练的情况下实现了面部情绪识别的泛化能力,验证了其作为Sapiens下游任务的有效性。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏