arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2605.27734 2026-05-28 cs.LG 70%

Learn from your own latents and not from tokens: A sample-complexity theory

从自身潜在表示而非token学习:样本复杂度理论

Daniel J. Korchinski, Alessandro Favero, Matthieu Wyart

机构 * Institute of Physics(物理研究所) University of Cambridge(剑桥大学) Johns Hopkins University(约翰霍普金斯大学) EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过概率上下文无关语法数据,证明潜在预测方法在样本复杂度上相比token级SSL具有指数级优势,并分析了多尺度层次结构的必要性。

Comments 10 pages, 5 figures in main. 28 pages, 14 figures, 1 table in all

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10085 2026-05-28 cs.CL 70%

CALM-IT: Generating Realistic Long-Form Motivational Interviewing Dialogues with Dual-Actor Conversational Dynamics Tracking

CALM-IT: 通过双角色对话动态追踪生成逼真的长形式动机访谈对话

Viet Cuong Nguyen, Nhi Yen Nguyen, Kristin A. Candan, Mary Conlon, Vanessa Rumie, Kristen Risola, Michael L. Birnbaum, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院) Northwell Health(北well健康) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出CALM-IT框架,通过显式建模客户与咨询师状态的演变来生成和评估长形式动机访谈对话,在8,232个合成对话语料上优于基线方法,尤其在MITI 4.2全局评分和客户接受率上表现最佳。

Comments 53 pages, in submission to EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26935 2026-05-27 cs.CL 70%

DunbaaBERT: From Sacrifice to Semantics

DunbaaBERT: 从牺牲到语义

Iffat Maab, Waleed Jamil, Raphael Schmitt

机构 * Research and Development Center for Large Language Models (LLMC), National Institute of Informatics, Tokyo(大型语言模型研发中心(LLMC),信息研究所,东京) School of Computation, Information and Technology, Technical University of Munich, Germany(计算、信息与技术学院,慕尼黑技术大学,德国) Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg, Germany(临床医学系,弗赖堡大学医学院及医学中心,德国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DunbaaBERT,一种从零训练的乌尔都语RoBERTa-base模型族,通过不同词汇表大小在17GB语料上预训练,在多项下游任务中达到与强多语言基线相当的性能,并发现较大词汇表并不持续提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05141 2026-05-27 cs.CL 70%

To model human linguistic prediction, make LLMs less superhuman

为了模拟人类语言预测,让大语言模型不那么超人类

Byung-Doh Oh, Tal Linzen

机构 * Division of Linguistics and Multilingual Studies, Nanyang Technological University, Singapore(南洋理工大学语言学与多语言研究系,新加坡) Department of Linguistics, New York University, New York, USA(纽约大学语言学系,纽约,美国) Center for Data Science, New York University, New York, USA(纽约大学数据科学中心,纽约,美国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文指出大语言模型因超人类预测能力而无法解释人类阅读行为,主张通过模拟人类记忆来改进模型,并提出新实验方向。

Comments Accepted to Trends in Cognitive Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24907 2026-05-26 cs.CL 70%

Overview of the PsyDefDetect Shared Task at BioNLP 2026: Detecting Levels of Psychological Defense Mechanisms in Supportive Conversations

PsyDefDetect 共享任务概述:在支持性对话中检测心理防御机制水平

Hongbin Na, Zimu Wang, Zhaoming Chen, Yining Hua, Rena Gao, Kailai Yang, Ling Chen, Wei Wang, Shaoxiong Ji, John Torous, Sophia Ananiadou

机构 * University of Technology Sydney(技术大学悉尼) Xi’an Jiaotong-Liverpool University(西安交通大学-利物浦大学) University of Utah(犹他大学) Harvard University(哈佛大学) The University of Melbourne(墨尔本大学) The University of Manchester(曼彻斯特大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文介绍了与 BioNLP@ACL 2026 合办的 PsyDefDetect 共享任务,该任务基于临床验证的 DMRS 框架,要求系统将求助者话语分类为九个类别,最佳系统达到 0.420 的宏 F1 分数,但仍存在改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23893 2026-05-25 cs.LG 70%

Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models

Complete-muE:MoE模型的最优超参数迁移与缩放

Hongwu Peng, Ohiremen Dibua, Yuanjun Xiong, Yifan Gong, Jianming Zhang, Yan Kang

机构 * Adobe Research(Adobe研究院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出Complete-muE框架,通过双桥系统实现稠密FFN与混合专家(MoE)架构间的超参数迁移,支持MoE模型在激活专家数、总容量、粒度等方面的缩放,并验证了“一次调优稠密模型,迁移至所有MoE配置”的实用策略。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23885 2026-05-25 cs.CL 70%

Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions

数据约束下的多语言知识迁移:通过词汇干预

Anastasiia Sedova, Natalie Schluter, Skyler Seto, Maartje ter Hoeve

机构 * Apple(苹果公司)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出LINK方法,利用双语词汇对预训练数据中的高资源语言部分进行词汇替换,无需额外模型训练或大量平行数据,即可有效提升低资源语言的知识迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23721 2026-05-25 cs.CL 70%

Is a Document Educational or Just Wikipedia-Style? -- Pitfalls of Classifier-Based Quality Filtering

文档是教育性的还是维基风格的?——基于分类器的质量过滤的陷阱

Mateusz Klimaszewski, Piotr Andruszkiewicz

机构 * Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文揭示了基于分类器的质量过滤方法中一个关键漏洞:简单的维基风格重格式化操作可显著改变模型的质量评估,使低质量内容通过过滤阈值,并量化了FineWeb-Edu CQF模型约7%文档的过滤决策反转。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20545 2026-05-21 stat.ML cs.LG 70%

Sample Complexity of Transfer Learning: An Optimal Transport Approach

迁移学习的样本复杂性:一种最优传输方法

Haoyang Cao, Xin Guo, Wenpin Tang, Guan Wang

机构 * Tsinghua-Berkeley Shenzhen Institute(清华大学-伯克利深圳研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过最优传输视角分析迁移学习的样本效率,发现当数据维度d大于3时,迁移学习的样本复杂性为O(m^{-(α+1)/d}),优于直接学习的O(m^{-p/d}),其中α表示数据分布的光滑度,p表示最优目标模型的光滑度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08702 2026-05-19 cs.CL 70%

Scaling Laws for Code: A More Data-Hungry Regime

代码的缩放规律:一个更数据渴求的阶段

Xianzhen Luo, Wenzhen Zheng, Qingfu Zhu, Rongyi Zhang, Houyi Li, Siming Huang, YuanTao Fan, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Fudan University(复旦大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了代码的缩放规律,通过大规模实验发现Farseer定律在准确性上更优,代码模型在模型大小上表现良好,但需要更高的数据与参数比,且在代码-自然语言混合数据中,自然语言在资源受限场景下有益,但在更高计算预算下成为负担。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17180 2026-05-19 cs.LG math.OC stat.ML 70%

The Geometry of Projection Heads: Conditioning, Invariance, and Collapse

投影头的几何学:条件性、不变性与坍缩

Faris Chaudhry

机构 * Department of Computing, Imperial College London, United Kingdom(伦敦帝国学院计算机系,英国)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种投影头的几何理论,通过将投影头建模为可训练的黎曼度量来研究自监督学习中的条件性、不变性和坍缩问题,揭示了投影头在不同深度下的适应能力和稳定性。

Comments Accepted at ICML 2026. 29 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15465 2026-05-18 cs.LG eess.SP 70%

Toward World Modeling of Physiological Signals with Chaos-Theoretic Balancing and Latent Dynamics

向生理信号的世界建模迈进:基于混沌理论的平衡与潜在动态

Yunfei Luo, Xi Chen, Yuliang Chen, Lanshuang Zhang, Md Mofijul Islam, Siwei Zhao, Peter Kotanko, Subhasis Dasgupta, Andrew Campbell, Rakesh Malhotra, Tauhidur Rahman

机构 * University of California San Diego(加州大学圣地亚哥分校) Dartmouth College(达特茅斯学院) Amazon Web Services(亚马逊网络服务) Sanderling Renal Services(Sanderling 肾脏服务) Renal Research Institute(肾脏研究研究所) Icahn School of Medicine at Mount Sinai(辛克尔医学院(Mount Sinai))

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NormWear-2模型,通过将多变量生理信号与临床干预变量编码到共享潜在空间,结合先验知识推理与非参数潜在状态转移适应,实现多时间尺度的预测。混沌理论平衡动态制度多样性提升了表示鲁棒性,且在不同临床场景下表现优异。

Comments NormWear Collection: https://huggingface.co/collections/mosaic-laboratory/normwear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14069 2026-05-15 cs.LG 70%

SurF: A Generative Model for Multivariate Irregular Time Series Forecasting

SurF:一种用于多变量不规则时间序列生成模型

Mohammad R. Rezaei, Tejas Balaji, Rahul G. Krishnan

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 SurF提出了一种生成模型,利用时间重标定定理将事件序列转换为独立同分布的单位速率指数噪声,支持跨异构事件流数据集训练,并在六个真实世界基准上取得最佳时间RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29475 2026-05-14 cs.LG 70%

Survival In-Context: Amortized Bayesian Survival Analysis via Prior-Fitted Networks

生存上下文:通过先验适应网络实现的 amortized 概率生存分析

Dmitrii Seletkov, Paul Hager, Georgios Kaissis, Rickmer Braren, Daniel Rueckert, Raphael Rehms

机构 * Institute of Diagnostic and Interventional Radiology, Technical University of Munich, Germany(慕尼黑技术大学诊断与介入放射学研究所,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich, Germany(慕尼黑技术大学医疗人工智能与医学研究所,德国) Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(波茨坦大学数字工程哈索普兰特纳研究所,德国) University Hospital Hamburg-Eppendorf, Germany(汉堡-埃彭多夫大学医院,德国) Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算系,英国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Survival In-Context模型,通过先验适应网络实现生存分析,无需任务特定训练即可进行个性化生存预测,实验证明其在小中等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13262 2026-05-14 cs.LG q-bio.QM 70%

Chem-GMNet: A Sphere-Native Geometric Transformer for Molecular Property Prediction

Chem-GMNet:一种分子性质预测的球形本征几何变换器

Deepak Warrier, Raja Sekhar Pappala

机构 * MSTACK AI

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Chem-GMNet,一种基于球形本征的几何变换器,通过改进的模块设计在分子性质预测任务中取得优异表现,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13055 2026-05-14 cs.CL cs.CY 70%

The Cost of Perfect English: Pragmatic Flattening and the Erasure of Authorial Voice in L2 Writing Supported by GenAI

完美英语的成本:生成AI支持的二语写作中的语用扁平化与作者声音的消失

Ao Liu, Shanhua Zhu

机构 * School of Foreign Languages, Southeast University(东南大学外国语言学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨生成AI对二语写作的影响,发现其导致语用扁平化和作者声音的消失,提出需通过批判性AI素养来保护多元语用多样性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12835 2026-05-14 cs.AI 70%

PROMETHEUS: Automating Deep Causal Research Integrating Text, Data and Models

PROMETHEUS:整合文本、数据和模型的深度因果研究自动化

Sridhar Mahadevan

机构 * Adobe Research and University of Massachusetts, Amherst(Adobe研究院和马萨诸塞大学阿默斯特分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PROMETHEUS通过整合文本、数据和模型构建因果地图,利用局部因果预测状态模型和区域限制图分析研究领域内的因果关系与证据矛盾。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07767 2026-05-13 cs.LG 70%

Taking the Road Less Scheduled with Adaptive Polyak Steps

走少计划之路:自适应Polyak步长

Dimitris Oikonomou, Matthew Buchholz, Yuen-Man Pun, Robert M. Gower, Nicolas Loizou

机构 * Johns Hopkins University(约翰霍普金斯大学) University of British Columbia(不列颠哥伦比亚大学) Australian National University(澳大利亚国立大学) Center for Computational Mathematics(计算数学中心) Flatiron Institute, Simons Foundation(Flatiron 机构,Simons 基金会)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出自适应Polyak步长的Schedule-Free SGD和Adam,通过迭代平均实现无调度优化,无需调优基础学习率,统一了标准与无调度Polyak方法,实验显示其在语言建模中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11691 2026-05-13 cs.LG 70%

Compositional Neural Operators for Multi-Dimensional Fluid Dynamics

组合神经算子用于多维流体动力学

Hamda Hmida, Hsiu-Wen Chang, Youssef Mesri

机构 * Mines Paris - PSL University, Centre for Material Forming (CEMEF)(巴黎矿学院-PSL大学,材料成形中心(CEMEF)) Mines Paris - PSL University, Centre for Robotics (CAOR)(巴黎矿学院-PSL大学,机器人中心(CAOR))

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出组合神经算子框架,通过分解复杂PDE为基础模块,提升流体动力学问题的求解效率与可解释性。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15529 2026-05-12 cs.AI 70%

LACE: Lattice Attention for Cross-thread Exploration

LACE:用于跨线探索的晶格注意力

Yang Li, Zirui Zhang, Yang Liu, Chengzhi Mao

机构 * Amazon AGI Labs(亚马逊人工通用智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LACE通过引入跨线注意力机制,使大语言模型在推理过程中实现协同合作,提升推理准确性达7个百分点。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09126 2026-05-12 cs.LG 70%

Cosine-Gated Adam-Decay: Drop-In Staleness-Aware Outer Optimization for Decoupled DiLoCo

余弦门控Adam衰减:一种用于解耦DiLoCo的掉入式滞后期感知外优化

Vatsal Shah, Jiahao Sun

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出CGAD,一种基于余弦门控的Adam衰减算法,通过衰减因子和余弦门控机制提升异步DiLoCo系统的稳定性,实验证明其在不同规模模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08383 2026-05-12 cs.CL 70%

Change My View? The Dynamics of Persuasion and Polarization in Online Discourse

改变观点?在线讨论中说服与极化的动态

David Freeborn, Malihe Alikani, Anthony Sicilia

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过分析Reddit的ChangeMyView讨论,探讨说服与极化动态,发现让步与共情策略促进观点改变,而直接反驳等策略则抑制观点改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08299 2026-05-12 cs.SE cs.AI 70%

Do not copy and paste! Rewriting strategies for code retrieval

不要复制粘贴!代码检索的重写策略

Andrea Gurioli, Federico Pennino, Maurizio Gabbrielli

机构 * DISI University of Bologna(博洛尼亚大学DISI学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了三种重写策略在不同检索场景下的效果,发现全自然语言重写在在线检索中表现最佳,但离线检索效果下降明显,提出Delta H作为评估重写收益的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07454 2026-05-11 cs.CL 70%

GRaSp: Automatic Example Optimization for In-Context Learning in Low-Data Tasks

GRaSp:用于低数据任务中上下文学习的自动示例优化

Simen Bihaug-Frøyland, Henrik Brådland

机构 * Centre for Artificial Intelligence Research, University of Agder(人工智能研究中心,阿格德大学) School of Computing and Information, University of Pittsburgh(计算与信息学院,匹兹堡大学) Norkart AS(Norkart公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GRaSp提出一个三阶段框架,通过生成合成候选集、聚类降维和遗传算法优化,提升上下文学习任务的性能,尤其在金融命名实体识别任务中表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06990 2026-05-11 cs.CV cs.LG 70%

TRAJGANR: Trajectory-Centric Urban Multimodal Learning via Geospatially Aligned Neural Representations

TRAJGANR: 通过地理对齐的神经表示进行轨迹导向的城市多模态学习

Maria Despoina Siampou, Gengchen Mai, Ni Lao, Jinmeng Rao, Neha Arora, Cyrus Shahabi, Shushman Choudhury

机构 * Google Research, Mountain View, CA(谷歌研究,山景城,加利福尼亚州) Google LLC, Mountain View, CA(谷歌公司,山景城,加利福尼亚州) Dept. of Computer Science, University of Southern California, Los Angeles, CA(计算机科学系,南加州大学,洛杉矶,加利福尼亚州) SEAI Lab, Dept. of Geography and the Environment, The University of Texas at Austin, Austin, TX(SEAI实验室,地理与环境系,德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 TRAJGANR提出一种新的多模态自监督学习框架,通过将连续移动模式与静态位置观察对齐,提升城市理解和移动任务的性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05267 2026-05-08 cs.SE cs.AI 70%

Bridging Generation and Training: A Systematic Review of Quality Issues in LLMs for Code

连接生成与训练:LLMs用于代码的品质问题系统综述

Kaifeng He, Xiaojun Zhang, Peiliang Cai, Mingwei Liu, Yanlin Wang, Chong Wang, Kaifeng Huang, Bihuan Chen, Xin Peng, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文系统综述114项研究,探讨训练数据质量如何影响代码生成质量,建立统一分类体系,提出18种传播机制,并总结检测与缓解技术,指出质量保障正从事后过滤转向数据驱动的闭环修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16281 2026-05-08 cs.LG q-bio.NC 70%

Laya: A LeJEPA Approach to EEG via Latent Prediction over Reconstruction

Laya: 一种基于联合嵌入预测架构的EEG方法

Saarang Panchavati, Uddhav Panchavati, Hiroki Nariai, Corey Arnold, William Speier

机构 * Department of Medical Informatics(医学信息学系) UCLA(美国加利福尼亚大学洛杉矶分校) Department of Cognitive Science(认知科学系) UCSD(美国圣地亚哥大学) David Geffen School of Medicine(大卫·盖弗医学院) Mattel Children’s Hospital(马特尔儿童医院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Laya,一种基于LeJEPA的EEG基础模型,通过预测潜在表示而非信号重建,提升EEG表示的语义结构和临床准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01407 2026-05-05 cs.IR cs.CL 70%

The Pre-Training Study of Expanded-SPLADE Models on Web Document Titles

扩展SPLADE模型在网页文档标题上的预训练研究

Hiun Kim, Tae Kwan Lee, Taeryun Won

机构 * Naver(纳维尔)

专题命中 预训练与数据 :language model(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了不同预训练数据集和预训练选项对MLM预训练模型在检索微调中的影响,发现高检索效果模型多基于通用语料库并使用较高学习率,但检索成本和posting列表长度变异较大,且通用预训练数据集重复对检索效果影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00251 2026-05-04 cs.SD cs.CL eess.AS 70%

Alethia: A Foundational Encoder for Voice Deepfakes

Alethia:一种用于语音深度伪造的 foundational 编码器

Yi Zhu, Brahmi Dwivedi, Jayaram Raghuram, Surya Koppisetti

机构 * Reality Defender Inc.

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出Alethia,一种新的基础音频编码器,结合瓶颈掩码嵌入预测与基于流匹配的光谱图重建,显著优于现有语音基础模型,在真实世界扰动和零样本泛化方面表现更优。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24541 2026-05-04 cs.CL 70%

Open Korean Historical Corpus: A Millennia-Scale Diachronic Collection of Public Domain Texts

开放的韩国历史语料库:一个跨越千年的历时性公共领域文本集合

Seyoung Song, Nawon Kim, Songeun Chae, Kiwoong Park, Jiho Jin, Haneul Yoo, Kyunghyun Cho, Alice Oh

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了一个涵盖1300年历史的韩国语料库,用于量化分析语言演变,包括韩文书写系统的变化及现代语言模型的改进。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏