arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2606.03817 2026-06-03 cs.CL 70%

Rethinking the Idiomaticity Decomposability Hypothesis: Evidence from Distributional Learning

重新思考习语可分解性假说:来自分布学习的证据

Maggie Mi, Golzar Atefi, Atsuki Yamaguchi, Felix Gers, Aline Villavicencio, Nafise Sadat Moosavi

机构 * University of Sheffield(谢菲尔德大学) Berliner Hochschule für Technik (BHT)(柏林技术大学(BHT)) University of Exeter(埃克塞特大学) Federal University of Rio Grande do Norte, Brazil(巴西北里奥格兰德联邦大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文利用上下文语言模型作为受控分布学习者,研究习语可分解性(构成意义对整体比喻意义的贡献程度)与句法灵活性的关系,发现模型导出的可分解性与人类判断弱相关,与句法灵活性呈微小但一致的负相关,且习语表征的稳定化受惊讶度、可分解性和频率共同影响,其中可分解性具有最强的训练依赖效应。

Comments ACL 2026 Main - long paper (9 pages + Appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02739 2026-06-03 cs.SD cs.AI eess.AS 70%

EntangleCodec: A Unified Discrete Audio Tokenizer via Semantic-Acoustic Entanglement

EntangleCodec:通过语义-声学纠缠的统一离散音频分词器

Hui Li, Yangfan Gao, Junlin Shang, Changhao Jiang, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出EntangleCodec,一种通过将音频与丰富标题对齐学习语义-声学联合表示的统一离散音频分词器,在紧凑令牌流中捕获语言内容、说话人身份、情感、韵律和声学场景,并通过流匹配扩散解码器实现高质量重建,在音频理解和生成任务上均取得领先性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08707 2026-06-03 q-bio.BM cs.LG 70%

Tokenizing Loops of Antibodies

抗体环的标记化

Ada Fang, Robert G. Alberstein, Simon Kelow, Frédéric A. Dreyer

机构 * Harvard University(哈佛大学) Prescient Design, Genentech(Prescient Design,基因泰克)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 提出Igloo多模态抗体环标记器,通过对比学习编码主链二面角和序列,高效检索相似环结构,提升H3环识别性能5.9%,并集成到蛋白质语言模型中改善抗体设计。

Comments 21 pages, 7 figures, 10 tables, code available at https://github.com/prescient-design/igloo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01906 2026-06-02 cs.AI 70%

Bayesian Spectral Emotion Transition Discovery from Multi-Annotator Disagreement

贝叶斯谱情感转移发现:来自多标注者分歧

Keito Inoshita, Takato Ueno

机构 * Keio University(庆应大学) National Institute of Advanced Industrial Science and Technology(国家工业科学与技术研究院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出贝叶斯谱情感转移发现(BSETD)两阶段框架,从多标注者软标签中挖掘情感转移结构,并通过谱分解分离惯性与传染成分,在EmotionLines数据集上验证了与心理学理论的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01289 2026-06-02 cs.LG 70%

Feature to Dynamics: Feature-space to Autoregression strategy for Zero-shot Time Series Forecasting

从特征到动态:面向零样本时间序列预测的特征空间到自回归策略

Yifan Wu, Junjie Wu, Kai Wu, Xiaoyu Zhang, Jian Lou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出FSA框架,通过从可解释特征空间到自回归策略空间的映射,在零样本单变量时间序列预测中引入显式归纳偏置,分离全局趋势、周期成分和局部动态,以更少数据假设实现跨域泛化,在受控实验中优于Transformer架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02277 2026-06-02 cs.CL 70%

CECOR: Correction-oriented synthetic data construction for factual error correction

CECOR:面向事实错误纠正的修正导向合成数据构建

Lei Zhu, Xiaobao Wang, Jianbiao Yang, Chenyang Wang, Dongxiao He, Longbiao Wang, Jianwu Dang

机构 * Tianjin University(天津大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出CECoR框架,通过分解与注入范式合成高质量训练数据,结合两阶段学习策略,有效提升多跳事实错误纠正的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29948 2026-06-02 cs.SD cs.AI eess.AS 70%

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

HoliTok: 一种具有鲁棒的双重语音生成与理解能力的连续整体式分词

Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(X-LANCE实验室,计算机科学学院,上海交通大学,中国) hi lab, Xiaohongshu Inc, China(hi实验室,小红书公司,中国)

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 提出HoliTok连续整体式语音分词模型,通过渐进训练策略联合保持信号保真度、融入语义信息并维持潜在可学习性,基于该分词构建统一AR+DiT模型实现语音合成与识别,实验证明其在统一生成-理解架构中无需额外优化即可鲁棒运行。

Comments 14 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03309 2026-06-02 cs.CV cs.AI 70%

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models

VLM4VLA:重新审视视觉-语言-动作模型中的视觉-语言模型

Jianke Zhang, Xiaoyu Chen, Qiuyue Wang, Mingsheng Li, Yanjiang Guo, Yucheng Hu, Jiajun Zhang, Shuai Bai, Junyang Lin, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Qwen Team, Alibaba Inc.(阿里巴巴公司Qwen团队)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文通过VLM4VLA最小适配管道,系统研究视觉-语言模型(VLM)的选择和能力如何影响下游视觉-语言-动作(VLA)策略性能,发现VLM通用能力无法预测下游任务表现,且视觉模块是性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31371 2026-06-01 cs.LG 70%

Softsign: Smooth Sign in Your Optimizer For Better Parameter Heterogeneity Handling

Softsign: 优化器中的平滑符号函数以更好地处理参数异质性

Dmitrii Feoktistov, Timofey Belinsky, Andrey Veprikov, Amir Zainullin, Aleksandr Beznosikov

机构 * HSE University(莫斯科国立高等经济学院) Yandex Research(Yandex研究院) BRAIn Lab(BRAIn实验室) SB AI Lab(SB人工智能实验室) Innopolis University(因诺波利斯大学)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出SoftSignum和SoftMuon优化器,通过温度控制的软符号变换替代硬符号映射,结合自适应分位数温度调度,解决基于符号的优化器在参数异质性和终端收敛上的问题,并在随机非凸设置下证明收敛性,实验表明在多种深度学习任务(包括大语言模型预训练)中优于硬符号优化器和AdamW。

Comments 9 pages, 3 tables, 4 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 70%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27881 2026-06-01 cs.CL 70%

Retrieval, Reward, and Training Protocols: What Matters in Training Search Agents?

检索、奖励与训练协议:训练搜索代理的关键因素是什么?

Yibo Zhao, Zichen Ding, Jiayi Wu, Zun Wang, Xiang Li

机构 * School of Data Science and Engineering, East China Normal University(东华大学数据科学与工程学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过控制实验,系统研究了检索语料库、奖励设计和训练协议三个维度对搜索代理训练的影响,发现纠正语料覆盖问题比算法差异更有效,简单的基于结果的奖励方法在多数设置下表现优异,并提出了实用训练指南。

Comments 18pages, 4 figures, and 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29765 2026-05-29 cs.LG 70%

MMTM: Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion

MMTM: 基于相似性门控融合的长视频三模态主题建模

Ali Abusaleh, Bhuvanesh Verma, Alexander Mehler

机构 * Text Technology Lab (TTLab), Goethe University Frankfurt(文本技术实验室(TTLab),法兰克福歌德大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出MMTM模块化流水线,通过相似性门控融合集成语音识别、音频和视觉嵌入及BERTopic聚类,在长视频主题发现中显著提升主题质量。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13986 2026-05-29 cs.LG stat.ML 70%

TabPFN-3: Technical Report

TabPFN-3: 技术报告

Léo Grinsztajn, Klemens Flöge, Oscar Key, Felix Birkel, Philipp Jund, Brendan Roof, Mihir Manium, Shi Bin Hoo, Magnus Bühler, Anurag Garg, Dominik Safaric, Jake Robertson, Benjamin Jäger, Simone Alessi, Adrian Hayler, Vladyslav Moroshan, Lennart Purucker, Philipp Singer, Alan Arazi, Julien Siems, Jan Hendrik Metzen, Georg Grab, Nick Erickson, Siyuan Guo, Eliott Kalfon, Simon Bing, David Salinas, Clara Cornu, Lilly Charlotte Wehrhahn, Diana Kriuchkova, Kursat Kaya, Lydia Sidhoum, Marie Salmon, Jerry Chen, Madelon Hulsebos, Yann LeCun, Samuel Müller, Bernhard Schölkopf, Sauraj Gambhir, Noah Hollmann, Frank Hutter

机构 * Prior Labs

专题命中 预训练与数据 :LLM(abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 本文提出TabPFN-3,通过扩展训练数据和优化推理,在表格数据上实现最先进性能,并支持时间序列、关系数据和表格文本数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18395 2026-05-29 cs.CL 70%

Do not be greedy, Think Twice: Sampling and Selection for Document-level Information Extraction

不要贪婪,三思而后行:文档级信息抽取的采样与选择

Mikel Zubillaga, Oscar Sainz, Oier Lopez de Lacalle, Eneko Agirre

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(希茨中心 - Ixa,巴斯克国家大学UPV/EHU)

专题命中 预训练与数据 :LLM(abstract);prompting(abstract);分类 cs.CL

AI总结 提出ThinkTwice框架,通过采样生成多个候选模板并选择最优,利用无监督一致性和有监督奖励模型,在文档级信息抽取中超越贪婪解码方法。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28228 2026-05-28 cs.CL 70%

When Seekers Are Hard to Help: Evaluating Emotional Support Dialogue Systems in Worst-Case Interactions

当求助者难以帮助:评估情感支持对话系统在最坏情况交互中的表现

Jiajie Yang, Yangchun Li, Guanyi Chen, Rui Fan, Xin Bai, Tingting He

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北人工智能与智能学习省级重点实验室) National Language Resources Monitoring and Research Center for Network Media(网络媒体语言资源监测与研究中心) School of Computer Science, Central China Normal University(华中师范大学计算机学院) Faculty of Artificial Intelligence in Education, Central China Normal University(华中师范大学教育人工智能学院) School of Chinese Language and Literature, Central China Normal University(华中师范大学中文语言文学学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过专家模拟和提出最坏情况评估框架,发现现有情感支持对话系统在面对低参与度、抗拒等困难求助者时性能显著下降,并验证了最坏情况模拟数据可提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28074 2026-05-28 cs.CR cs.CL cs.IR 70%

SilentRetrieval: Hijacking Retrieval-Augmented Generation via Semantically-Preserving Adversarial Data Poisoning

SilentRetrieval:通过语义保持的对抗性数据投毒劫持检索增强生成

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出SilentRetrieval两阶段数据投毒攻击,通过协调束搜索和上下文自适应触发生成,在保持文档流畅性的同时实现高检索命中率和攻击成功率,并评估了防御措施的有效性。

Comments 12 pages, 4 figures, KDD '26 camera-ready version

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27734 2026-05-28 cs.LG 70%

Learn from your own latents and not from tokens: A sample-complexity theory

从自身潜在表示而非token学习:样本复杂度理论

Daniel J. Korchinski, Alessandro Favero, Matthieu Wyart

机构 * Institute of Physics(物理研究所) University of Cambridge(剑桥大学) Johns Hopkins University(约翰霍普金斯大学) EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过概率上下文无关语法数据,证明潜在预测方法在样本复杂度上相比token级SSL具有指数级优势,并分析了多尺度层次结构的必要性。

Comments 10 pages, 5 figures in main. 28 pages, 14 figures, 1 table in all

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10085 2026-05-28 cs.CL 70%

CALM-IT: Generating Realistic Long-Form Motivational Interviewing Dialogues with Dual-Actor Conversational Dynamics Tracking

CALM-IT: 通过双角色对话动态追踪生成逼真的长形式动机访谈对话

Viet Cuong Nguyen, Nhi Yen Nguyen, Kristin A. Candan, Mary Conlon, Vanessa Rumie, Kristen Risola, Michael L. Birnbaum, Munmun De Choudhury

机构 * Georgia Institute of Technology(佐治亚理工学院) Northwell Health(北well健康) Columbia University(哥伦比亚大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出CALM-IT框架,通过显式建模客户与咨询师状态的演变来生成和评估长形式动机访谈对话,在8,232个合成对话语料上优于基线方法,尤其在MITI 4.2全局评分和客户接受率上表现最佳。

Comments 53 pages, in submission to EMNLP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26935 2026-05-27 cs.CL 70%

DunbaaBERT: From Sacrifice to Semantics

DunbaaBERT: 从牺牲到语义

Iffat Maab, Waleed Jamil, Raphael Schmitt

机构 * Research and Development Center for Large Language Models (LLMC), National Institute of Informatics, Tokyo(大型语言模型研发中心(LLMC),信息研究所,东京) School of Computation, Information and Technology, Technical University of Munich, Germany(计算、信息与技术学院,慕尼黑技术大学,德国) Institute of General Practice, Faculty of Medicine and Medical Center, University of Freiburg, Germany(临床医学系,弗赖堡大学医学院及医学中心,德国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DunbaaBERT,一种从零训练的乌尔都语RoBERTa-base模型族,通过不同词汇表大小在17GB语料上预训练,在多项下游任务中达到与强多语言基线相当的性能,并发现较大词汇表并不持续提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05141 2026-05-27 cs.CL 70%

To model human linguistic prediction, make LLMs less superhuman

为了模拟人类语言预测,让大语言模型不那么超人类

Byung-Doh Oh, Tal Linzen

机构 * Division of Linguistics and Multilingual Studies, Nanyang Technological University, Singapore(南洋理工大学语言学与多语言研究系,新加坡) Department of Linguistics, New York University, New York, USA(纽约大学语言学系,纽约,美国) Center for Data Science, New York University, New York, USA(纽约大学数据科学中心,纽约,美国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文指出大语言模型因超人类预测能力而无法解释人类阅读行为,主张通过模拟人类记忆来改进模型,并提出新实验方向。

Comments Accepted to Trends in Cognitive Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24907 2026-05-26 cs.CL 70%

Overview of the PsyDefDetect Shared Task at BioNLP 2026: Detecting Levels of Psychological Defense Mechanisms in Supportive Conversations

PsyDefDetect 共享任务概述:在支持性对话中检测心理防御机制水平

Hongbin Na, Zimu Wang, Zhaoming Chen, Yining Hua, Rena Gao, Kailai Yang, Ling Chen, Wei Wang, Shaoxiong Ji, John Torous, Sophia Ananiadou

机构 * University of Technology Sydney(技术大学悉尼) Xi’an Jiaotong-Liverpool University(西安交通大学-利物浦大学) University of Utah(犹他大学) Harvard University(哈佛大学) The University of Melbourne(墨尔本大学) The University of Manchester(曼彻斯特大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文介绍了与 BioNLP@ACL 2026 合办的 PsyDefDetect 共享任务,该任务基于临床验证的 DMRS 框架,要求系统将求助者话语分类为九个类别,最佳系统达到 0.420 的宏 F1 分数,但仍存在改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23893 2026-05-25 cs.LG 70%

Complete-muE: Optimal Hyperparameter Transfer and Scaling for MoE Models

Complete-muE:MoE模型的最优超参数迁移与缩放

Hongwu Peng, Ohiremen Dibua, Yuanjun Xiong, Yifan Gong, Jianming Zhang, Yan Kang

机构 * Adobe Research(Adobe研究院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出Complete-muE框架,通过双桥系统实现稠密FFN与混合专家(MoE)架构间的超参数迁移,支持MoE模型在激活专家数、总容量、粒度等方面的缩放,并验证了“一次调优稠密模型,迁移至所有MoE配置”的实用策略。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23885 2026-05-25 cs.CL 70%

Multilingual Knowledge Transfer under Data Constraints via Lexical Interventions

数据约束下的多语言知识迁移:通过词汇干预

Anastasiia Sedova, Natalie Schluter, Skyler Seto, Maartje ter Hoeve

机构 * Apple(苹果公司)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出LINK方法,利用双语词汇对预训练数据中的高资源语言部分进行词汇替换,无需额外模型训练或大量平行数据,即可有效提升低资源语言的知识迁移效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23721 2026-05-25 cs.CL 70%

Is a Document Educational or Just Wikipedia-Style? -- Pitfalls of Classifier-Based Quality Filtering

文档是教育性的还是维基风格的?——基于分类器的质量过滤的陷阱

Mateusz Klimaszewski, Piotr Andruszkiewicz

机构 * Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文揭示了基于分类器的质量过滤方法中一个关键漏洞:简单的维基风格重格式化操作可显著改变模型的质量评估,使低质量内容通过过滤阈值,并量化了FineWeb-Edu CQF模型约7%文档的过滤决策反转。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20545 2026-05-21 stat.ML cs.LG 70%

Sample Complexity of Transfer Learning: An Optimal Transport Approach

迁移学习的样本复杂性:一种最优传输方法

Haoyang Cao, Xin Guo, Wenpin Tang, Guan Wang

机构 * Tsinghua-Berkeley Shenzhen Institute(清华大学-伯克利深圳研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过最优传输视角分析迁移学习的样本效率,发现当数据维度d大于3时,迁移学习的样本复杂性为O(m^{-(α+1)/d}),优于直接学习的O(m^{-p/d}),其中α表示数据分布的光滑度,p表示最优目标模型的光滑度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08702 2026-05-19 cs.CL 70%

Scaling Laws for Code: A More Data-Hungry Regime

代码的缩放规律:一个更数据渴求的阶段

Xianzhen Luo, Wenzhen Zheng, Qingfu Zhu, Rongyi Zhang, Houyi Li, Siming Huang, YuanTao Fan, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Chinese Academy of Sciences(中国科学院) Fudan University(复旦大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了代码的缩放规律,通过大规模实验发现Farseer定律在准确性上更优,代码模型在模型大小上表现良好,但需要更高的数据与参数比,且在代码-自然语言混合数据中,自然语言在资源受限场景下有益,但在更高计算预算下成为负担。

Comments Accepted by ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17180 2026-05-19 cs.LG math.OC stat.ML 70%

The Geometry of Projection Heads: Conditioning, Invariance, and Collapse

投影头的几何学:条件性、不变性与坍缩

Faris Chaudhry

机构 * Department of Computing, Imperial College London, United Kingdom(伦敦帝国学院计算机系,英国)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种投影头的几何理论,通过将投影头建模为可训练的黎曼度量来研究自监督学习中的条件性、不变性和坍缩问题,揭示了投影头在不同深度下的适应能力和稳定性。

Comments Accepted at ICML 2026. 29 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15465 2026-05-18 cs.LG eess.SP 70%

Toward World Modeling of Physiological Signals with Chaos-Theoretic Balancing and Latent Dynamics

向生理信号的世界建模迈进:基于混沌理论的平衡与潜在动态

Yunfei Luo, Xi Chen, Yuliang Chen, Lanshuang Zhang, Md Mofijul Islam, Siwei Zhao, Peter Kotanko, Subhasis Dasgupta, Andrew Campbell, Rakesh Malhotra, Tauhidur Rahman

机构 * University of California San Diego(加州大学圣地亚哥分校) Dartmouth College(达特茅斯学院) Amazon Web Services(亚马逊网络服务) Sanderling Renal Services(Sanderling 肾脏服务) Renal Research Institute(肾脏研究研究所) Icahn School of Medicine at Mount Sinai(辛克尔医学院(Mount Sinai))

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NormWear-2模型,通过将多变量生理信号与临床干预变量编码到共享潜在空间,结合先验知识推理与非参数潜在状态转移适应,实现多时间尺度的预测。混沌理论平衡动态制度多样性提升了表示鲁棒性,且在不同临床场景下表现优异。

Comments NormWear Collection: https://huggingface.co/collections/mosaic-laboratory/normwear

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14069 2026-05-15 cs.LG 70%

SurF: A Generative Model for Multivariate Irregular Time Series Forecasting

SurF:一种用于多变量不规则时间序列生成模型

Mohammad R. Rezaei, Tejas Balaji, Rahul G. Krishnan

机构 * Department of Computer Science(计算机科学系) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 SurF提出了一种生成模型,利用时间重标定定理将事件序列转换为独立同分布的单位速率指数噪声,支持跨异构事件流数据集训练,并在六个真实世界基准上取得最佳时间RMSE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29475 2026-05-14 cs.LG 70%

Survival In-Context: Amortized Bayesian Survival Analysis via Prior-Fitted Networks

生存上下文:通过先验适应网络实现的 amortized 概率生存分析

Dmitrii Seletkov, Paul Hager, Georgios Kaissis, Rickmer Braren, Daniel Rueckert, Raphael Rehms

机构 * Institute of Diagnostic and Interventional Radiology, Technical University of Munich, Germany(慕尼黑技术大学诊断与介入放射学研究所,德国) Chair for AI in Healthcare and Medicine, Technical University of Munich, Germany(慕尼黑技术大学医疗人工智能与医学研究所,德国) Hasso Plattner Institute for Digital Engineering, University of Potsdam, Germany(波茨坦大学数字工程哈索普兰特纳研究所,德国) University Hospital Hamburg-Eppendorf, Germany(汉堡-埃彭多夫大学医院,德国) Department of Computing, Imperial College London, UK(伦敦帝国理工学院计算系,英国) Munich Center for Machine Learning (MCML), Germany(慕尼黑机器学习中心(MCML),德国)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Survival In-Context模型,通过先验适应网络实现生存分析,无需任务特定训练即可进行个性化生存预测,实验证明其在小中等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏