arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2605.07483 2026-05-14 cs.LG cs.AI 62%

Does Your Neural Network Extrapolate? Feature Engineering as Identifiability Bias for OOD Generalization

你的神经网络能外推吗?特征工程作为对ODD泛化性的可识别性偏差

Leonel Aguilar, Jan Nagler, Christoph Hoelscher, Nino Antulov-Fantulin

机构 * Chair of Cognitive Science, ETH Zürich(认知科学教授职位,苏黎世联邦理工学院) Centre for Human and Machine Intelligence, Frankfurt School(人机智能中心,法兰克福学校) Aisot Technologies AG, D-GESS, ETH Zürich(Aisot技术公司,D-GESS,苏黎世联邦理工学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨神经网络在面对分布外数据时的外推能力,指出特征工程对可识别性偏差的影响,通过实例展示正确特征的重要性及模型类表达目标的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12049 2026-05-13 cs.LG cs.AI cs.IT cs.NE math.IT 62%

Scaling Laws and Tradeoffs in Recurrent Networks of Expressive Neurons

在表达性神经元的递归网络中缩放规律与权衡

Aaron Spieler, Georg Martius, Anna Levina

机构 * University of Tübingen, Germany(图宾根大学,德国) Max Planck Institute for Biological Cybernetics, Tübingen, Germany(生物感知研究所,图宾根,德国) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统研究所,图宾根,德国)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在固定参数预算下,递归网络中神经元数量、每单位有效复杂度和连接度的最优分配问题,通过ELM网络验证了复杂度与连接度的权衡关系,并提出了信息论模型解释其结果。

Comments 25 pages, 21 figures, 3 tables, including derivations. Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11114 2026-05-13 cs.LG cs.AI stat.ML 62%

In-Context Multi-Objective Optimization

上下文多目标优化

Xinyu Zhang, Conor Hassan, Julien Martinelli, Daolang Huang, Samuel Kaski

机构 * Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 TAMO通过Transformer架构实现多目标黑盒优化,无需重新训练即可在不同任务间转移,显著提升优化效率并保持帕累托前沿质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08322 2026-05-13 cs.LG cs.AI 62%

SDG-MoE: Signed Debate Graph Mixture-of-Experts

SDG-MoE:带符号辩论图混合专家

Stepan Kulibaba, Kirill Labzin, Artem Dzhalilov, Roman Pakhomov, Oleg Svidchenko, Alexander Gasnikov, Aleksei Shpilman

机构 * Innopolis University(因诺波利斯大学) Sirius University(西里乌斯大学) HSE University(俄罗斯高等经济大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 SDG-MoE通过引入轻量级迭代辩论步骤提升混合专家模型性能,通过支持图和批评图捕获专家间相互影响,结合分歧门控机制保持专业性,实验显示在预训练任务中表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08902 2026-05-13 cs.LG cs.AI 62%

Intention-Conditioned Flow Occupancy Models

意图条件流占用模型

Chongyi Zheng, Seohong Park, Sergey Levine, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出意图条件流占用模型(InFOM),通过引入用户意图的隐变量,提升模型对长期依赖的建模能力,在36个状态基和4个图像基基准任务中实现回报提升1.8倍和成功率提升36%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19914 2026-05-12 cs.CL cs.AI cs.SE 62%

Simulating Complex Multi-Turn Tool Calling Interactions in Stateless Execution Environments

在无状态执行环境中模拟复杂多轮工具调用交互

Maxwell Crouse, Ibrahim Abdelaziz, Kshitij Fadnis, Siva Sankalp Patel, Kinjal Basu, Chulaka Gunasekara, Sadhana Kumaravel, Asim Munawar, Pavan Kapanipathi

机构 * IBM Research AI(IBM人工智能研究院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiGiT-TC方法,用于生成无状态环境下多轮工具调用对话,通过新颖的生成模式隐式表示工具调用,验证了在有状态问题设置中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09991 2026-05-12 cs.AI cs.LG math.OC 62%

Optimizer-Induced Mode Connectivity: From AdamW to Muon

优化器诱导的模式连接:从AdamW到Muon

Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了优化器对模式连接的影响,发现不同优化器在不同宽度下形成连通集,并揭示了优化器依赖的结构特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03928 2026-05-12 cs.LG cs.AI cs.CV stat.ML 62%

Supervised Dimensionality Reduction Revisited: Why LDA on Frozen CNN Features Deserves a Second Look

监督降维再审视:为何在冻结的CNN特征上使用LDA值得再次审视

Indar Kumar, Girish Karhana, Sai Krishna Jasti, Ankit Hemant Lade

机构 * independent researchers(独立研究人员)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文重新审视了在冻结特征上使用LDA进行监督降维的有效性,发现其在粗粒度任务中提升准确率,但在细粒度任务中表现不佳,揭示了LDA在不同任务场景下的适用边界。

Comments 11 pages, 5 figures, 5 tables. Code available at https://github.com/IndarKarhana/lda-image-classification

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12635 2026-05-12 cs.CL cs.AI 62%

Positional Encoding via Token-Aware Phase Attention

基于令牌感知的相注意力的位置编码

Yu Wang, Sheng Shen, Rémi Munos, Hongyuan Zhan, Yuandong Tian

机构 * Meta

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Token-Aware Phase Attention,通过可学习的相函数改进注意力机制,实现长距离token交互,支持更长上下文的持续预训练,并在长上下文场景下取得更低的困惑度和更强的检索性能。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08988 2026-05-12 cs.LG cs.AI cs.CE 62%

Benchmarking Compositional Generalisation for Machine Learning Interatomic Potentials

分子机器学习势函数的组成泛化基准测试

Amir Masoud Nourollah, Irtaza Khalid, Stefano Leoni, Steven Schockaert

机构 * Cardiff University(卡迪夫大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出四个任务评估分子学习势函数的组成泛化能力,发现最先进模型在面对新分子时表现显著下降,误差比分布内例子高一个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19831 2026-05-11 cs.LG cs.CL 62%

Neural Neural Scaling Laws

神经神经扩展定律

Michael Y. Hu, Jane Pan, Ayush Rajesh Jhaveri, Nicholas Lourie, Kyunghyun Cho

机构 * New York University(纽约大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出NeuNeu模型,通过时间序列外推预测语言模型在下游任务中的性能,相比传统参数化方法,其在66个下游任务上的均方误差降低了44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06145 2026-05-08 cs.LG cs.AI cs.SY eess.SY 62%

Unifying Goal-Conditioned RL and Unsupervised Skill Learning via Control-Maximization

通过控制最大化统一目标条件强化学习和无监督技能学习

Alireza Modirshanechi, Benjamin Eysenbach, Peter Dayan, Eric Schulz

机构 * Helmholtz Munich(海德堡大学慕尼黑分校) Max Planck Institute for Biological Cybernetics(生物 cybernetics 最大计划研究所) Princeton University(普林斯顿大学) University of Tübingen(图宾根大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文通过控制最大化理论统一了目标条件强化学习与无监督技能学习,揭示了两者在目标敏感性上的联系,并证明了不同GCRL形式的不等价性及与MISL目标的对应关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06032 2026-05-08 cs.LG cs.AI 62%

Does Synthetic Data Help? Empirical Evidence from Deep Learning Time Series Forecasters

合成数据有帮助吗?来自深度学习时间序列预测器的实证证据

Hugo Cazaux, Eyjólfur Ingi Ásgeirsson, Hlynur Stefánsson

机构 * Department of Engineering(工程系) Reykjavík University(雷克雅未克大学) Iceland(冰岛)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文通过大规模实证研究探讨合成数据在时间序列预测中的作用,发现通道混合模型在多数实验中受益,而通道独立模型则表现下降,提出使用合成增强需考虑模型架构和数据集依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05224 2026-05-08 cs.LG cs.AI cs.CR 62%

Channel-Level Semantic Perturbations: Unlearnable Examples for Diverse Training Paradigms

通道级语义扰动:用于多样化训练范式的不可学习示例

Bo Wang, Jia Ni, Mengnan Zhao, Zhan Qin, Kui Ren

机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在不同训练范式下不可学习示例的有效性,发现预训练权重会削弱现有方法效果,并提出Shallow Semantic Camouflage策略以提升数据不可学习性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11229 2026-05-08 cs.AI cs.LG 62%

Latent Generative Solvers for Generalizable Long-Term Physics Simulation

潜在生成求解器用于通用的长期物理模拟

Zituo Chen, Sili Deng

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出潜在生成求解器(LGS),通过物理变分自编码器、分层流强迫变换器和训练中的输入噪声,实现了对异构PDE家族的泛化和长序列稳定性,有效提升了物理模拟的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01640 2026-05-05 cs.LG cs.CL 62%

Prescriptive Scaling Laws for Data Constrained Training

数据受限训练的规范性扩展定律

Justin Lovelace, Christian Belardi, Srivatsa Kundurthy, Shriya Sudhakar, Kilian Q. Weinberger

机构 * Department of Computer Science(计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出新的扩展定律,通过引入过拟合惩罚,改进数据受限训练中的计算分配策略,证明过度重复无效,建议增加模型容量,且通过权重衰减系数比较验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07129 2026-05-05 cs.LG cs.CL 62%

Growing Transformers: Modular Composition and Layer-wise Expansion on a Frozen Substrate

生长变换器:在固定基质上的模块化组合与逐层扩展

A. Bochkov

机构 * Moscow Institute of Physics and Technology (MIPT)(莫斯科物理技术学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了在固定接口下训练解码器Transformer的约束训练方法,通过逐层扩展模型并保持可训练参数预算,展示了在有限参数下持续学习的可行性及与密集训练的权衡。

Comments Limitations added

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27356 2026-05-01 cs.LG cs.AI 62%

TypeBandit: Type-Level Context Allocation and Reweighting for Effective Attribute Completion in Heterogeneous Graph Neural Networks

TypeBandit:基于类型级上下文分配与重加权的异构图神经网络中有效属性补全

Ta-Yang Wang, Rajgopal Kannan, Viktor Prasanna

机构 * University of Southern California(南加州大学) DEVCOM Army Research Office(陆军研究办公室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TypeBandit方法,通过类型级上下文分配与重加权提升异构图神经网络中属性补全效果,结合拓扑感知初始化、类型级老虎机采样和联合表征学习,实现高效且灵活的属性补全策略。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26516 2026-04-30 cs.LG cs.AI 62%

Lyapunov-Guided Self-Alignment: Test-Time Adaptation for Offline Safe Reinforcement Learning

Lyapunov引导的自对齐:用于离线安全强化学习的测试时适应

Seungyub Han, Hyungjin Kim, Jungwoo Lee

机构 * Seoul National University(首尔国立大学)

专题命中 预训练与数据 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAS框架,通过自对齐机制在不重新训练的情况下实现离线安全强化学习的测试时适应,利用Lyapunov条件筛选可行轨迹并生成上下文提示,提升安全性与性能。

Comments Accepted at AISTATS 2026. First two authors contributed equally. Project page: https://seungyubhan.github.io/sas/. Code: https://github.com/seungyubhan/sas

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23627 2026-04-28 cs.CL cs.LG 62%

Neural Grammatical Error Correction for Romanian

神经语法错误纠正用于罗马尼亚语

Teodor-Mihai Cotet, Stefan Ruseti, Mihai Dascalu

机构 * Computer Science Department University Politehnica of Bucharest(布加勒斯特大学工业大学计算机科学系)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文首次为罗马尼亚语构建了语法错误纠正语料库,并提出基于预训练的Transformer模型,在低资源环境下有效提升了纠错性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19147 2026-04-22 cs.LG cs.AI 62%

Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling

Nexusformer:非线性注意力扩展用于稳定且可继承的Transformer扩展

Weijie Zhao, Mingquan Liu, Bolun Wang, Simo Wu, Nuobei Xie, Rui-Jie Zhu, Peng Zhou

机构 * The School of Computer Science, China University of Geosciences, 388 Lumo Road, Wuhan, 430074, Hubei, China(中国地质大学(北京)计算机科学学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 Nexusformer通过非线性映射解决传统Transformer扩展中的线性瓶颈,实现无损结构扩展,实验表明其在语言模型和推理任务中以更低的计算成本达到与Tokenformer相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21191 2026-04-21 cs.CL cs.AI 62%

Function Words as Statistical Cues for Language Learning

功能词作为语言学习的统计线索

Xiulin Yang, Heidi Getz, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨功能词的统计特性如何促进抽象语法知识的学习,通过跨语言语料分析验证了功能词的高频、句法关联性和短语边界对齐性是普遍规律,实验表明保留这些特性能提升神经网络学习效果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16758 2026-04-21 cs.CV cs.AI cs.LG 62%

Frozen Vision Transformers for Dense Prediction on Small Datasets: A Case Study in Arrow Localization

冻结的视觉Transformer用于小数据集上的密集预测:箭头定位的案例研究

Maxwell Shepherd

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种系统,用于在40厘米室内射箭靶面自动检测、定位和评分箭头穿孔,仅使用48张标注照片(5,084个穿孔)。系统结合了颜色基于的标准化校正阶段、冻结的自监督视觉Transformer和AnyUp引导的特征上采样,实现了亚毫米级精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16362 2026-04-21 cs.LG cs.AI cs.CV 62%

SetFlow: Generating Structured Sets of Representations for Multiple Instance Learning

SetFlow:生成多实例学习的结构化表示集

Nikola Jovišić, Milica Škipina, Vanja Švenda

机构 * Institute for Artificial Intelligence R&D of Serbia(塞尔维亚人工智能研究与开发研究所)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 SetFlow通过生成架构直接建模多实例学习的整个袋数据,在表示空间中捕捉实例间交互,提升在数据稀缺场景下的表现。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15093 2026-04-17 cs.AI cs.CL cs.CV cs.HC 62%

OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis

OpenMobile: 通过任务和轨迹合成构建开放移动代理

Kanzhi Cheng, Zehao Li, Zheng Ma, Nuo Chen, Jialin Cao, Qiushi Sun, Zichen Ding, Fangzhi Xu, Hang Yan, Jiajun Chen, Anh Tuan Luu, Jianbing Zhang, Lewei Lu, Dahua Lin

机构 * Nanjing University(南京大学) SenseTime(秒速) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Xi’an Jiaotong University(西安交通大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OpenMobile框架,通过可扩展的任务合成管道和策略切换策略生成高质量任务指令和轨迹,实现移动代理在AndroidWorld等基准测试中取得显著成绩。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13275 2026-04-16 cs.CL cs.LG 62%

Better and Worse with Scale: How Contextual Entrainment Diverges with Model Size

更大与更小:如何在模型规模下语境同步发生分歧

Dikshant Kukreja, Kshitij Sah, Gautam Gupta, Avinash Anand, Rajiv Ratn Shah, Zhengkui Wang, Aik Beng Ng, Erik Cambria

机构 * IIIT Delhi, India(德里印度理工学院) Nanyang Technological University(南洋理工大学) NVIDIA(NVIDIA公司) Singapore Institute of Technology(新加坡理工学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了模型规模对语境同步的影响,发现大模型在忽略虚假信息方面更有效,但对无关token的忽略能力下降,揭示了语义过滤与机械复制的对立行为。

Comments 16 pages, 11 figures, 6 tables. Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11805 2026-04-14 cs.LG cs.AI cs.CV cs.RO 62%

Solving Physics Olympiad via Reinforcement Learning on Physics Simulators

通过物理模拟器强化学习解决物理竞赛

Mihir Prabhudesai, Aryan Satpathy, Yangmin Li, Zheyang Qin, Nikash Bhardwaj, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过物理模拟器生成合成数据,利用强化学习训练LLM,实现零样本迁移到现实物理竞赛,提升模型物理推理能力。

Comments Project Webpage - https://sim2reason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20792 2026-04-14 cs.LG cs.CL q-bio.BM 62%

BadGraph: A Backdoor Attack Against Latent Diffusion Model for Text-Guided Graph Generation

BadGraph: 针对文本引导图生成的潜在扩散模型后门攻击

Liang Ye, Shengqin Chen, Jiazhu Dai

机构 * School of Computer Engineering and Science, Shanghai University(上海大学计算机工程与科学学院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文提出BadGraph,一种针对文本引导图生成的潜在扩散模型的后门攻击方法,通过文本触发器污染训练数据,在推理时触发指定子图,同时保持对清洁输入的正常性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07286 2026-04-14 cs.LG cs.AI q-bio.BM q-bio.QM 62%

Evolutionary Profiles for Protein Fitness Prediction

蛋白质适应性预测的进化图谱

Jigang Fan, Xiaoran Jiao, Shengdong Lin, Zhanming Liang, Weian Mao, Chenchen Jing, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Peking University(北京大学) East China University of Science and Technology(华东理工大学) Chengdu University of Information Technology(成都信息工程大学) Massachusetts Institute of Technology(麻省理工学院) Zhejiang University of Technology(浙江工业大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EvoIF模型,通过整合进化信号提升蛋白质突变适应性预测性能,采用轻量结构和逆强化学习框架,在有限数据下实现高精度预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09389 2026-04-13 cs.LG cs.CL 62%

Is More Data Worth the Cost? Dataset Scaling Laws in a Tiny Attention-Only Decoder

更多数据值得付出成本吗?在极小注意力解码器中的数据集扩展定律

Götz-Henrik Wiegand, Lorena Raichle, Rico Städeli, Tomas Hrycej, Bernhard Bermeitinger, Siegfried Handschuh

机构 * Institute of Computer Science, University of St. Gallen(圣加仑大学计算机科学研究所) Institute of Computer Science in Vorarlberg, University of St. Gallen(圣加仑大学福拉尔贝格计算机科学研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过极小注意力解码器研究数据集规模扩展定律,发现数据量增加带来性能提升但存在边际效益递减,为数据与计算成本平衡提供指导。

Comments Presented as a paper at 3rd DATA-FM workshop @ ICLR 2026, Brazil. Published at 13th IEEE Swiss Conference on Data Science and AI (SDS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏