arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12452 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12452 篇

2606.29858 2026-07-13 cs.CL 版本更新 77%

Smooth Scaling Laws Hide Stepwise Token Learning

平滑缩放定律隐藏了逐步的令牌学习

Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

机构 * Dots Studio, Xiaohongshu Inc.(dots studio,小红书公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua university(清华大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出令牌级框架,将缩放定律分解为上下文令牌的局部学习事件,通过拟合S形曲线发现令牌学习集中在局部转换中,并利用学习时间谱定量重建验证损失导数,进而通过重塑训练分布实现11%的验证损失加速降低。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10145 2026-07-13 cs.CL 版本更新 77%

Lost in Backpropagation: The LM Head is a Gradient Bottleneck

陷入反向传播:语言模型头部是一个梯度瓶颈

Nathan Godey, Yoav Artzi

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 语言模型头部的梯度瓶颈导致表达和优化受限,影响训练效率,需新设计

Comments To be presented at COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06845 2026-07-09 cs.CL 新提交 77%

LLMs Silently Correct African American English: Auditing and Mitigating Dialect Bias via Activation Steering

大语言模型对非裔美国英语的隐性纠正:通过激活引导来审计和减轻方言偏见

Huan Wu, Ali Emami, Muhammad Furquan Hassan, Osaretin Igbinoba, Osakpolor Idusuyi, Osamede Igbinoba, Faiza Khan Khattak, Laleh Seyyed-Kalantari

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds(连接思维公司) Emory University(埃默里大学) Wilfrid Laurier University(威尔弗里德·劳里埃大学) University of Toronto(多伦多大学) University of Guelph(圭尔夫大学) Monark Health(莫纳克健康公司) CIFAR Solution Network(加拿大高级研究院解决方案网络)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究发现大语言模型会将非裔美国英语重写为标准美国英语,提出端到端框架审计和减轻偏见,审计用cDGI等方法,减轻偏见用激活引导,该方法比提示更有效,还发布了真实AAE平行语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05842 2026-07-08 cs.SE cs.AI cs.CR 新提交 77%

Beyond Refusal: A Same-Lineage Study of Aligned and Abliterated LLMs for Vulnerability Analysis

超越拒绝:用于漏洞分析的对齐和消除拒绝的大语言模型的同谱系研究

Mingchen Li, Meikang Qiu, Zifan Peng, Heng Fan, Song Fu, Junhua Ding, Yunhe Feng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型辅助软件安全中,同谱系模型的安全状态(对齐或消除拒绝)对软件安全工作流程防御效用的影响,通过比较不同模型在多方面的表现,发现评估应综合考量模型响应、响应正确性及输出在工程流程中的可操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05217 2026-07-08 cs.CY cs.CL cs.IR 新提交 77%

Curated retrieval versus open web search in public AI information services: a coverage-trust trade-off

公共人工智能信息服务中的 curated 检索与开放网页搜索:覆盖度-可信度权衡研究

Hafsteinn Einarsson, Hafsteinn Birgir Einarsson, Jón Gunnar Ólafsson, Jón Gunnar Þorsteinsson

机构 * Faculty of Industrial Engineering, Mechanical Engineering and Computer Science, University of Iceland(工业工程、机械工程和计算机科学学院,爱沙尼亚大学) Faculty of Political Science, University of Iceland(政治学学院,爱沙尼亚大学) The Icelandic Web of Science, University of Iceland(冰岛科学网络,爱沙尼亚大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对公共AI信息服务的源可信度问题,对比 curated 本地语料RAG与开放网页搜索两种检索路径,发现前者可信度高但覆盖有限,后者覆盖广但源可信度差,揭示了覆盖度与可信度的核心权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17758 2026-07-07 cs.LG 版本更新 77%

Memisis: Orchestrating and Evaluating Synthetic Data for Tabular Health Datasets

Memisis:协调和评估表格健康数据的合成数据

Nitish Nagesh, Pengbao Zhou, Atchuth Naveen Chilaparasetti, Yajat Nagaraj Kiran, Tu Nguyen, Arshia Harish Puthran, Muhjaazee Love, Aadi Sharma, Mahdi Bagheri, Ian Harris, Amir M. Rahmani

机构 * University of California Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Memisis工具,通过结合现有合成数据工具、大语言模型和先进评估指标,协调和评估合成数据,以提高下游预测任务和临床决策的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11784 2026-07-07 cs.LG stat.ML 版本更新 77%

Language Generation with Replay: A Learning-Theoretic View of Model Collapse

带重放的语言生成:模型崩溃的学习理论视角

Giorgio Racca, Michal Valko, Amartya Sanyal

机构 * University of Copenhagen(哥本哈根大学) Isara Labs(Isara实验室)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究随着前沿大语言模型训练对数据需求增加,生成文本可能重入训练语料库致模型崩溃的问题。通过语言生成极限框架,引入重放对手,刻画重放何时限制生成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30460 2026-07-01 cs.LG cs.DC 版本更新 77%

HSAP: A Hierarchical Sequence-aware Parallelism for Hybrid-Context Generative Models

HSAP: 一种面向混合上下文生成模型的分层序列感知并行方法

Songxin Zhang, Zejian Xie, Zhuoyang Song, Cong lin, Junyu Lu, Jiaxing Zhang, Bingyi Jing

机构 * Southern University of Science and Technology(南方科技大学) International Digital Economy Academy(国际数字经济学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 提出一种分层序列感知并行框架,通过JIT编译优化通信策略,解决混合上下文打包序列中的因果注意力计算问题,在多个指标上优于现有方法。

Comments 10 pages, ACL preprint style

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21608 2026-06-30 cs.CL 77%

MixSarc: A Bangla-English Code-Mixed Corpus for Implicit Meaning Identification

MixSarc:一种用于隐含意义识别的孟加拉-英语混合语料库

Kazi Samin Yasar Alam, Md Tanbir Chowdhury, Tamim Ahmed, Ajwad Abrar, Md Rafid Haque

机构 * Department of Computer Science and Engineering, Islamic University of Technology, Dhaka, Bangladesh(伊斯兰科技大学计算机科学与工程系,达卡,孟加拉国) Department of Computer Science, University of Illinois Chicago, Chicago, Illinois, United States of America(伊利诺伊大学芝加哥分校计算机科学系,芝加哥,伊利诺伊州,美国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 MixSarc通过构建首个孟加拉-英语混合语料库,解决隐含意义识别中的多语言切换与文化差异问题,验证了模型在幽默检测上的有效性,但发现讽刺等类别因不平衡和复杂性而表现欠佳。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16028 2026-06-30 cs.CR cs.LG cs.SE 77%

ANVIL: Anomaly-based Vulnerability Identification without Labelled Training Data

ANVIL:无需标记训练数据的基于异常的漏洞识别

Weizhou Wang, Eric Liu, Xiangyu Guo, Xiao Hu, Ilya Grishchenko, David Lie

机构 * University of Toronto(多伦多大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ANVIL,通过将漏洞检测转化为异常检测,利用大语言模型对代码进行掩码重建,结合多种指标提升检测性能,在PrimeVul数据集上优于现有监督检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13491 2026-06-23 cs.IT cs.LG math.IT math.ST stat.TH 版本更新 77%

From Zipf's Law to Neural Scaling through Heaps' Law and Hilberg's Hypothesis

从齐普夫定律到神经缩放:通过希普斯定律和希尔伯格假设

Łukasz Dębowski

机构 * Institute of Computer Science, Polish Academy of Sciences(波兰科学院计算机科学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文系统揭示了神经缩放定律与齐普夫定律之间的演绎关系,通过推导词汇增长的希普斯定律和熵缩放的希尔伯格假设,证明神经缩放定律是齐普夫定律在广泛假设下的推论。

Comments 32 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18663 2026-06-18 cs.CL 新提交 77%

RegMix-D: Dynamic Data Mixing via Proxy Training Trajectories

RegMix-D: 通过代理训练轨迹实现动态数据混合

Kaiyan Zhao, Zhongtao Miao, Akiko Aizawa, Yoshimasa Tsuruoka

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出RegMix-D,通过代理训练轨迹预测多阶段最优混合比例,实现动态数据混合,在13个下游任务上优于RegMix和DoReMi,且代理计算预算仅为RegMix的25%。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11875 2026-06-11 cs.CL cs.SD 新提交 77%

I Understand How You Feel: Enhancing Deeper Emotional Support Through Multilingual Emotional Validation in Dialogue System

我理解你的感受:通过对话系统中的多语言情感验证增强深层情感支持

Zi Haur Pang, Yahui Fu, Koji Inoue, Tatsuya Kawahara

机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出情感验证在对话系统中的应用,构建多语言语料库M-EDESConv和测试集M-TESC,设计多语言情感感知门控单元MEGUMI进行时机检测,并评估当前LLM在情感验证响应生成中的表现。

Comments This paper has been accepted for presentation at SIGdial Meeting on Discourse and Dialogue 2026 (SIGDIAL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11304 2026-06-11 physics.ins-det cs.LG hep-ex hep-ph 新提交 77%

SPADE: Split-and-Delay Embeddings for Autoregressive High-Granularity Calorimeter Simulation

SPADE: 用于自回归高粒度量热器模拟的分裂与延迟嵌入

Joschka Birk, Frank Gaede, Anna Hallin, Gregor Kasieczka, Martina Mozzanica, Henning Rose

机构 * Institute for Experimental Physics, Universität Hamburg(实验物理研究所,汉堡大学) Deutsches Elektronen-Synchrotron DESY(德国电子同步辐射光源DESY)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 提出SPADE自回归变压器,通过独立嵌入多特征令牌并延迟特征流,利用标准自注意力学习令牌内相关性,在ILD探测器点云簇射生成中优于现有模型。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08729 2026-06-09 cs.RO cs.LG 新提交 77%

IR-SIM: A Lightweight Skill-Native Simulator for Navigation, Learning, and Benchmarking

IR-SIM:一种用于导航、学习和基准测试的轻量级技能原生模拟器

Ruihua Han, Shuai Wang, Chengyang Li, Rui Gao, Xinyi Wang, Zhe Liu, Guoliang Li, Yupu Lu, Qi Hao, Jia Pan, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology(深圳先进技术研究院) Southern University of Science and Technology(南方科技大学) University of Michigan(密歇根大学) University of Macau(澳门大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出轻量级技能原生导航模拟器IR-SIM,通过YAML配置完全定义场景,支持文本提示生成与修改,用于导航算法基准测试和训练数据自动生成,并桥接高保真模拟器和真实部署。

Comments 12 pages, 6 figures, project website: https://github.com/hanruihua/ir-sim

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08025 2026-06-09 cs.CL 新提交 77%

Arabic Sentence Segmentation Across Genres and Punctuation Conditions

跨体裁与标点条件下的阿拉伯语句子分割

Mohammed Elkholy, Khalid N. Elmadani, Nizar Habash, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·泽德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 针对阿拉伯语标点歧义和不一致导致的句子分割难题,构建跨8种体裁的语料库AraSEG,评估LLM、轻量编码器和依存解析器,发现轻量模型在困难设置下优于LLM,且准确分割能显著提升下游依存解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20329 2026-06-05 cs.CV cs.AI 77%

Image Generators are Generalist Vision Learners

图像生成器是通用视觉学习者

Valentin Gabeur, Shangbang Long, Songyou Peng, Paul Voigtlaender, Shuyang Sun, Yanan Bao, Karen Truong, Zhicheng Wang, Wenlei Zhou, Jonathan T. Barron, Kyle Genova, Nithish Kannen, Sherry Ben, Yandong Li, Mandy Guo, Suhas Yogin, Yiming Gu, Huizhong Chen, Oliver Wang, Saining Xie, Howard Zhou, Kaiming He, Thomas Funkhouser, Jean-Baptiste Alayrac, Radu Soricut

机构 * Google(谷歌)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 本文研究了图像生成器在视觉理解中的通用学习能力,通过引入Vision Banana模型,展示了图像生成训练如何像语言模型预训练一样,使模型在多种视觉任务中取得最佳性能,证明了图像生成预训练在构建基础视觉模型中的核心作用。

Comments Project Page: http://vision-banana.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04401 2026-06-04 cs.LG 77%

TANDEM: Bi-Level Data Mixture Optimization with Twin Networks

TANDEM: 基于孪生网络的双层数据混合优化

Jiaxing Wang, Deping Xiang, Jin Xu, Mingyang Yi, Guoqiang Gong, Zicheng Zhang, Haoran Li, Pengzhang Liu, Zhen Chen, Ke Zhang, Ju Fan, Qixiang Jiang

机构 * JD.com(京东公司) University of Oxford(牛津大学) Renmin University of China(中国人民大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TANDEM方法,通过孪生网络(代理模型和参考模型)的差异衡量数据效用,优化领域混合比例,在数据受限和监督微调等场景中显著提升大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04025 2026-06-04 cs.SE cs.AI 77%

The Biomimetic Architecture of Software 4.0

软件4.0的仿生架构

Philip Sheldrake, Dirk Scheffler

机构 * Unnamed Labs Amsterdam(阿姆斯特丹无名实验室) Unnamed Labs Karlsruhe(卡尔斯鲁厄无名实验室)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出软件4.0范式,通过自创生异质架构融合人类智能、神经AI与反射符号基底,解决概率-符号阻抗不匹配问题,并介绍实现该架构的编程语言Recognitive。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23420 2026-06-04 cs.AI 77%

Bilevel Autoresearch: Meta-Autoresearching Itself

双层自动研究:元自动研究自身

Yaonan Qu, Meng Lu

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI

AI总结 提出双层自动研究框架,外层循环通过读取内层循环代码和轨迹、识别瓶颈并注入可执行Python搜索机制来改进内层循环,在GPT预训练基准上实现5倍改进。

Comments 16 pages, 5 figures, 3 tables. v2 expands the framing as mechanism-level agentic self-improvement and updates related work and limitations; core method and experiments unchanged. This paper was primarily drafted by AI agents with human oversight and direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20213 2026-06-03 cs.SE cs.AI cs.CR 77%

CodeHacker: Automated Test Case Generation for Detecting Vulnerabilities in Competitive Programming Solutions

CodeHacker: 用于检测竞赛编程解决方案漏洞的自动化测试用例生成

Jingwei Shi, Xinxiang Yin, Jing Huang, Jinman Zhao, Shengyu Tao

机构 * Shanghai University of Finance and Economics(上海金融学院) Northwestern Polytechnical University(西北工业大学) Meituan(美团) University of Toronto(多伦多大学)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CodeHacker框架,通过多策略对抗测试用例生成(压力测试、反哈希攻击、逻辑特定攻击)和校准阶段,有效暴露程序漏洞,提升测试集真负率并增强RL训练模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01207 2026-06-02 cs.CV cs.LG 77%

Feature Alignment Determines Fusion Strategy: A Comparative Study of Cross-Attention and Concatenation in Multimodal Learning

特征对齐决定融合策略:多模态学习中交叉注意力与拼接的比较研究

Zhiqiang Zhou, Xuezhen Xie

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化学工业职业技术学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 通过实验和理论分析,证明特征对齐质量而非数据规模是决定多模态融合策略优劣的关键因素,当特征预对齐时拼接优于交叉注意力。

Comments 8 pages,6 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01062 2026-06-02 cs.AI 77%

DAG-MoE: From Simple Mixture to Structural Aggregation in Mixture-of-Experts

DAG-MoE:从简单混合到专家混合中的结构聚合

Jiarui Feng, Hanqing Zeng, Karish Grover, Ruizhong Qiu, Yinglong Xia, Qiang Zhang, Qifan Wang, Ren Chen, Dongqi Fu, Jiayi Liu, Zhoukai Zhao, Xiangjun Fan, Benyu Zhang, Yixin Chen

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出DAG-MoE框架,通过轻量级模块自动学习选定专家之间的最优聚合结构,以替代标准加权求和聚合,从而在不改变专家或路由器的情况下扩展专家组合空间并实现单层多步推理,在预训练和微调中均优于传统MoE基线。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00683 2026-06-02 cs.CL 77%

OCC-RAG: Optimal Cognitive Core for Faithful Question Answering

OCC-RAG:面向忠实问答的最优认知核心

Maksim Savkin, Mikhail Goncharov, Alexander Gambashidze, Alla Chepurova, Dmitrii Tarasov, Nikita Andriianov, Daria Pugacheva, Vasily Konovalov, Andrey Galichin, Ivan Oseledets

机构 * OCC Team(OCC团队)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);SLM(abstract_cn);分类 cs.CL

AI总结 提出OCC-RAG,一种通过多上下文多跳合成数据训练的小语言模型,在忠实问答任务中匹配或超越2-6倍规模通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12081 2026-06-02 cs.IR cs.LG 77%

From Scaling to Structured Expressivity: Rethinking Transformers for CTR Prediction

从规模到结构化表达能力:重新思考用于CTR预测的Transformer

Bencheng Yan, Yuejie Lei, Zhiyuan Zeng, Zheye Deng, Di Wang, Kaiyi Lin, Pengjie Wang, Chuan Yu, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对CTR预测中Transformer模型因结构错位导致收益递减的问题,提出Field-Aware Transformer (FAT),通过场感知参数重构和基组合超网络实现结构化表达能力,在理论(Rademacher复杂度标度律)和实验(AUC提升+4.38%,线上CTR+2.33%,RPM+0.66%)上均优于现有方法。

Comments KDD 2026; The first four authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30288 2026-06-01 cs.AI 77%

MIRA: Mid-training Rubric Anchoring for Source-Aware Data Selection

MIRA: 基于自锚定评分标准的中期训练源感知数据选择

Haowen Wang, Yaxin Du, Jian Yang, Jiajun Wu, Shukai Liu, Yuxuan Zhang, Pingjie Wang, Siheng Chen, Tuney Zheng, Ming Zhou, Xianglong Liu, Bryan Dai

机构 * Beihang University(北洋大学) IQuest Research(IQuest研究院) Shanghai Jiao Tong University(上海交通大学) University of British Columbia(不列颠哥伦比亚大学) Langboat Multilingual-Multimodal-NLP/mira(Langboat多语言-多模态-NLP/mira)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);post-training(abstract);分类 cs.AI

AI总结 针对中期训练中异构数据源的选择问题,提出MIRA框架,通过自锚定评分标准发现和可扩展的学生评分器,在代码中期训练中仅用一半token即可匹配全语料性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28184 2026-05-28 cs.LG 77%

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

通过最优系数校准在强化学习中联合训练多令牌预测

Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文从优化角度分析多令牌预测与强化学习联合训练失败的原因,提出最优系数校准方法,通过在线跟踪最优系数实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24296 2026-05-27 cs.AI cs.IR 77%

When Does Synthetic Patent Data Help? Volume-Fidelity Trade-offs in Low-Resource Multi-Label Classification

合成专利数据何时有帮助?低资源多标签分类中的数量-保真度权衡

Amirhossein Yousefiramandi, Ciaran Cooney

机构 * Clarivate, Intellectual Property(Clarivate知识产权)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 研究通过LLM生成合成数据用于多标签专利分类时的数量与保真度权衡,发现低资源场景下数量效应主导,高资源场景下保真度更重要,混合数据策略最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20527 2026-05-14 cs.LG 77%

RMNP: Row-Momentum Normalized Preconditioning for Scalable Matrix-Based Optimization

RMNP:基于行动量归一化的可扩展矩阵优化预条件化

Shenyang Deng, Zhuoli Ouyang, Tianyu Pang, Zihang Liu, Ruochen Jin, Shuhua Yu, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) International Computer Science Institute(国际计算机科学研究所) University of California, Berkeley(加州大学伯克利分校) Meta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 RMNP通过行归一化替代牛顿-施卢茨迭代,提升预条件化效率,保持优化性能,实验显示其在大语言模型预训练中表现优异。

Comments The 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09189 2026-05-12 cs.LG 77%

Practical Scaling Laws: Converting Compute into Performance in a Data-Constrained World

实用的扩展定律:在数据受限的世界中将计算转化为性能

Christopher M. Bryant, Hao Liu

机构 * Arena Physica

专题命中 预训练与数据 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种新的扩展定律公式,用于在数据受限条件下更准确地预测模型性能,通过分解损失为欠容量、欠训练和过拟合项,改进了传统扩展定律的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏