arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2603.22629 2026-03-25 cs.CL cs.AI 73%

LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation

LGSE: 词法基础的子词嵌入初始化用于低资源语言适应

Hailay Teklehaymanot, Dren Fazlija, Wolfgang Nejdl

机构 * L3S Research Center Hannover(汉诺威L3S研究中心)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 LGSE通过引入词法信息的子词分割方法,改进低资源语言适应中的词嵌入初始化,通过平均预训练的子词或FastText词法表示,提升表示质量。

Comments 12 pages, 1 figure, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22294 2026-03-25 cs.LG cs.AI 73%

Efficient Embedding-based Synthetic Data Generation for Complex Reasoning Tasks

高效嵌入式合成数据生成用于复杂推理任务

Srideepika Jayaraman, Achille Fokoue, Dhaval Patel, Jayant Kalagnanam

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于嵌入的合成数据生成方法,通过增强数据多样性提升多个基准的性能,分析嵌入空间中数据分布与预测准确性之间的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18090 2026-03-23 cs.SD cs.AI cs.CL 73%

MOSS-TTS Technical Report

MOSS-TTS 技术报告

Yitian Gong, Botian Jiang, Yiwei Zhao, Yucheng Yuan, Kuangwei Chen, Yaozhou Jiang, Cheng Chang, Dong Hong, Mingshu Chen, Ruixiao Li, Yiyang Zhang, Yang Gao, Hanfu Chen, Ke Chen, Songlin Wang, Xiaogui Yang, Yuqian Zhang, Kexin Huang, ZhengYuan Lin, Kang Yu, Ziqi Chen, Jin Wang, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

机构 * SII-OpenMOSS Team(SII-OpenMOSS团队)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 MOSS-TTS 基于可扩展的 recipe 提出语音生成基础模型,支持多语言和开放域场景,具备零样本语音克隆、音素级发音控制等能力。

Comments Project page: https://github.com/OpenMOSS/MOSS-TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19280 2026-03-23 cs.CL cs.AI cs.CY 73%

From Feature-Based Models to Generative AI: Validity Evidence for Constructed Response Scoring

从基于特征的模型到生成式AI:构造响应评分的效度证据

Jodi M. Casabianca, Daniel F. McCaffrey, Matthew S. Johnson, Naim Alper, Vladimir Zubenko

机构 * BroadMetrics ETS

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了生成式AI在构造响应评分中的效度证据收集,对比了传统特征模型与生成式AI的差异,提出最佳实践以支持AI评分系统的使用和解释。

Comments 37 pages, 8 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05545 2026-03-19 cs.CL cs.CY cs.LG 73%

The Moral Foundations Reddit Corpus

道德基础Reddit语料库

Jackson Trager, Alireza S. Ziabari, Elnaz Rahmati, Aida Mostafazadeh Davani, Preni Golazizian, Farzan Karimi-Malekabadi, Ali Omrani, Zhihe Li, Brendan Kennedy, Georgios Chochlakis, Nils Karl Reimer, Melissa Reyes, Kelsey Cheng, Mellow Wei, Christina Merrifield, Arta Khosravi, Evans Alvarez, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出一个包含16123条Reddit评论的语料库,用于标注道德情感,通过评估不同模型表现,强调了人工标注数据在AI对齐评估中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16354 2026-03-18 cs.CL cs.IR cs.LG 73%

PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development

PashtoCorp:一个12.5亿词语料库、评估套件和可重复的低资源语言开发流水线

Hanif Rahman

机构 * Independent Researcher(独立研究员)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文介绍了PashtoCorp,一个包含12.5亿词的Pashto语料库,通过可重复的流水线和多种数据源,显著提升了低资源语言的NLP研究水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13308 2026-03-17 cs.LG cs.AI 73%

Task Expansion and Cross Refinement for Open-World Conditional Modeling

任务扩展与跨细化用于开放世界条件建模

Shreyas Bhat Brahmavar, Qiyang Liu, Yang Li, Junier Oliva

机构 * Department of Computer Science University of North Carolina at Chapel Hill(计算机科学系北卡罗来纳大学教堂山分校) Independent Researcher(独立研究者)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TEXR框架,通过结构化合成和细化语义数据上下文,扩展任务覆盖范围,提升开放世界条件建模的零样本、少样本和多样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12906 2026-03-16 cs.CL cs.AI 73%

Learning from Child-Directed Speech in Two-Language Scenarios: A French-English Case Study

在双语场景中学习儿童引导的口语:一项法语-英语案例研究

Liel Binyamin, Elior Sulem

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在严格数据匹配条件下,扩展BabyBERTa至英法双语场景的紧凑语言模型,对比儿童口语与多领域语料对语法和语义任务的影响,发现儿童口语在单语任务中表现更优,双语预训练对文本蕴含任务有显著提升。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11099 2026-03-13 cs.LG cs.AI 73%

Graph Tokenization for Bridging Graphs and Transformers

图标记化:连接图与变换器

Zeyuan Guo, Enmao Diao, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecom.(北京邮电大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出图标记化框架,结合可逆图序列化与BPE,使变换器模型可直接应用于图结构数据,实现对图基准测试的高性能表现。

Comments Accepted as a poster at ICLR 2026. Code is available at https://github.com/BUPT-GAMMA/Graph-Tokenization-for-Bridging-Graphs-and-Transformers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07365 2026-03-10 cs.LG cs.AI 73%

Scaling Laws in the Tiny Regime: How Small Models Change Their Mistakes

小规模 regime 中的缩放规律:小型模型如何改变其错误

Mohammed Alnemari, Rizwan Qureshi, Nader Begrazadah

机构 * Faculty of Computer Science and Information Technology, University of Tabuk(计算机科学与信息科技学院,塔布克大学) AIST Research Center, University of Tabuk(AIST研究中心,塔布克大学) Department of Computer Science, Salim Habib University(计算机科学系,Salim Habib大学) University of California, Irvine(加州大学尔湾分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了小规模模型在 CIFAR-100 上的误差率缩放规律,发现小型模型在准确率、误差结构和校准方面有独特表现,且幂律关系在不同规模下不一致。

Comments 17 pages, 6 figures, 2 tables. Submitted to MDPI Machine Learning and Knowledge Extraction (MAKE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03524 2026-03-10 cs.LG cs.AI 73%

Test-Time Meta-Adaptation with Self-Synthesis

测试时元适应与自合成

Zeyneb N. Kaya, Nick Rui

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MASS通过自动生成问题特定的合成训练数据,实现大语言模型在测试时的自我适应与优化,提升下游任务性能。

Comments 5 pages, 2 figures, 1 table. Accepted to AI with Recursive Self-Improvement (RSI) Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03605 2026-03-03 cs.AI cs.LG stat.ML 73%

Understanding the Role of Training Data in Test-Time Scaling

理解训练数据在测试时扩展中的作用

Adel Javanmard, Baharan Mirzasoleiman, Vahab Mirrokni

机构 * University of Southern California(南加州大学) Google Research(谷歌研究) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了训练数据对测试时扩展性能的影响,发现增加计算量可减少上下文长度并提升模型表现,但若训练数据缺乏必要技能则可能损害性能。

Comments 25 pages, 5 figures, accepted in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00436 2026-03-03 cs.LG cs.AI 73%

ROKA: Robust Knowledge Unlearning against Adversaries

ROKA: 面对对抗者的鲁棒知识反学习

Jinmyeong Shin, Joshua Tapia, Nicholas Ferreira, Gabriel Diaz, Moayed Daneshyari, Hyeran Jeon

机构 * University of California, Merced(加州大学梅尔塞德斯分校) California State University, East Bay(加州州立大学东湾分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ROKA通过神经愈合机制实现鲁棒的知识反学习,有效对抗间接反学习攻击,同时保护保留数据的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24109 2026-03-02 cs.CL cs.AI 73%

ARGUS: Seeing the Influence of Narrative Features on Persuasion in Argumentative Texts

ARGUS:叙事特征对说服力影响的观察

Sara Nabhani, Federico Pianzola, Khalid Al-Khatib, Malvina Nissim

机构 * University of Groningen(格罗宁根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ARGUS通过分析叙事特征对说服力的影响,探索在线论证中叙事作用的机制

Comments 22 pages, 8 figures, submitted to ACM Transactions on Intelligent Systems and Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23057 2026-02-27 cs.CL cs.AI 73%

Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention

仿射缩放注意力:迈向灵活且稳定的Transformer注意力

Jeongin Bae, Baeseong Park, Gunho Park, Minsub Kim, Joonhyung Lee, Junhee Yoo, Sunghyeon Woo, Jiwon Ryu, Se Jung Kwon, Dongsoo Lee

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 仿射缩放注意力通过引入输入依赖的缩放和偏置项,提升Transformer模型的训练稳定性与注意力行为控制能力。

Comments Preprint. 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22223 2026-02-27 cs.IR cs.CL cs.LG 73%

SQaLe: A Large Text-to-SQL Corpus Grounded in Real Schemas

SQaLe:基于真实模式的大型文本到SQL语料库

Cornelius Wolff, Daniel Gomm, Madelon Hulsebos

机构 * Centrum Wiskunde & Informatica(荷兰数学与信息学研究中心) University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 SQaLe是一个基于真实数据库模式的大型半合成文本到SQL数据集,通过结合模式采样、问题合成和SQL构建,生成了高质量的(问题,模式,查询)三元组,用于提升文本到SQL模型的泛化能力。

Comments Accepted at the AI for Tabular Data workshop at EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18920 2026-02-24 cs.CL cs.AI 73%

DeepInnovator: Triggering the Innovative Capabilities of LLMs

DeepInnovator: 激发大语言模型的创新能力

Tianyu Fan, Fengji Zhang, Yuxiang Zheng, Bei Chen, Xinyao Niu, Chengen Huang, Junyang Lin, Chao Huang

机构 * The University of Hong Kong(香港大学) City University of Hong Kong(城市大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DeepInnovator通过自动化数据提取和猜想与反驳训练范式,提升大语言模型的创新能力,实现显著优于基线的创新想法生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13653 2026-02-17 cs.AI cs.CL cs.CV cs.HC 73%

Building Autonomous GUI Navigation via Agentic-Q Estimation and Step-Wise Policy Optimization

通过代理-Q估计和分步策略优化构建自主GUI导航

Yibo Wang, Guangda Huzhang, Yuwei Hu, Yu Xia, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Lijun Zhang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Ovis Team, Alibaba Group(阿里团队,阿里巴巴集团)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于代理-Q估计和分步策略优化的GUI自主导航框架,通过强化学习提升GUI交互能力,实验证明其在导航和基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12556 2026-02-16 cs.LG cs.AI 73%

SD-MoE: Spectral Decomposition for Effective Expert Specialization

SD-MoE:通过谱分解实现有效的专家专业化

Ruijun Huang, Fang Dong, Xin Zhang, Hengjie Cao, Zhendong Huang, Anrui Chen, Jixian Zhou, Mengyi Chen, Yifeng Yang, Mingzhi Dong, Yujiang Wang, Jinlong Hou, Qin Lv, Robert P. Dick, Yuan Cheng, Fan Yang, Tun Lu, Chun Zhang, Li Shang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) University of Bath, Bath, United Kingdom(巴斯大学) Oxford Suzhou Centre for Advanced Research, Suzhou, China(牛津苏泽研究中心) Department of Electrical Engineering and Computer Science, University of Michigan(密歇根大学电气工程与计算机科学系) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Department of Computer Science, University of Colorado Boulder, Colorado, USA(科罗拉多大学博尔德分校计算机科学系) Research Institute of Tsinghua University in Shenzhen, Shenzhen, China(清华大学深圳研究院) Greater Bay Area National Center of Technology Innovation, Research Institute of Tsinghua University in Shenzhen, Shenzhen, China(粤港澳大湾区国家技术创新中心,清华大学深圳研究院) School of Microelectronics, Fudan University, Shanghai, China(复旦大学微电子学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SD-MoE通过谱分解解决MoE中专家专业化不足的问题,提升模型性能并兼容多种现有架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10168 2026-02-16 q-bio.QM cs.AI cs.LG 73%

EVA: Towards a universal model of the immune system

EVA:朝着免疫系统通用模型迈进

Scienta Team, Ethan Bandasack, Vincent Bouget, Apolline Bruley, Yannis Cattan, Charlotte Claye, Matthew Corney, Julien Duquesne, Karim El Kanbi, Aziz Fouché, Pierre Marschall, Francesco Strozzi

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 EVA是首个跨物种多模态免疫学基础模型,通过整合转录组和组织学数据,提升免疫疾病研究的转化应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09570 2026-02-11 cs.CL cs.AI cs.IR 73%

LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval

LEMUR:一种用于多语言法律嵌入模型检索鲁棒微调的语料库

Narges Baba Ahmadi, Jan Strich, Martin Semmann, Chris Biemann

机构 * Hub of Computing and Data Science (HCDS) University of Hamburg(计算与数据科学中心(HCDS)乌姆斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LEMUR通过构建多语言法律语料库并微调嵌入模型,提升了多语言法律检索的鲁棒性和准确性,尤其在低资源语言中表现显著。

Comments Accepted at EACL SRW 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10364 2026-02-10 cs.LG cs.CL cs.CR 73%

Can We Infer Confidential Properties of Training Data from LLMs?

能否从LLMs中推断出训练数据的保密属性?

Pengrun Huang, Chhavi Yadav, Kamalika Chaudhuri, Ruihan Wu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PropInfer基准任务,通过两种微调范式评估LLMs属性推断攻击,揭示LLMs在隐私保护方面的潜在漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06949 2026-02-09 cs.RO cs.AI cs.CV cs.LG 73%

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

DreamDojo:从大规模人类视频中学习通用机器人世界模型

Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K. R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, Linxi "Jim" Fan

机构 * NVIDIA HKUST(香港科技大学) UC Berkeley(加州大学伯克利分校) Stanford(斯坦福大学) KAIST(韩国科学技术院) UofT(多伦多大学) UCSD(加州大学圣地亚哥分校) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 DreamDojo通过大规模人类视频学习通用机器人世界模型,解决动作标签稀缺问题,实现高精度物理理解和实时交互。

Comments Project page: https://dreamdojo-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04301 2026-02-09 cs.LG cs.CL 73%

Quantifying the Effect of Test Set Contamination on Generative Evaluations

量化测试集污染对生成评估的影响

Rylan Schaeffer, Joshua Kazdan, Baber Abbasi, Ken Ziyu Liu, Brando Miranda, Ahmed Ahmed, Fazl Berez, Abhay Puri, Stella Biderman, Niloofar Mireshghallah, Sanmi Koyejo

机构 * University of Oxford(牛津大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05106 2026-02-06 cs.CL cs.LG stat.ML 73%

Data Kernel Perspective Space Performance Guarantees for Synthetic Data from Transformer Models

变换器模型合成数据的Data Kernel视角空间性能保证

Michael Browder, Kevin Duh, J. David Harris, Vince Lyzinski, Paul McNamee, Youngser Park, Carey E. Priebe, Peter Viechnicki

机构 * Department of Mathematics at the University of Maryland, College Park(马里兰大学College Park数学系) Human Language Technology Center of Excellence, Johns Hopkins University(约翰霍普金斯大学人机语言技术中心) Center for Imaging Science (CIS), the Institute for Computational Medicine (ICM), and the Mathematical Institute for Data Science (MINDS), Johns Hopkins University(约翰霍普金斯大学影像科学中心(CIS)、计算医学研究所(ICM)和数据科学数学研究所(MINDS)) Department of Applied Mathematics and Statistics (AMS), the Center for Imaging Science (CIS), and the Mathematical Institute for Data Science (MINDS), Johns Hopkins University(约翰霍普金斯大学应用数学与统计学系(AMS)、影像科学中心(CIS)和数据科学数学研究所(MINDS))

专题命中 预训练与数据 :LLM(abstract);preference optimization(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Data Kernel Perspective Space(DKPS)方法,通过数学分析为变换器模型的合成数据质量提供统计保证,旨在提升下游任务如神经机器翻译模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04304 2026-02-05 cs.CV cs.AI cs.CL 73%

Beyond Static Cropping: Layer-Adaptive Visual Localization and Decoding Enhancement

超越静态裁剪:层适应的视觉定位与解码增强

Zipeng Zhu, Zhanghao Hu, Qinglin Zhu, Yuxi Hong, Yijun Liu, Jingyong Su, Yulan He, Lin Gui

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) King’s College London(伦敦大学国王学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LASER方法,通过动态层适应提升视觉定位和解码精度,解决静态裁剪在复杂推理任务中的局限性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02619 2026-02-05 cs.LG cs.AI cs.SE 73%

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

daVinci-Agency: 解锁长周期代理数据高效性

Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03772 2026-02-04 cs.LG cs.AI 73%

UniGeM: Unifying Data Mixing and Selection via Geometric Exploration and Mining

UniGeM: 通过几何探索与挖掘统一数据混合与选择

Changhao Wang, Yunfei Yu, Xinhao Yao, Jiaolong Yang, Riccardo Cantoro, Chaobo Li, Qing Cui, Jun Zhou

机构 * Politecnico di Torino(托斯大学) Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Institute of Microelectronics of the CAS(中国科学院微电子研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 UniGeM通过几何探索与挖掘统一数据混合与选择,提升大语言模型的数据效率和推理性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00576 2026-02-03 cs.LG cs.AI 73%

Data Distribution as a Lever for Guiding Optimizers Toward Superior Generalization in LLMs

数据分布作为引导优化器实现LLM超一般化的杠杆

Tushaar Gangavarapu, Jiping Li, Christopher Vattheuer, Zhangyang Wang, Baharan Mirzasoleiman

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过调整训练数据分布降低简单性偏见,提升大型语言模型的泛化能力,实验表明在数学推理任务中性能提升达18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 73%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏