arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2002.01685 2020-02-06 cs.CL cs.LG 84%

Parsing as Pretraining

David Vilares, Michalina Strzyz, Anders Søgaard, Carlos Gómez-Rodríguez

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments AAAI 2020 - The Thirty-Fourth AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.08237 2020-01-03 cs.CL cs.LG 84%

XLNet: Generalized Autoregressive Pretraining for Language Understanding

Zhilin Yang, Zihang Dai, Yiming Yang, Jaime Carbonell, Ruslan Salakhutdinov, Quoc V. Le

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Pretrained models and code are available at https://github.com/zihangdai/xlnet

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.01580 2019-12-18 cs.LG cs.CL stat.ML 84%

A Comparative Study of Pretrained Language Models on Thai Social Text Categorization

Thanapapas Horsuwan, Kasidis Kanwatchara, Peerapon Vateekul, Boonserm Kijsirikul

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments 12 pages, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.10547 2019-06-03 cs.CL cs.LG 84%

An Embarrassingly Simple Approach for Transfer Learning from Pretrained Language Models

Alexandra Chronopoulou, Christos Baziotis, Alexandros Potamianos

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments NAACL 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1611.02683 2018-02-23 cs.CL cs.LG cs.NE 84%

Unsupervised Pretraining for Sequence to Sequence Learning

Prajit Ramachandran, Peter J. Liu, Quoc V. Le

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Updated to accepted EMNLP 2017 version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17957 2026-08-19 cs.LG 新提交 84%

Understanding the Surprising Generalization Properties of Tabular Foundation Models

表格基础模型的出人意料的泛化特性研究

Nour Shaheen, Junwei Ma, Alex Labach, Frank Hutter, Valentin Thomas, Anthony L. Caterini

机构 * Polytechnique Montréal(蒙特利尔理工学院) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) Chandar Research Lab(钱达尔研究实验室) University of Toronto(多伦多大学) Layer 6 AI(第六层人工智能公司) Prior Labs(普里奥实验室) ELLIS Institute Tübingen(埃利斯研究所图宾根分部) University of Freiburg(弗赖堡大学) Cohere(科here公司)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究揭示仅在单个真实表格上预训练的TFMs有强迁移性,提出以任务为中心、基于检索的新视角,为TFMs的模型与语料库设计提供了新框架。

Comments This work extends our previous work, Generalization Can Emerge in Tabular Foundation Models From a Single Table (arXiv:2511.09665)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29129 2026-08-03 cs.LG 新提交 84%

PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining

PluRel-to-RDB-PFN:模式引导的合成关系预训练

Mohammad Sadeq Abolhasani, Viswanath Ganapathy

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract,comments);分类 cs.LG

AI总结 该研究将合成关系数据库生成器PluRel作为RDB-PFN的外部预训练数据源,通过三种课程策略对比,发现模式优先引导策略仅用少量数据即可恢复RDB-PFN近94%的性能,证实早期接触真实模式的有效性。

Comments Proceedings of the 2nd ICML on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16899 2026-06-16 cs.LG 新提交 84%

Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

奇妙预训练优化器及其发现之处 II:超球优化

Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.LG

AI总结 针对Muon等优化器在大模型预训练中增益随规模增大而减弱的问题,提出Hyperball包装器,固定权重矩阵及其更新的Frobenius范数,在1.2B参数模型上实现20-30%的token等效加速,并改善学习率迁移。

Comments Corresponding blog post: https://psychedelic-sunstone-851.notion.site/Fantastic-Pretraining-Optimizers-and-Where-to-Find-Them-2-1-Hyperball-Optimization-2e924306e6f280e7a5ffee00eb40a0dd

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07303 2025-04-29 cs.CL 84%

Filipino Benchmarks for Measuring Sexist and Homophobic Bias in Multilingual Language Models from Southeast Asia

Lance Calvin Lim Gamboa, Mark Lee

机构 * School of Computer Science, University of Birmingham(英国伯明翰大学计算机科学学院) Department of Information Systems and Computer Science, Ateneo de Manila University(马尼拉亚托大学信息系统与计算机科学系)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments Accepted for presentation at The First Workshop on Language Models for Low-Resource Languages (LoResLM) at The 31st International Conference on Computational Linguistics (COLING 2025)

Journal ref https://aclanthology.org/2025.loreslm-1.9/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04688 2023-09-21 cs.CV cs.AI 84%

Interaction-Aware Prompting for Zero-Shot Spatio-Temporal Action Detection

Wei-Jhe Huang, Jheng-Hsien Yeh, Min-Hung Chen, Gueter Josmy Faure, Shang-Hong Lai

专题命中 预训练与数据 :prompting(title,abstract);language model(abstract);分类 cs.AI;foundation model(comments)

Comments Accepted by ICCV Workshop 2023 (What is Next in Multimodal Foundation Models?)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00208 2026-07-02 cs.CL cs.AI cs.LG 新提交 83%

SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing

SLIM-RL: 无需轨迹切分的扩散LLM风险预算随机掩码强化学习

Ruikang Zhao, Zhenting Wang, Han Gao, Ligong Han

机构 * Technical University of Denmark(丹麦技术大学) MBZUAI Institute of Foundation Models(穆罕默德·本·扎耶德人工智能大学基础模型研究所) Iowa State University(爱荷华州立大学) Red Hat AI Innovation(红帽人工智能创新实验室) MIT–IBM Watson AI Lab(麻省理工学院-IBM沃森人工智能实验室)

专题命中 预训练与数据 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SLIM-RL方法,通过τ预算解码器控制每步提交风险,结合无迹随机掩码目标和自适应方差缩减技术,在不重构训练轨迹的情况下匹配或超越现有轨迹感知方法,在数学和代码任务上取得显著提升。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03283 2026-06-30 eess.AS cs.SD 83%

SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification

SpeakerCard-1M:面向野外说话人确认的基于证据的说话人卡片语料库

Junyi Peng, Oldřich Plchot, Xiao Song, Dading Chong, Lichun Fan, Hang Su, Themos Stafylakis, Junjie Li, Kong Aik Lee, Shuai Wang, Jian Luan, Jan Černocký

机构 * Brno University of Technology, Czechia(布拉格技术大学,捷克) Peking University, China(北京大学,中国) Xiaomi, China(小米,中国) Athens University of Economics and Business, Greece(雅典经济与商业大学,希腊) The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港) Nanjing University, China(南京大学,中国)

专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出SpeakerCard-1M双语说话人资源,通过声学探针和受限LLM生成结构化说话人卡片,并定义跨模态协议以支持基于证据的说话人确认。

Comments Corpus and protocols at https://junyipeng00.github.io/SpeakerCard-1M-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27379 2026-06-29 cs.CL cs.AI cs.LG 新提交 83%

Position: The Term "Machine Unlearning" Is Overused in LLMs

立场:术语“机器遗忘”在大型语言模型中被过度使用

Sangyeon Yoon, Yeachan Jun, Albert No

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文主张机器遗忘应限于数据集定义的删除,而许多标为“遗忘”的任务(如拒绝有害请求、实体/知识移除)实为不同目标,需不同术语和基线,并指出术语混淆导致指标误用。

Comments 13 pages; ICML 2026 Position Paper Track. Sangyeon Yoon and Yeachan Jun contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21292 2026-06-23 cs.CV 新提交 83%

Lightweight 3D Feature Pretraining by Bayesian Inversion of 2D Foundation Models

轻量级3D特征预训练:基于2D基础模型的贝叶斯反演

Marwane Hariat, Gianni Franchi, David Filliat, Antoine Manzanera

机构 * U2IS, ENSTA – Institut Polytechnique de Paris, Palaiseau, France(U2IS,ENSTA – 巴黎综合理工学院,法国帕莱索) Pôle Recherche, Agence Ministérielle pour l’IA de Défense, Palaiseau, France(研究部,国防人工智能部级机构,法国帕莱索)

专题命中 预训练与数据 :foundation model(title);pretraining(title)

AI总结 提出Casper3D,一种轻量级概率框架,通过贝叶斯反演将多视图2D基础模型嵌入转换为潜在3D语义表示,实现开放词汇3D理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22088 2026-06-11 cs.LG cs.AI cs.CL 版本更新 83%

Unifying Learning Dynamics and Generalization in Transformers Scaling Law

统一Transformer缩放定律中的学习动力学与泛化

Chiwun Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过将Transformer学习动力学形式化为ODE系统并近似为核行为,严格分析了随机梯度下降训练下的泛化误差,揭示了计算资源缩放时泛化误差的指数衰减与幂律衰减的两阶段相变,并建立了紧的上下界。

Comments 87 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22403 2026-05-22 cs.CV 83%

Translating Signals to Languages for sEMG-Based Activity Recognition

将信号转换为语言以实现基于sEMG的活动识别

Ming Wang, Haoxuan Qu, Qiuhong Ke, Wei Zhou, Hossein Rahmani, Jun Liu

机构 * Lancaster University(兰卡斯特大学) Monash University(墨尔本大学) Cardiff University(卡迪夫大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出了一种基于大语言模型的sEMG活动识别框架,通过将连续sEMG信号转换为语言形式,提升活动识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18091 2026-05-12 cs.LG cs.AI cs.CL 83%

Data Mixing Can Induce Phase Transitions in Knowledge Acquisition

数据混合可在知识获取中引发相变

Xinran Gu, Kaifeng Lyu, Jiazheng Li, Jingzhao Zhang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海启智研究院) Simons Institute for the Theory of Computing, UC Berkeley(伯克利理论计算研究所)

专题命中 预训练与数据 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在数据混合训练中LLM的知识获取行为,发现混合比例和模型规模会影响知识获取的相变现象,揭示了容量分配机制与信息理论框架下的预测关系。

Comments NeurIPS'25 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25203 2026-04-29 cs.CL cs.AI cs.LG 83%

BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate

BARRED: 通过不对称辩论合成定制策略的守卫规则

Arnon Mazza, Elad Levi

机构 * Plurai Inc.(Plurai公司)

专题命中 预训练与数据 :LLM(abstract_cn);language model(abstract);small language model(abstract);prompting(abstract)

AI总结 BARRED通过不对称辩论生成合成训练数据,提升定制策略的安全性与效率,实验表明其优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04804 2026-04-21 cs.CL cs.AI cs.IR cs.LG cs.MA 83%

SkillX: Automatically Constructing Skill Knowledge Bases for Agents

SkillX: 为智能体自动构建技能知识库

Chenxi Wang, Zhuoyun Yu, Xin Xie, Wuguannan Yao, Runnan Fang, Shuofei Qiao, Kexin Cao, Guozhou Zheng, Xiang Qi, Peng Zhang, Shumin Deng

机构 * Zhejiang University(浙江大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SkillX通过多级技能设计、迭代技能精炼和探索性技能扩展,构建可复用的技能知识库,提升智能体在长周期任务中的表现和泛化能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03535 2026-04-21 cs.SE 83%

Across Programming Language Silos: A Study on Cross-Lingual Retrieval-augmented Code Generation

跨越编程语言壁垒:关于跨语言检索增强型代码生成的研讨

Qiming Zhu, Jialun Cao, Xuanang Chen, Weili Zhang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Shing-Chi Cheung

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了跨语言检索增强型代码生成中的知识转移,通过构建13种编程语言的14000个实例数据集,发现跨语言知识转移非 trivial,且依赖语言亲和力和预训练语料多样性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21686 2026-04-21 cs.CL cs.AI cs.LG 83%

Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework

矩阵:基于点对点的多智能体合成数据生成框架

Dong Wang, Yang Li, Ansong Ni, Ching-Feng Yeh, Youssef Emad, Xinjie Lei, Liam Robbins, Karthik Padthe, Hu Xu, Xian Li, Asli Celikyilmaz, Ramya Raghavendra, Lifei Huang, Carole-Jean Wu, Shang-Wen Li

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Matrix框架,通过去中心化设计实现多智能体协同生成高质量、多样化的合成数据,提升数据生成效率2-15倍,适用于多智能体对话、网络推理数据提取等场景。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14142 2026-04-16 cs.LG cs.AI cs.CL 83%

From $P(y|x)$ to $P(y)$: Investigating Reinforcement Learning in Pre-train Space

从P(y|x)到P(y):在预训练空间中研究强化学习

Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Tencent AI Lab(腾讯AI实验室)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PreRL和DSRL方法,通过优化预训练空间中的边际分布P(y),提升LLM推理能力,并通过NSR机制增强推理效果,实验表明DSRL在推理任务中表现优异。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/Pretrain_Space_RLVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13103 2026-04-16 cs.SE cs.MA 83%

Fairness in Multi-Agent Systems for Software Engineering: An SDLC-Oriented Rapid Review

多代理系统在软件工程中的公平性:面向软件开发生命周期的快速综述

Corey Yang-Smith, Ronnie de Souza Santos, Ahmad Abdellatif

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文综述了多代理系统在软件工程中的公平性研究,分析了LLM赋能环境下的公平性框架,指出当前研究在评估实践、泛化能力及缓解机制方面存在三大不足。

Comments 8 pages, 4 figures. Accepted to the LLMTrust workshop at FSE Companion 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08706 2026-03-10 cs.AI cs.CL cs.LG 83%

Agentic Critical Training

代理批判训练

Weize Liu, Minghui Liu, Sy-Tuyen Ho, Souradip Chakraborty, Xiyao Wang, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院公园分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 代理批判训练(ACT)是一种强化学习方法,通过奖励模型判断替代行为的正确性,使模型自主发展对行为质量的推理,从而提升代理性能和泛化能力。

Comments Project page: https://attention-is-all-i-need.github.io/ACT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13654 2026-03-03 cs.SE cs.CR 83%

SOSecure: Safer Code Generation with RAG and StackOverflow Discussions

SOSecure: 借助检索增强生成与StackOverflow讨论实现更安全的代码生成

Manisha Mukherjee, Vincent J. Hellendoorn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 SOSecure通过检索增强生成与StackOverflow讨论提升代码安全性,实现71.7%-96.7%的修复率,优于其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16278 2026-01-26 cs.CL cs.AI cs.LG 83%

Better as Generators Than Classifiers: Leveraging LLMs and Synthetic Data for Low-Resource Multilingual Classification

优于分类器:利用大语言模型和合成数据进行低资源多语言分类

Branislav Pecher, Jan Cegin, Robert Belanec, Ivan Srba, Jakub Simko, Maria Bielikova

机构 * Kempelen Institute of Intelligent Technologies(克姆佩尔智能技术研究所) Faculty of Information Technology, Brno University of Technology(信息科技学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本研究利用大语言模型生成合成数据,训练更小的多语言模型,发现生成器在低资源语言中表现更优。

Comments Accepted to the Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11330 2025-10-14 cs.SD cs.AI cs.CL cs.LG eess.AS 83%

Diffusion-Link: Diffusion Probabilistic Model for Bridging the Audio-Text Modality Gap

KiHyun Nam, Jongmin Choi, Hyeongkeun Lee, Jungwoo Heo, Joon Son Chung

机构 * Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) University of Seoul, South Korea(首尔大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 5 pages. Submitted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03323 2025-10-03 cs.CL cs.AI cs.LG 83%

Out-of-Distribution Detection using Synthetic Data Generation

Momin Abbas, Muneeza Azmat, Raya Horesh, Mikhail Yurochkin

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

Comments Accepted to COLM 2025. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21611 2025-10-01 cs.CL cs.AI cs.LG 83%

When Does Multimodality Lead to Better Time Series Forecasting?

Xiyuan Zhang, Boran Han, Haoyang Fang, Abdul Fatir Ansari, Shuai Zhang, Danielle C. Maddix, Cuixiong Hu, Andrew Gordon Wilson, Michael W. Mahoney, Hao Wang, Yan Liu, Huzefa Rangwala, George Karypis, Bernie Wang

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16531 2025-09-23 cs.CL cs.AI cs.FL cs.LG 83%

Bayesian scaling laws for in-context learning

Aryaman Arora, Dan Jurafsky, Christopher Potts, Noah D. Goodman

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);post-training(abstract);SFT(abstract)

Comments COLM 2025 camera-ready version; 9 pages main text, 39 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏