arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139914 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2311.06696 2026-01-05 cs.CL cs.LG 73%

Simple and Effective Input Reformulations for Translation

简单而有效的输入改写用于翻译

Brian Yu, Hansen Lillemark, Kurt Keutzer

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 本文通过简单输入改写方法提升翻译任务的性能,实验表明在佛洛斯200基准测试中性能提升达3.5 chrF++。

Comments 13 pages, 6 figures. To be published in Empirical Methods in Natural Language Processing (Main) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22293 2025-12-30 cs.LG cs.CL cs.CR 73%

Learning from Negative Examples: Why Warning-Framed Training Data Teaches What It Warns Against

从负例学习:为什么警告框架的训练数据教会了它所警告的内容

Tsogt-Ochir Enkhbayar

专题命中 预训练与数据 :language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现,警告框架的训练数据未能有效阻止模型学习警告行为,而是通过统计共现性主导了模型的学习过程。

Comments Submitted to Neel Nanda's MATS Stream

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00654 2025-12-30 cs.CV cs.CL cs.LG 73%

ICONS: Influence Consensus for Vision-Language Data Selection

ICONS: 视觉-语言数据选择中的影响共识

Xindi Wu, Mengzhou Xia, Rulin Shao, Zhiwei Deng, Pang Wei Koh, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) University of Washington(华盛顿大学) Google DeepMind(谷歌DeepMind) Allen Institute for AI(人工智能研究院)

专题命中 预训练与数据 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 ICONS通过影响共识方法高效选择视觉-语言数据,保持高性能并支持多任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21515 2025-12-29 cs.LG cs.CL 73%

Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training

感知度意识的数据扩展定律:感知度景观预测持续预训练的表现

Lei Liu, Hao Zhu, Yue Shen, Zhixuan Chu, Jian Wang, Jinjie Gu, Kui Ren

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出感知度意识的数据扩展定律,通过感知度景观预测持续预训练的表现,有效提升数据利用效率和训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20204 2025-12-24 cs.CL cs.AI 73%

Corpus of Cross-lingual Dialogues with Minutes and Detection of Misunderstandings

多语言对话语料库及误解检测

Marko Čechovič, Natália Komorníková, Dominik Macháček, Ondřej Bojar

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理学院) Institute of Formal and Applied Linguistics (ÚFAL)(形式与应用语言学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多语言对话语料库及自动检测误解的方法,通过手动标注和模型测试,验证了Gemini模型在识别误解方面的性能。

Comments 12 pages, 2 figures, 6 tables, published as a conference paper in Text, Speech, and Dialogue 28th International Conference, TSD 2025, Erlangen, Germany, August 25-28, 2025, Proceedings, Part II. This version published here on arXiv.org is before review comments and seedings of the TSD conference staff

Journal ref Text, Speech, and Dialogue 28th International Conference, TSD 2025, Erlangen, Germany, August 25-28, 2025, Proceedings, Part II: Corpus of Cross-Lingual Dialogues with Minutes and Detection of Misunderstandings (pp 301-312)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07414 2025-12-22 cs.AI cs.CL cs.GT 73%

Language Self-Play For Data-Free Training

数据自由训练的语言自博弈

Jakub Grudzien Kuba, Mengting Gu, Qi Ma, Yuandong Tian, Vijai Mohan, Jason Chen

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语言自博弈方法,通过模型与自身博弈实现数据自由训练,提升指令遵循、数学和编码任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12167 2025-12-16 cs.CL cs.AI 73%

Extending the Context of Pretrained LLMs by Dropping Their Positional Embeddings

通过删除预训练语言模型的位置嵌入来扩展上下文

Yoav Gelberg, Koshi Eguchi, Takuya Akiba, Edoardo Cetin

机构 * Sakana AI University of Oxford(牛津大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 通过删除预训练语言模型的位置嵌入,实现无需长上下文微调的零样本上下文扩展,提升语言模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13867 2025-12-03 cs.AI cs.LG 73%

Generative Fuzzy System for Sequence Generation

生成模糊系统用于序列生成

Hailong Yang, Zhaohong Deng, Wei Zhang, Zhuangzhuang Zhao, Guanjin Wang, Kup-sze Choi

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种结合数据与知识驱动机制的生成模糊系统框架GenFS,用于提升序列生成任务的准确性和流畅性。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18934 2025-11-25 cs.CL cs.AI cs.DB 73%

Skeletons Matter: Dynamic Data Augmentation for Text-to-Query

骨架很重要:面向文本到查询的动态数据增强

Yuchen Ji, Bo Xu, Jie Shi, Jiaqing Liang, Deqing Yang, Yu Mao, Hai Chen, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Ant Group(蚂蚁集团) Shanghai Key Laboratory of Data Science(上海数据科学 key laboratory)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种动态数据增强框架,通过识别查询骨架作为共同优化目标,提升文本到查询任务的泛化能力和效率。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17161 2025-11-24 cs.CL cs.AI 73%

The PLLuM Instruction Corpus

PLLuM指令语料库

Piotr Pęzik, Filip Żarnecki, Konrad Kaczyński, Anna Cichosz, Zuzanna Deckert, Monika Garnys, Izabela Grabarczyk, Wojciech Janowski, Sylwia Karasińska, Aleksandra Kujawiak, Piotr Misztela, Maria Szymańska, Karolina Walkusz, Igor Siek, Maciej Chrabąszcz, Anna Kołos, Agnieszka Karlińska, Karolina Seweryn, Aleksandra Krasnodębska, Paula Betscher, Zofia Cieślińska, Katarzyna Kowol, Artur Wilczek, Maciej Trzciński, Katarzyna Dziewulska, Roman Roszko, Tomasz Bernaś, Jurgita Vaičenonienė, Danuta Roszko, Paweł Levchuk, Paweł Kowalski, Irena Prawdzic-Jankowska, Marek Kozłowski, Sławomir Dadas, Rafał Poświata, Alina Wróblewska, Katarzyna Krasnowska-Kieraś, Maciej Ogrodniczuk, Michał Rudolf, Piotr Rybak, Karolina Saputa, Joanna Wołoszyn, Marcin Oleksy, Bartłomiej Koptyra, Teddy Ferdinan, Stanisław Woźniak, Maciej Piasecki, Paweł Walkowiak, Konrad Wojtasik, Arkadiusz Janz, Przemysław Kazienko, Julia Moska, Jan Kocoń

机构 * University of Lodz(卢兹大学) NASK National Research Institute(国家研究 institute) Institute of Slavic Studies PAS(波兰科学院斯拉夫研究所) National Information Processing Institute(国家信息处理研究所) Institute of Computer Science PAS(波兰科学院计算机科学研究所) Wroclaw Tech(沃拉日县技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 PLLuM项目构建了首个指令语料库,用于微调大语言模型,分析人工与合成指令数据对语言适应的影响,并发布首个代表性子集供其他模型开发参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10819 2025-11-21 cs.AI cs.LG 73%

PoE-World: Compositional World Modeling with Products of Programmatic Experts

PoE-World: 通过程序专家的乘积进行组合世界建模

Wasu Top Piriyakulkij, Yichao Liang, Hao Tang, Adrian Weller, Marta Kryven, Kevin Ellis

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Dalhousie University(达尔豪斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 PoE-World通过程序专家的乘积有效建模复杂非网格世界领域,利用LLMs学习世界模型并实现高效泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14334 2025-11-20 cs.AI cs.LG 73%

When Words Change the Model: Sensitivity of LLMs for Constraint Programming Modelling

Alessio Pellegrino, Jacopo Mauro

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14806 2025-11-20 q-bio.GN cs.AI cs.LG 73%

MergeDNA: Context-aware Genome Modeling with Dynamic Tokenization through Token Merging

Siyuan Li, Kai Yu, Anna Wang, Zicheng Liu, Chang Yu, Jingbo Zhou, Qirong Yang, Yucheng Guo, Xiaoming Zhang, Stan Z. Li

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

Comments AAAI 2026 (Oral Presentation) Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14761 2025-11-19 cs.CV cs.AI cs.LG 73%

ARC Is a Vision Problem!

Keya Hu, Ali Cy, Linlu Qiu, Xiaoman Delores Ding, Runqian Wang, Yeyin Eva Zhu, Jacob Andreas, Kaiming He

机构 * MIT(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Technical Report. Project webpage: https://github.com/lillian039/VARC

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09287 2025-11-18 cs.AI cs.CY cs.LG 73%

From Model Training to Model Raising

Roland Aydin, Christian Cyron, Steve Bachelor, Ashton Anderson, Robert West

机构 * Hamburg University of Technology(汉堡理工大学) Helmholtz-Zentrum Hereon(海德堡研究中心) University of Toronto(多伦多大学) EPFL(苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication in Communications of the ACM (CACM), Opinion section

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07637 2025-11-12 cs.LG cs.AI cs.CR 73%

Private-RAG: Answering Multiple Queries with LLMs while Keeping Your Data Private

Ruihan Wu, Erchi Wang, Zhiyuan Zhang, Yu-Xiang Wang

机构 * Computer Science and Engineering University of California, San Diego(计算机科学与工程大学加州大学圣地亚哥分校) Halıcıoğlu Data Science Institute University of California, San Diego(Halıcıoğlu数据科学研究所加州大学圣地亚哥分校) Department of Computer Science University of California, Los Angeles(计算机科学系加州大学洛杉矶分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07080 2025-11-11 cs.CL cs.AI 73%

Wasm: A Pipeline for Constructing Structured Arabic Interleaved Multimodal Corpora

Khalil Hennara, Ahmad Bastati, Muhammad Hreden, Mohamed Motasim Hamed, Zeina Aldallal, Sara Chrouf, Safwan AlModhayan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06232 2025-11-11 cs.LG cs.AI 73%

Scaling Laws and In-Context Learning: A Unified Theoretical Framework

Sushant Mehta, Ishan Gupta

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Journal ref Workshop on Principles of Generative Modeling (PriGM) @ EurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07879 2025-11-07 cs.CL cs.LG 73%

Datasets, Documents, and Repetitions: The Practicalities of Unequal Data Quality

Alex Fang, Hadi Pouransari, Matt Jordan, Alexander Toshev, Vaishaal Shankar, Ludwig Schmidt, Tom Gunter

机构 * Apple(苹果公司) Stanford(斯坦福大学) UT Austin(德克萨斯大学奥斯汀分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23239 2025-11-05 cs.IR cs.CL cs.LG 73%

Beyond Contrastive Learning: Synthetic Data Enables List-wise Training with Multiple Levels of Relevance

Reza Esfandiarpoor, George Zerveas, Ruochen Zhang, Macton Mgonzo, Carsten Eickhoff, Stephen H. Bach

机构 * Brown University(布朗大学) Microsoft(微软) University of Tübingen(图宾根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Findings of the EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10707 2025-11-04 cs.LG cs.AI 73%

ConTextTab: A Semantics-Aware Tabular In-Context Learner

Marco Spinaci, Marek Polewczyk, Maximilian Schambach, Sam Thelin

机构 * SAP France(SAP法国分公司) SAP SE(SAP德国分公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted as spotlight at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01258 2025-11-04 cs.CL cs.AI 73%

Measuring Algorithmic Partisanship via Zero-Shot Classification and Its Implications on Political Discourse

Nathan Junzi Chen

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03869 2025-11-04 cs.LG cs.AI 73%

Outlier Gradient Analysis: Efficiently Identifying Detrimental Training Samples for Deep Learning Models

Anshuman Chhabra, Bo Li, Jian Chen, Prasant Mohapatra, Hongfu Liu

机构 * University of South Florida, Tampa, FL, USA(佛罗里达州立大学) Brandeis University, Waltham, MA, USA(布兰迪大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted to ICML 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26847 2025-11-03 cs.CR cs.AI cs.CL cs.IT math.IT 73%

Broken-Token: Filtering Obfuscated Prompts by Counting Characters-Per-Token

Shaked Zychlinski, Yuval Kainan

机构 * JFrog

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13397 2025-10-29 cs.CL cs.AI 73%

Retrieval-Augmented Generation-based Relation Extraction

Sefika Efeoglu, Adrian Paschke

机构 * Electrical Engineering and Computer Science Department, Technische Universitaet Berlin(技术大学柏林电子工程与计算机科学系) Department of Computer Science, Freie Universitaet Berlin(柏林自由大学计算机科学系) Data Analytic Center (DANA), Fraunhofer Institute FOKUS(弗劳恩霍夫研究所FOKUS数据分析中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments published at the Semantic Web journal. The last version is available: https://doi.org/10.1177/22104968251385519

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22261 2025-10-28 cs.LG cs.AI 73%

Epistemic Deep Learning: Enabling Machine Learning Models to Know When They Do Not Know

Shireen Kudukkil Manchingal

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15807 2025-10-28 cs.CL cs.IR cs.LG 73%

The Atlas of In-Context Learning: How Attention Heads Shape In-Context Retrieval Augmentation

Patrick Kahardipraja, Reduan Achtibat, Thomas Wiegand, Wojciech Samek, Sebastian Lapuschkin

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22594 2025-10-28 cs.AI cs.LG 73%

A Framework for Quantifying How Pre-Training and Context Benefit In-Context Learning

Bingqing Song, Jiaxiang Li, Rong Wang, Songtao Lu, Mingyi Hong

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15857 2025-10-28 cs.LG cs.AI cs.CV cs.RO 73%

Diffusion Beats Autoregressive in Data-Constrained Settings

Mihir Prabhudesai, Mengning Wu, Amir Zadeh, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Lambda

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Project Webpage: https://diffusion-scaling.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21322 2025-10-27 cs.LG cs.CL 73%

Leverage Unlearning to Sanitize LLMs

Antoine Boutet, Lucas Magnana

机构 * INSA Lyon, Inria, CITI, UR3720(里昂国立应用科学学院、法国国家科学研究中心、CITI、UR3720) Inria, INSA Lyon, CITI, UR3720(法国国家科学研究中心、里昂国立应用科学学院、CITI、UR3720)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏